AI 日报 · 2026-09-09

OpenAI 声称其未发布内部模型解决了纳维-斯托克斯存在性与光滑性这一千禧年难题,并由 GPT-6 Astra 用 17 小时完成 Lean 形式化验证;但该成果随即陷入优先权争议,外部数学家指控 OpenAI 在得知其接近突破后抢先完成。腾讯混元同日开源 AuK 语音生成与编辑模型及 AuK-F…

OpenAI 声称其未发布内部模型解决了纳维-斯托克斯存在性与光滑性这一千禧年难题,并由 GPT-6 Astra 用 17 小时完成 Lean 形式化验证;但该成果随即陷入优先权争议,外部数学家指控 OpenAI 在得知其接近突破后抢先完成。腾讯混元同日开源 AuK 语音生成与编辑模型及 AuK-Flash 蒸馏版,以统一自然语言指令覆盖 TTS、语音编辑、增强与分离等任务;OpenAI 还发布了 ChatGPT Images 2.5,强化多轮指令跟随与参考图主体保留。研究方面,Hugging Face 讨论安全拒答应精确到主题内有害子集而非整题拒答,LangChain 则为多智能体新增 isolated 与 fork 上下文模式。

东亚一手(中国厂商官方 & 模型发布)

腾讯(混元)

⭐⭐⭐ [模型发布] tencent/AuK-Flash

Tencent Hunyuan Models (HuggingFace) · 2026-09-08 · 原文 ↗
腾讯混元在 Hugging Face 发布 AuK-Flash,这是其 1.5B 语音生成与编辑基础模型 AuK 的蒸馏版,支持 4 步快速推理。AuK 在数百万小时音频数据上训练,通过统一自然语言指令接口覆盖零样本与指令式 TTS、内容与歌词编辑、音高/语速/音量编辑、情绪/音色/口音编辑、语音增强与语音分离等任务。仓库同时提供 AuK 基座版与 AuK-Flash 权重,以 MIT 协议开源,并支持在 Hugging Face 与 ModelScope 下载使用。相关示例还说明需搭配 Qwen2.5-Omni-3B 作为 MLLM 编码器。
打分理由
腾讯在语音方向的一次重要开源发布,MIT 协议提供覆盖多类语音生成与编辑任务的 1.5B 基础模型及其 4 步蒸馏版,影响面较广;但非旗舰大模型发布,页面也未提供 benchmark 或性能对比,故按非主力模型定档。

⭐⭐⭐ [模型发布] tencent/AuK

Tencent Hunyuan Models (HuggingFace) · 2026-09-08 · 原文 ↗
腾讯混元开源了语音生成与编辑基础模型 AuK,参数量为 1.5B,基于数百万小时多样化音频训练。它通过统一自然语言指令接口,支持零样本与指令型 TTS、内容编辑、声学编辑、副语言编辑、语音增强和音源分离等任务。模型提供 AuK(基础版)与 AuK-Flash(4 步蒸馏推理版)两个变体,权重已在 Hugging Face 和 ModelScope 开放下载,并配有包含指令模板与 CLI/Python 示例的 Cookbook。
打分理由
虽是腾讯的非旗舰模型发布,但 AuK 以统一指令接口覆盖 TTS、编辑、增强与分离等多种任务且权重全面开源,对语音应用开发者有实际价值,值得 3 分。

衍生 & 周边(产品 / Agent / Tools / 观点)

模型发布

⭐⭐ [模型发布] Introducing ChatGPT Images 2.5

Simon Willison's Weblog · 2026-09-08 · 原文 ↗
OpenAI 发布了 ChatGPT Images 2.5,官方称其图像生成模型已累计生成超过 30 亿张图片。新版在多轮指令跟随上表现更好、响应更快,并能更好地保留参考图片中的主体。API 新增两个模型 ID:gpt-image-2.5-sunburst 和 gpt-image-2.5-flare,Simon Willison 认为 Sunburst 更适合精细编辑,Flare 更适合快速日常生成。他还更新了自己的 openai_image.py 命令行工具,使其支持传入参考图片,并给出了将一只浣熊科学家添加到原图中的示例。
打分理由
这是对 OpenAI 图像模型非主力更新的一手消息转述,虽然包含新模型 ID 和具体用法,但属衍生内容且影响面有限,因此按日更门槛记为 2。

产品更新

⭐⭐ [产品更新] Organizing Context in a Multi-Agent Harness

LangChain Blog · 2026-09-08 · 原文 ↗
本文讨论了多智能体编排框架中 supervisor 与 subagent 之间的上下文组织问题。多数框架让 subagent 以全新上下文启动,从而实现上下文隔离,但隔离模式下 subagent 可能重复执行 supervisor 已完成的上下文收集操作,造成浪费。LangChain 在 deepagents 最新版本中引入了 context modes,支持 isolated 与 fork 两种模式;forked subagents 会继承 supervisor 的完整对话状态,并借助 prompt caching 降低开销,适合作为 worker 继续推进已有工作,而 isolated 模式更适合需要独立判断的 verifier。文章还给出了选择上下文模式的建议。
打分理由
这是 LangChain 官方对 deepagents 新增 forked subagents 上下文模式的工程说明,给出了具体配置与适用场景,但属于常规开发者工具更新,不构成行业格局级事件。

研究

⭐⭐⭐⭐ [研究] On the Navier–Stokes Millennium Prize Problem

Simon Willison's Weblog · 2026-09-08 · 原文 ↗
OpenAI 表示,其未发布的内部模型解决了纳维-斯托克斯存在性与光滑性问题——七个千禧年大奖问题之一;智能体在 9 月 5 日得出结果,GPT-6 Astra 又用 17 小时完成 Lean 形式化验证。整个尝试覆盖多个千禧年问题,共发送 490 万条消息、约 3000 亿输出 token,其中纳维-斯托克斯任务占 270 万条消息、约 1300 亿 token。OpenAI 称自己是 9 月 1 日听到传闻后才启动,并称没有通过任何途径查看 Tristan Buckmaster 与 Levent Alpöge 的工作,但表示无法排除其产品使用产生的去标识化数据对结果有影响。NYU 教授 Tristan Buckmaster 与就职于 Anthropic 的数学家 Levent Alpöge 声称他们合作近一年、8 月 15 日已有突破,并质疑 OpenAI 得知其进度后抢先完成;OpenAI 表示不会邀请 Alpöge 共同署名,因其雇主是竞争对手。Simon Willison 的博客转述了 OpenAI 的说明和这一争议。
打分理由
AI 被指解决千禧年大奖问题并伴随剽窃争议,是改变行业格局级别的重大事件,但信源为二手博客,故按 secondary 封顶给 4 分。

⭐⭐ [研究] Safety for Whom? Refusing the Right Subset of a Topic, Not the Whole Topic

Hugging Face Blog · 2026-09-08 · 原文 ↗
本文介绍了一篇论文「Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal」。作者指出,主流安全对齐工作把危害视为主题属性,例如 LlamaGuard-3 这类护栏模型编码了主题级分类,XSTest 和 OR-Bench 等基准则探测由此引发的对安全提示的过度拒答。但在实际部署中,同一主题内不同场景需要不同的边界:例如公民教育助手与公共部门助手共享一个模型,却可能需要在政治话题上表现相反,主题级护栏无法表达这种区分。论文将问题形式化为「主题宇宙」中包含一个目标有害子集,理想行为是在该子集内拒答、在其余良性部分继续回答,而训练出的模型只会学到近似的平滑拒答边界,可能外溢到良性区域。文章还分析了自生成安全调优管线在该设定下的缺陷,正文在描述第一个缺陷「覆盖缺口」处中断。
打分理由
这是一篇有论证、问题设定清晰的安全对齐研究博文,提出「按部署策略拒绝主题子集而非整个主题」的思路,对关注安全与对齐的读者有参考价值;但正文在展示具体方法细节与结果前中断,且属衍生信源,未达更高档位。

📬
每天 3–5 条 agent 生态一手信号,中英双语。不错过重要更新 → 订阅邮件
Loading...