AI 日报 · 2026-08-31

模型层更新密集:Google 发布多变量时序基础模型 TimesFM-3,DeepSeek 推出 V4 系列首个多模态实验模型,后者在 Agent 任务上提升明显。腾讯也一次释出 ContextPilot-14B、8B、E4B 三个 checkpoint,均围绕长程 Agent 的主动上下文管理。产…

模型层更新密集:Google 发布多变量时序基础模型 TimesFM-3,DeepSeek 推出 V4 系列首个多模态实验模型,后者在 Agent 任务上提升明显。腾讯也一次释出 ContextPilot-14B、8B、E4B 三个 checkpoint,均围绕长程 Agent 的主动上下文管理。产品侧,Simon Willison 拆解 ChatGPT Work,认为其本质是降低门槛的 Codex 重包装,真正区别在于联网执行、无头浏览器、持久化文件系统与 Sites 发布等能力;OpenAI 则披露 ChatGPT Ads 年化收入运行率达 10 亿美元。

北美一手(LLMs 官方 & 关联账号)

OpenAI

⭐⭐ [产品更新] A milestone in expanding access to AI

OpenAI News · 2026-08-31 · 原文 ↗
OpenAI 宣布其广告产品 ChatGPT Ads 的年化收入运行率已达到 10 亿美元。该产品正在向全球扩展。OpenAI 表示,广告收入将通过免费和可负担的选项,支持更多人使用 AI。
打分理由
OpenAI 官方宣布广告业务年化收入达 10 亿美元并全球扩展,是有具体数字的商业里程碑,但并非模型发布且细节有限,故评为 2。

Google

⭐⭐⭐ [模型发布] TimesFM-3: A zero-shot foundation model for multivariate forecasting

Google Research Blog · 2026-08-31 · 原文 ↗
Google Research 发布 TimesFM-3,一款面向多变量时间序列预测的零样本基础模型,参数规模 3.3 亿,在超过 1 万亿时间点的真实与合成语料上预训练。相比此前版本仅支持单变量预测,TimesFM-3 原生支持多目标联合预测、历史协变量以及过去-未来(动态)协变量,可在零样本条件下捕捉跨序列依赖。模型采用 decoder-only transformer 架构,将数据按 32 步长分块,并通过交替的因果时间注意力与全变量注意力建模时序与跨序列关系,支持单次前向传播的非自回归解码。官方称其在多个主要基准上显著优于其他预测模型,相关代码与权重已通过 GitHub 和 HuggingFace 提供。
打分理由
非旗舰但重要的垂类模型发布:TimesFM 系列从单变量跃升至多变量零样本预测,来自一手厂商渠道并含具体技术细节与基准成绩,行业影响明显。

东亚一手(中国厂商官方 & 模型发布)

DeepSeek

⭐⭐⭐ [模型发布] deepseek-ai/DeepSeek-V4-Flash-Vision-Exp

DeepSeek Models (HuggingFace) · 2026-08-31 · 原文 ↗
DeepSeek 发布 DeepSeek-V4-Flash-Vision-Exp,这是 DeepSeek-V4 系列的首个实验性多模态模型,在 V4-Flash 架构上引入视觉模块并经过继续训练以解锁视觉理解能力。相比 DeepSeek-V4-Flash-0731,它在多模态 Agent 能力上提升明显(例如 ApexBench Pass@1 从 26.2 升至 36.5,Agents' Last Exam 从 25.2 升至 27.3),在纯文本 Agent 任务上保持相近水平(如 Terminal Bench 83.9 vs 82.7、DSBench-Hard 63.6 vs 59.6)。模型采用 MIT 许可,仓库提供分词器、提示编码参考与最小 PyTorch 推理实现,覆盖视觉编码器、DFlash 注意力、MoE、Hyper-Connections 等组件。
打分理由
DeepSeek 官方发布 V4 系列首个多模态实验模型,带完整 benchmark 与 MIT 开源推理实现,对开发者有直接可用价值,但属于非旗舰的衍生线发布,行业影响低于主力旗舰模型。

腾讯(混元)

⭐⭐ [模型发布] tencent/ContextPilot-14B

Tencent Hunyuan Models (HuggingFace) · 2026-08-30 · 原文 ↗
腾讯发布了 ContextPilot-14B,这是基于 Qwen3-14B 的模型检查点,用于长时程语言模型代理的主动上下文管理。该框架通过细粒度强化学习教导代理规划、维护长期记忆,并在推理和使用工具时卸载低价值上下文。ContextPilot 包含扩展的上下文管理工具集、上下文感知的部分展开和细粒度信用分配三个组件。在长上下文问答和深度搜索任务上,它相比现有基线取得了更强的性能,同时保持更紧凑的工作上下文。模型权重与代码已开源,但加载权重本身不包含上下文管理工具,需配合官方仓库使用。
打分理由
这是腾讯发布的研究型非主力模型,基于 Qwen3-14B 提供可复现的权重和框架,但方向垂直且需配合仓库使用,对行业影响有限。

⭐⭐ [模型发布] tencent/ContextPilot-E4B

Tencent Hunyuan Models (HuggingFace) · 2026-08-30 · 原文 ↗
腾讯发布 ContextPilot-E4B,这是基于 Google Gemma4-E4B-it 的 8B 文本生成模型 checkpoint,属于 ContextPilot 框架——一个用于长程语言模型智能体主动上下文管理的研究项目。该框架让智能体在推理和调用工具时自行规划、维护长期记忆,并卸载不重要的上下文。ContextPilot 结合了扩展的上下文管理工具集(规划、结构化记忆、检索、软上下文卸载)、上下文感知的部分 rollout 以及细粒度 credit assignment 三部分。官方称在长上下文问答和深度搜索任务上,ContextPilot 以更紧凑的工作上下文取得优于现有基线的表现。模型卡同时提供了论文(EMNLP 2026)和 GitHub 代码仓库。
打分理由
腾讯发布的非主力研究型模型,基于开源 Gemma4-E4B 微调,面向智能体上下文管理,附论文与代码;非旗舰模型且属研究探索,行业影响有限,按 primary 非主力模型标准给 2。

⭐⭐ [模型发布] tencent/ContextPilot-8B

Tencent Hunyuan Models (HuggingFace) · 2026-08-30 · 原文 ↗
腾讯混元在 HuggingFace 发布了 ContextPilot-8B,这是基于 Qwen3-8B 的模型版本,实现了 ContextPilot 框架,用于长程语言模型智能体的主动上下文管理。该框架通过细粒度强化学习,训练智能体在持续推理和工具调用的同时进行规划、维护长期记忆并卸载低价值上下文。ContextPilot 整合了三部分:扩展的上下文管理工具集(规划、结构化记忆、检索与软上下文卸载)、上下文感知的部分展开,以及基于下游分支结果训练中间快照的细粒度信用分配。在长上下文问答与深度搜索任务上,模型以更紧凑的工作上下文取得了更强的表现。HuggingFace 提供权重加载代码,但完整运行需配合官方仓库中的工具定义、智能体运行环境与评估流程。
打分理由
腾讯混元发布的是基于 Qwen3-8B 的研究型衍生模型,非旗舰主线发布,技术有一定新颖性但行业影响面有限;按一手信源从严标准定为 2。

衍生 & 周边(产品 / Agent / Tools / 观点)

观点

⭐⭐⭐ [观点] Understanding ChatGPT Work

Simon Willison's Weblog · 2026-08-30 · 原文 ↗
Simon Willison 对 OpenAI 的 ChatGPT Work 进行了深入拆解,指出它实际上是两个产品:云端版(Work Cloud,可通过网页或移动应用访问)和桌面应用中的本地版(Work Local,可访问本机文件并运行程序,类似重新包装、降低对非程序员门槛的 Codex)。Work 目前仅向每月 20 美元及以上订阅者开放,并提供了比 Chat 更多的功能,包括在 GPT-5.6 Sol/Luna/Terra 之间选择模型及不同推理档位、带联网能力的代码执行环境、无头 Chrome 浏览器、持久化文件系统、发布 ChatGPT Sites、运行子代理会话等。作者认为 OpenAI 官方关于何时使用 Chat 与 Work 的说明几乎无用,真正的区别在于 Work 拥有这些 Chat 不具备的能力。他还提到 Work 会话可能计入 Codex 配额,而 Chat 会话有独立配额。
打分理由
这是对 OpenAI 重要新产品 ChatGPT Work 的高信息量第三方深度分析,给出了模型选择、联网代码执行、持久化文件系统等具体可操作细节,对开发者有明确参考价值,但并非一手发布,故低于 4。

📬
每天 3–5 条 agent 生态一手信号,中英双语。不错过重要更新 → 订阅邮件
Loading...