AI 日报 · 2026-09-16

Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,主打无需中断对话的实时语音推理,其中 Extended Thinking 在多项语音质量评测中领先,并已通过 Gemini API、Workspace、Gem…

Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,主打无需中断对话的实时语音推理,其中 Extended Thinking 在多项语音质量评测中领先,并已通过 Gemini API、Workspace、Gemini app 与 Search 开放。Google 同日还以科学和语言为主题展示布局:AlphaGenome Atlas 绘制全部遗传变异,WeatherNext 3 提升降水预报,Gemini 系列把实时翻译和转写扩展到更多语码混用场景。OpenAI 则在 ChatGPT Ads 测试 Sponsored Agents,并推出 Ads Manager 插件与 HubSpot、Shopify 集成,把 AI 助手直接推进广告投放和电商转化链路。Mistral 与 Mozilla 合作让 Firefox Smart Window 获得重视隐私的本地语言模型支持;研究方面,Google 的 Retrieve-for-Train 试图用离线强化学习和扩散检索器绕开查询扇出的推理瓶颈,IBM 与 Hugging Face 则提醒智能体单次成功不等于可重复成功。

北美一手(LLMs 官方 & 关联账号)

OpenAI

⭐⭐ [产品更新] Reimagining advertising with AI

OpenAI News · 2026-09-16 · 原文 ↗
OpenAI 为 ChatGPT Ads 推出新的 AI 广告体验:正在测试「Sponsored Agents」,用户点击广告后可与企业赞助的 agent 开启明确标注的对话,该对话独立于 ChatGPT 自身的回答和用户原有会话,目前在美国与部分广告主测试。面向广告主,ChatGPT 内新增 Ads Manager 插件,可用自然语言提示创建、更新和分析广告活动;Ads Manager 也加入 AI 辅助,根据落地页和活动目标提供文案与图片建议,广告主可审阅和编辑后再决定是否采用。此外推出可选的 AI 文本定制功能,能根据对话语境调整既有标题与描述,并自动将广告文案翻译为用户偏好的语言。OpenAI 还将 ChatGPT Ads 接入其首个 CRM 合作伙伴 HubSpot 和首个电商合作伙伴 Shopify:HubSpot 用户可连接 ChatGPT Ads 账户并创建广告、跟踪表现、跟进线索,美国 Shopify 商家可通过 Shopify App Store 中的 ChatGPT Ads 应用创建和管理广告活动。
打分理由
属一手厂商的非模型产品更新,涉及新的广告产品形态与首批 CRM/电商集成,但未涉及模型能力变化,按上限 3 的标准定档为 2。

Google

⭐⭐⭐ [模型发布] Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking

Google DeepMind Blog · 2026-09-15 · 原文 ↗
Google DeepMind 发布两款实时对话模型 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,官方称其为目前最先进的实时对话模型,在智能水平和并行推理上有较大升级,可在对话不中断的情况下处理复杂推理、实时视觉上下文与后台任务。Gemini 3.8 Live 面向规模化与成本效率,结合对话智能、流畅对话与视觉定位;Gemini 3.8 Live Extended Thinking 面向高复杂度任务,具备更强的智能与多步推理能力。性能方面,3.8 Live Extended Thinking 在 Artificial Analysis 的 Speech to Speech Quality Index 上以 82.6 分位居第一,在 τ-Voice 上得 68.6%,在 Sierra 的 τ-Voice-banking 上得 35.1%,在 Big Bench Audio 上得 97.7%;3.8 Live 在 Speech Agent Arena 排名第二。两款模型可通过 Gemini API、Google Workspace、Gemini app 和 Search 使用。
打分理由
这是 Google 实时语音对话模型线的发布,属于非主力旗舰系列的垂类模型,附有多项基准成绩,但并非主线旗舰模型更新,故未进最高档。

⭐⭐ [产品更新] Building AI to accelerate science and improve lives

Google AI (The Keyword) · 2026-09-15 · 原文 ↗
Google 高级副总裁 James Manyika 撰文介绍 Google 用 AI 推动科学发现与民生改善的整体布局,并称 Google 技术现已支持 300 多种语言、覆盖 70 亿人,占全球人口 86%。文章列举近期进展:用 AlphaGenome Atlas 绘制人类基因组中全部 90 亿个单字母遗传变异并开放给研究者;推出全球天气模型 WeatherNext 3,称一天以上的降水预报准确率提升 50%,已用于自家产品;把全球健康、粮食安全与社会经济数据整合为 Planetary Prediction Engine,用于刚果(金)埃博拉疫情和美国 21 项 CDC 健康指标的脆弱社区识别;并扩大 AI 研究以减少航空业气候影响,已在英国(与政府合作)和亚洲落地。此外,文章提到获诺贝尔奖的 AlphaFold 已预测科学界已知的全部 2 亿个蛋白质结构,被 190 个国家的 400 万研究者使用,AlphaMissense 用于预测致病基因突变,Google 还发布了 AI & Economy ATLAS 的互动洞察。
打分理由
一手厂商的进展综述与宣传博文,涵盖多个已开放或已落地的模型与工具(AlphaGenome Atlas、WeatherNext 3、Planetary Prediction Engine),但属汇总性宣传内容,非单一重大模型发布。

⭐⭐ [产品更新] AI for everyone in every language

Google AI (The Keyword) · 2026-09-15 · 原文 ↗
Google 表示其技术和产品目前支撑 300 多种语言的日常交互,覆盖全球 70 多亿人、约占 86% 的人口;Google Translate 自 2006 年推出以来已从少数语言扩展到今天的 250 多种。文章称 Google 正从单纯文本翻译转向原生音频智能,训练 Gemini 等模型直接处理音频,以捕捉语调、节奏、情感和语境,并理解 Spanglish、Hinglish 这类语码混用。其中 Gemini 3.5 Live Translate 支持 70 种语言、2000 多个语言对之间的实时口语翻译,Gemini 3.5 Transcribe 被描述为 Google 目前最精准的语音转文字模型,并驱动 Android Gboard 的 Rambler 功能。1,000 Languages Initiative 的目标是支持全球使用人数最多的 1000 种语言,其 Universal Speech Model 使用 1200 万小时音频训练,并借助跨语言迁移学习改善低资源语言的语音理解。
打分理由
Google 官方的语言 AI 宣传博文,含 300 多种语言、1200 万小时音频等具体数字及 Gemini 3.5 Live Translate、Transcribe 等已发布产品信息,但并非新旗舰模型发布,按 primary 非模型内容上限给 2。

⭐⭐ [研究] Bypassing inference bottlenecks: Accelerating complex AI search with Retrieve-for-Train

Google Research Blog · 2026-09-15 · 原文 ↗
现代搜索与推荐应用越来越需要返回一组连贯的结果,而不是单一最佳匹配。例如搜索「camping gear」时,用户想要的是帐篷、睡袋、便携炉和头灯这类互补组合,而非十顶略有差异的四人帐篷。为覆盖用户潜在兴趣,系统采用查询扇出(query fan-out)技术,把宽泛提示拆成多个相关子查询,但让 LLM 动态完成数据库感知的查询分解会消耗大量思考预算:零样本 LLM 本质上是通用自回归文本预测器,并未针对目标语料的特定几何流形优化,因此需要延长测试时计算才能返回在多样性、覆盖度、互补性、连贯性等集合级属性上最优、且对固定数据库有依据的结果。Google Research 在 ICML 2026 论文「Efficient, Property-Aligned Fan-Out Retrieval via RL-Compiled Diffusion」中提出奖励到数据编译框架 Retrieve-for-Train:用离线强化学习发现与奖励对齐的扇出并编译为监督信号,再把这些优化后的探索行为蒸馏进轻量扩散检索器,从而在推理时以单次前向完成高效的查询扇出,无需测试时思考 token。文中还指出依赖通用模型做数据库感知查询分解的两个问题:一是释义坍缩,零样本 LLM 容易生成冗余、近义的查询,例如对「Bohemian festival style」只给出「bohemian festival fashion」和「bohemian festival clothes」,遗漏流苏夹克、钩编连衣裙、麂皮靴等不同语义方向;二是自回归延迟瓶颈,模型通常需要生成数百个中间思维链(CoT)token 来规划扩展,再输出实际搜索词。
打分理由
这是 Google Research 的一手研究博文,提出并介绍了已发表于 ICML 2026 的 Retrieve-for-Train / RL 编译扩散检索方法,属于有论证的研究成果;但它不是模型发布,按一手渠道非模型内容的上限(3)并从紧打分,影响面集中在检索与推荐方向,定为 2。

衍生 & 周边(产品 / Agent / Tools / 观点)

模型发布

⭐⭐ [模型发布] Gemini Live audio

Simon Willison's Weblog · 2026-09-15 · 原文 ↗
Google 发布了 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两个新的语音到语音(speech-to-speech)模型,形态与 OpenAI 的 GPT-Live 系列类似。Simon Willison 借助文档让 GPT-6 Astra Extra High 为他构建了一个用于试用这两个模型的网页 UI:可选择模型与语音预设、输入可选的系统提示词,然后在浏览器中开始语音对话,并能在模型说话时打断它。该实现不使用任何库,连接的是 wss://generativelanguage.googleapis.com/ws/google.ai.generativelanguage.v1alpha.GenerativeService.BidiGenerateContent WebSocket 端点,并用 Web Audio API 的 AudioContext 同时完成音频采集与播放。他同时给出了该 WebSockets API 的 Gemini Live 入门教程链接。
打分理由
二级信源的报道,内容是 Google 非旗舰的语音到语音模型发布,附带一个可试用的网页演示,影响范围有限。

产品更新

⭐⭐ [产品更新] Mistral and Mozilla are bringing open, private and multilingual AI to your web browser

Mistral News (Alan Turing 兜底) · 2026-09-16 · 原文 ↗
Mistral 与 Mozilla 宣布合作,Mozilla 的 AI 浏览助手 Firefox Smart Window(beta)现由 Mistral 模型驱动。Smart Window 用于帮助用户理解复杂搜索、记住此前点击离开的内容,以及基于浏览器标签页查找重要信息。Mistral 将为法国和北美的 Smart Window 用户提供支持,英国和德国预计于今年晚些时候跟进。双方称该合作强调隐私与控制:默认情况下对话不会保存在 Mozilla 服务器上,包括 Mistral 在内的合作伙伴同意零数据保留。Mistral 还表示其模型针对地区语言、方言与文化语境进行微调,并把此次合作视为从企业客户延伸到全球消费者的一步。
打分理由
Mistral 与 Mozilla 的战略合作并把 Mistral 模型接入 Firefox Smart Window,有明确参与方与落地产品,但属非模型内容的衍生信源合作动态,故给 2。

研究

⭐⭐ [研究] Your Agent Aced the Task. Will It Do It Again?

Hugging Face Blog · 2026-09-15 · 原文 ↗
IBM Research 团队在 Hugging Face 博客发文指出,智能体在单次评测中的平均成功率会掩盖其可重复性问题:在 AppWorld 上,使用 GPT-4.1 的 ReAct 智能体 Mean@5 为 77.4%,但五次重复全部成功的任务仅占 53.0%,即 Pass^5 为 53.0%,两者相差 24.4 个百分点,困难任务上这一差距可达 30 个点。作者称多数 benchmark 只报告 Mean@k,而 Pass^k 才是「同一问题再问一次是否仍能成功」的指标。为此他们提出 Consistency Analyzer:只需一条已记录的轨迹、无需 ground truth,对轨迹中每个决策点做一次请求 k 个补全的重采样(默认 k=5),以定位容易翻转的决策点,而非端到端重跑任务。在其此前的 ALTK-Evolve 之上新增「一致性准则」后,差距从 24.4pp 降至 12.0pp(同任务 Pass⁵ 提升 16.0pp,相似任务提升 13.0pp),平均准确率没有损失;完整方法与评测见 arXiv 技术报告。
打分理由
衍生博客转述的研究内容,但给出了具体数据(24.4pp 一致性差距、降至 12.0pp)与无需 ground truth 的可复现诊断做法,属有数据有论证的研究,按 secondary 标准给 2 分。

⭐⭐ [研究] Can Skills Learned in Games Transfer to Real-World Work?

Latent Space (swyx) · 2026-09-15 · 原文 ↗
Good Start Labs 将游戏作为 AI 模型的训练材料,该公司去年十月从媒体与工具公司 Every 拆分出来,获得 General Catalyst、Inovia、Every 及天使投资人共 360 万美元融资。这一构想源自 2025 年一场前沿模型玩《外交》(Diplomacy)的 Twitch 直播,创始人 Alex Duffy 注意到 OpenAI 的 o3 靠策划背叛赢下所有对局,而 Claude Opus 4 因拒绝说谎而落败。该公司最近让一个 30B 模型在《1830:铁路与强盗大亨》游戏中训练,再测试其在金融研究任务上的表现。结果显示,单轮问答与「多轮终端智能体」(用工具探索环境、规划策略并实时调整)两种训练设计都提升了各自的游戏内目标,但只有终端智能体设计提升了 Finance-Agent 基准上的成绩。Duffy 认为,游戏呈现给 AI 的方式会决定它学到哪些技能、以及这些技能能否迁移到游戏之外的工作。
打分理由
属于二手信源,但包含具体实验设计与 benchmark 数据,展示了游戏训练设计的差异能否迁移到金融任务;不过只是小规模实验而非改变格局的发布,故评为 2。

其他

⭐⭐ [其他] Emerald AI, Google and NVIDIA Launch Alliance to Advance Flexible AI Data Centers

NVIDIA Blog · 2026-09-16 · 原文 ↗
Emerald AI、Google 和 NVIDIA 宣布联合成立 AI Energy Management Alliance(AEMA)。原文称这是首个此类联盟,旨在推动数据中心动态管理其电力使用。原文还表示,AI 工厂是智能时代的基础设施,负责任地扩展既取决于电网层面的创新,也取决于数据中心内部的创新。
打分理由
二级信源,内容为涉及 Google 与 NVIDIA 的多方产业联盟成立公告;因暂无具体金额或规模细节,按产业联盟在 2-3 档内取下限 2。

📬
每天 3–5 条 agent 生态一手信号,中英双语。不错过重要更新 → 订阅邮件
Loading...