AI 日报 · 2026-09-03
DeepMind 今天发布 Gemini 3.8 Flash 与面向网络防御的 Flash Cyber,并启动 Fairwind 计划,把漏洞发现与自动修复打包给政府和关键基础设施等可信防御者;这是六周内 Flash 系列的第三次更新,重点在智能体任务、软件工程和法律/金融等专业推理。NVIDIA …
DeepMind 今天发布 Gemini 3.8 Flash 与面向网络防御的 Flash Cyber,并启动 Fairwind 计划,把漏洞发现与自动修复打包给政府和关键基础设施等可信防御者;这是六周内 Flash 系列的第三次更新,重点在智能体任务、软件工程和法律/金融等专业推理。NVIDIA 宣布以约 129.303 亿美元收购 Hugging Face,成为当天另一条重大行业消息。围绕智能体与评测,Qwen 发布面向长期店铺经营的 E-Commerce Bench 和自动驾驶视觉语言模型 Qwen-Drive-1.0,Hugging Face 则有 NeoMME、GRPO 结构化输出微调、编码智能体记忆工具 funes 等内容。LangChain 与 Nevermined 展示让 agent 用受控信用卡自主购买服务,IBM 时间序列模型也上线 Confluent Cloud。Anthropic 的系统提示词更新显示 Claude 对歌词、书籍段落和版权角色的复现限制明显收紧。
北美一手(LLMs 官方 & 关联账号)
⭐⭐⭐⭐ [模型发布] Introducing Gemini 3.8 Flash and 3.8 Flash Cyber
Google DeepMind Blog · 2026-09-02 · 原文 ↗
Google DeepMind 发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber,这是六周内第三次 Flash 系列更新。3.8 Flash 定位为最智能的“工作马”模型,在软件工程、智能体任务和专业领域多步推理上较 3.7 Flash 显著提升,定价与 3.7 相同(每百万输入 token 0.75 美元、每百万输出 token 3.75 美元),并在 DeepSWE v1.1、Vals Finance Agent V2、Harvey 法律智能体基准上超越多数更大规模模型,HLE-Verified 得分 54.9%。3.8 Flash Cyber 面向网络安全场景,在漏洞检测与自动修复上具备前沿水平,目前通过 Fairwind 计划向受信任的防御者提供。两者共享同一基础智能,并借助长时智能体循环递归评估和优化模型;官方表示算力优先的应用可继续使用 3.7 Flash。
打分理由
这是 Flash 系列一次明显的版本跃升,并新增专门的网络安全模型变体,直接影响开发者与智能体、安全应用,但尚非旗舰级新模型,故定在 4 分。
⭐⭐ [产品更新] Proactive cyber defense for governments and enterprises
Google DeepMind Blog · 2026-09-02 · 原文 ↗
Google DeepMind 宣布启动 Fairwind 计划,一个面向政府、Google Cloud 客户及网络安全合作伙伴的有限访问项目,用于提供其先进的网络防御能力。该计划结合 Gemini 3.8 Flash Cyber 网络模型与 CodeMender 工具链,可自主发现并修复漏洞,将手动修复通常需要数周的工作缩短为几分钟内生成经验证、可部署的补丁。初期优先为政府与国家网络机构、关键基础设施运营商及核心科技平台提供访问权限。参与组织须遵守严格运营标准,包括仅限内部网络安全、事件响应或渗透测试团队访问,并部署多因素认证等保护措施。目前已有超过 650 家全球合作伙伴参与;此外,任何 Google Cloud 客户也可通过 Gemini Enterprise Agent Platform 结合公开模型使用 CodeMender。
打分理由
primary 信源的非模型内容,属于面向特定受信伙伴的网络安全防御专项计划,包含具体产品(Gemini 3.8 Flash Cyber 与 CodeMender)和明确准入方,有一定行业价值,但并非广泛影响开发者的重大事件,按上限规则定档为 2。
⭐⭐ [产品更新] Proactive cyber defense for governments and enterprises
Google AI (The Keyword) · 2026-09-02 · 原文 ↗
谷歌宣布启动 Fairwind 计划,面向政府和受信任合作伙伴提供其先进的网络防御 AI 能力。计划将 Gemini 3.8 Flash Cyber 与 CodeMender 工具链结合,让防御者在智能体规模上自主发现、验证并修复漏洞,数分钟内生成可部署的已验证补丁,而传统手动修复需要数周,运行成本也低于前沿大模型。首批将面向国家级网络安全机构、关键基础设施运营商和核心软件平台开放,并设定严格运营标准,如仅限内部安全、应急响应或渗透测试团队使用并启用多因素认证。谷歌称已有超过 650 家参与伙伴,所有 Google Cloud 客户也可通过 Gemini Enterprise Agent Platform 上的公开模型使用 CodeMender。
打分理由
面向政府与企业的受限网络防御产品发布,不是通用旗舰模型或面向开发者的重大变革;属于有价值但影响范围有限的产品更新,符合 primary 非模型内容的中间档。
东亚一手(中国厂商官方 & 模型发布)
通义千问(Qwen)
⭐⭐⭐ [研究] E-Commerce Bench: Long-Horizon Operations, Multi-Dimensional Evaluation
Qwen (通义千问) Blog · 2026-09-03 · 原文 ↗
Qwen 与淘宝天猫集团联合发布 E-Commerce Bench,用于评测模型作为商家在模拟市场中长期经营店铺的能力。智能体以 10 万元初始资金经营店铺,在 365 天模拟时间里进行类目调研、供应商议价、定价上架、促销、库存与现金流管理,并按利润、现金流管理、供应商谈判、防欺诈、运营效率、执行和跨周期学习等维度打分。环境包含 6,886 个商品、60 个类目、576 个供应商和 12 种店铺类型,数据来自淘宝天猫平台的去敏化真实数据,并设有市场事件和促销日历。设计上还加入了每日 600 分钟时间预算、工具调用耗时、三账户结算带来的资金延迟、仓储物流成本以及退货与信誉机制。该工作同时公开了论文和 GitHub 项目。
打分理由
一手厂商发布的新评测基准,环境设计贴近真实电商且细节充分,对长周期智能体评测有参考价值;但不涉及模型发布或重大产品更新,按一手非模型内容的上限给 3。
⭐⭐⭐ [模型发布] Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving
Qwen (通义千问) Blog · 2026-09-03 · 原文 ↗
Qwen 团队发布 Qwen-Drive-1.0,称其为首个面向自动驾驶的视觉语言基础模型。该模型基于原生的多模态 Qwen3.5-4B,不修改预训练 VLM 架构,而是外接 BEV 感知头与基于流匹配的 Planning Expert,将 3D 目标检测、语义占用预测、BEV 地图分割、驾驶场景视觉问答与轨迹规划统一到一个预训练 VLM 中。通过分段训练和数据配比,模型在保持通用视觉语言能力的同时显著提升驾驶能力,并支持跨多个公开驾驶数据集的联合训练。评测显示其驾驶问答平均值达 69.43,在通用 VLM 与驾驶/具身专用模型中均领先,同时通用能力未明显退化。
打分理由
这是主流大模型厂商在自动驾驶垂类发布的新基础模型,非旗舰产品线,但技术架构与评测数据完整且有领域开创性,按一手非主力模型标准给予 3 分。
衍生 & 周边(产品 / Agent / Tools / 观点)
模型发布
⭐⭐⭐ [模型发布] NeoMME: an efficient Multimodal-native and Multilingual Encoder
Hugging Face Blog · 2026-09-03 · 原文 ↗
NeoMME 是 Hcompany 推出的多语言多模态编码器系列,包含 260M 和 800M 两个参数规模。它不使用预训练视觉塔或因果语言模型,而是让单个双向 Transformer 直接处理文本 token 与图像 patch,并用带掩码的离散扩散目标从头训练。针对视觉文档检索,团队以 ColPali 的页面图像方法微调出 NeoMME-Retriever,一次前向即可生成稠密和 late-interaction 嵌入。在 ViDoRe v3 上两种尺寸均处于 nDCG@10 与模型规模的 Pareto 前沿;在 NVIDIA L40S 上,260M 模型每秒可编码约 51 页,约为 ModernVBERT 吞吐量的两倍。分层 token 池化与非对称量化把 late-interaction 索引存储从每页约 1.5 MB 降至约 6 kB(缩小约 255 倍),同时保留超过 95% 的基线 nDCG@10。模型已集成至 Hugging Face Transformers,checkpoint 以 Apache 2.0 协议开放。
打分理由
这是一篇开源多模态编码器发布,附带完整的架构说明、benchmark 数据与可复现的技术路径,在视觉文档检索上达到 Pareto 前沿并大幅压缩索引存储,对检索与 RAG 开发者有实际价值,但属 secondary 信源、非一线主流厂商旗舰模型,故定 3。
产品更新
⭐⭐ [产品更新] Give Your Coding Agents a Memory You Own
Hugging Face Blog · 2026-09-03 · 原文 ↗
Hugging Face 博客发布了一个名为 funes 的开源工具,旨在为编码智能体提供「记忆」。它的出发点是这样一种观察:智能体的会话痕迹其实记录了代码库探索、错误尝试与转向理由,但这些痕迹只停留在存档层面,无法在后续会话中被高效检索。funes 作为单一二进制工具,可本地运行,通过一条命令接入 Claude Code、Codex、pi 与 Hermes,并在每次会话结束后增量索引新回合。其索引流程统一解析各来源,将内容分块后使用本地模型做嵌入,查询时融合向量检索与 BM25,再经过交叉编码器重排与时效加权,返回带精确出处(所属智能体、时间戳、会话与回合)的原始文本。它默认完全本地工作,也可按需把记忆发布为私有的 Hugging Face 数据集,让记忆随机器迁移。
打分理由
这是一个面向开发者、可“安装即用”的智能体记忆工具,为编码智能体解决跨会话上下文丢失的问题,属于值得一读的常规产品发布,但尚未构成改变行业格局的重大事件。
⭐⭐ [产品更新] Real-Time Intelligence with IBM Time Series Models on Confluent
Hugging Face Blog · 2026-09-02 · 原文 ↗
IBM 与 Confluent 宣布,IBM 的时间序列基础模型已在 Confluent Cloud 上以 Early Access 形式上线(AWS 环境),并计划后续推向 Confluent Platform,覆盖本地与混合部署。这些模型可对流式数据执行预测、异常检测、优化与语义智能等任务,无需数据科学团队,业务分析师可直接使用。IBM 称这些模型此前已在其自身运营及水泥、钢铁、制浆造纸、食品和电信等行业设计伙伴处验证,并援引「精度每提升一个点价值数百万美元、生产力提升 5 到 10 倍」等说法。模型在 Confluent Cloud 中原生运行,可通过 Flink 调用,并内置治理能力;文中还提到模型背后有超过 4400 万次下载。
打分理由
二级信源,属于厂商产品集成通稿;虽发布了可在 Confluent Cloud 上使用的 Early Access 产物并给出具体能力与应用数据,但属常规产品更新,未达到改变行业格局的程度。
⭐⭐ [产品更新]
LangChain Blog · 2026-09-03 · 原文 ↗
LangChain 与支付服务商 Nevermined 的合作博文展示了让 agent 自主购买服务的方法:开发者可将一张带消费上限和适用范围限制的信用卡一次性授权给 agent,使其在任务中途自行购买 API 配额、网络搜索额度等,用完还能自动续费或发现并购买原本未接的外部数据服务,全程无需人工介入。服务商也可以让自己的 API 被 agent 自主购买,并用 LangSmith 追踪每笔支付,无需额外支付基础设施。文中引用行业数据说明背景:OpenAI/Anthropic 正从订阅制转向按用量计费;Gartner 预计 2030 年机器客户控制最高 30 万亿美元采购,McKinsey 预计 agent 介导商业规模 2030 年达 3-5 万亿美元;2026 年 7 月单笔 agent 支付平均约 0.31 美元。文章还指出按工作量定价正在取代按席位的定价,固定订阅制在重度使用下不可持续,例如 GitHub Copilot 每月 10 美元套餐在重度用户上约亏 20 美元每人每月。
打分理由
这是 LangChain 的集成型技术博文,提供了具体可操作的做法和数据,但属于厂商产品宣传而非重大发布,对 agent 自主支付趋势有参考价值,按 secondary 标准定档为 2。
⭐⭐ [产品更新] llm-gemini 0.34
Simon Willison's Weblog · 2026-09-02 · 原文 ↗
Simon Willison 发布了 llm-gemini 0.34,这是访问 Google Gemini 模型系列的 LLM 插件。新版本新增对 Gemini 3.8 Flash(gemini-3.8-flash)的支持,提供低、中、高三种思考级别,并修复了异步响应未记录解析模型版本的问题。同期 Google 发布了 Gemini 3.8 Flash,另有仅限可信防御者使用的 3.8 Flash Cyber。作者用该模型生成并对比了图片,还利用它给自己的 markdown-svg-renderer 工具增加 HTML 渲染支持;一次演示耗时 13 秒、成本 1.8 美分,并称 Flash 系列快速、便宜,且擅长 HTML/JavaScript 等任务。
打分理由
次级信源下的个人插件常规版本更新,顺带转述 Gemini 3.8 Flash 的发布;非旗舰模型且无重大行业影响,按标准定为值得一读。
⭐⭐ [产品更新] Claude's new system prompt really doesn't want to reproduce song lyrics
Simon Willison's Weblog · 2026-09-02 · 原文 ↗
Anthropic 更新了 Claude 消费级应用(Claude.ai 与移动应用)的系统提示词,并将提示词文档重组为索引页加各模型独立页面的形式;官网支持在任意页面后加 .md 获取 Markdown 版本,方便用户直接 diff 提示词差异。新版提示词(如 Fable 5.1)新增大量关于版权的限制:Claude 不得整体或部分复现歌词、诗歌、书籍段落,包括结尾句、副歌或逐音符写出的旋律,且一旦在对话中拒绝某请求,便会持续拒绝其改写或收窄版本,转而提供描述或分析。1929 年前首次发表的作品不受此限,但 Claude 依据自身对作品年代的认知判断,不确定时会拒绝。提示词还禁止生成受版权保护的角色和标识,包括用 SVG、CSS、canvas 等代码绘制的内容,并明确调整姿势、配色或场景不构成原创。作者认为新增歌词条款的时间点与索尼音乐版权公司和华纳查普尔起诉 Anthropic 使用歌词数据库训练的消息接近。
打分理由
二手信源对 Claude 消费应用系统提示词改动的拆解,涉及应对版权诉讼的行为限制,对开发者与普通用户有实际影响,但属产品行为调整而非模型发布,定档 2。
研究
⭐⭐ [研究] Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps
Hugging Face Blog · 2026-09-03 · 原文 ↗
这篇来自 Hugging Face 的教程给出了一份可公开复现的低成本微调方案:用 TRL 库对 LFM2.5-350M 进行 GRPO 强化学习微调,以提升结构化输出合规能力,全程约 500 个样本、100 个训练步,可在免费版 Colab 或 Kaggle GPU 上运行。作者用 llama.cpp 本地部署模型并在 IFStruct 基准上评测,结果显示基座模型通过率为 22.6%,微调后升至 29.7%。文中指出该流程并非 IFStruct 博客中 RL 模型的训练管线,目的只是展示小模型经过任务特定微调后能接近更大模型的表现。完整命令与评测步骤已公开在 GitHub。
打分理由
二手教程,面向小模型结构化输出优化,含可复现的数据与步骤,对实践者有参考价值,但属常规技术分享而非重大行业事件,故定 2 分。
⭐⭐ [研究] Training a coding model to paint watercolours with TRL and OpenEnv
Hugging Face Blog · 2026-09-03 · 原文 ↗
Surya Narreddi 此前发布了一段由语言模型用水彩技法作画的视频:模型通过 p5.brush 库编写 JavaScript 来生成图像,视频已获得超过 150 万次观看。Sergio Paniego 在 Hugging Face 博客上开源复现了这一思路,利用 TRL 和 OpenEnv 构建完整训练流水线,以 Qwen3.5-35B-A3B 为基座,用 LoRA 进行 GRPO 强化学习。文章公开了参考图池、RL 环境、基于 Inference Providers 的成对打分模型、训练脚本与训练后权重,并比较了三种奖励混合策略的训练效果。整个流程可以在 Hugging Face 上端到端运行,并通过一条命令行复现。
打分理由
该文是来自 Hugging Face 官方博客的二次信源,虽非重大模型发布,但提供了完整可复现的 RL 训练配方,公开了全部产物并对比三种奖励混合策略,对实操者有价值,属于值得一读的工程研究。
其他
⭐⭐⭐ [其他] NVIDIA to Acquire Hugging Face
NVIDIA Blog · 2026-09-03 · 原文 ↗
NVIDIA 宣布已达成收购 Hugging Face 的协议,交易金额为 129.303 亿美元。NVIDIA CEO 黄仁勋表示,双方将共同扩展 Hugging Face 的平台、强化其基础设施,并扩大全球开发者和机构获取 AI 的渠道。他还称赞 Hugging Face 团队过去十年构建的成果。
打分理由
百亿美元级别的重大并购,属于影响行业格局的资本事件,作为二级信源定档为 3。
每天 3–5 条 agent 生态一手信号,中英双语。不错过重要更新 → 订阅邮件
Loading...