AI 日报 · 2026-08-14
今日最核心的主线是基础模型与多模态生成同步加速:DeepSeek 正式发布 DeepSeek-V4-Pro-0813,以 1.7T 参数和 DSpark 投机解码在 HLE、Terminal Bench、DeepSWE 等智能体与生产基准上逼近最强闭源模型,并支持三档 reasoning_effor…
今日最核心的主线是基础模型与多模态生成同步加速:DeepSeek 正式发布 DeepSeek-V4-Pro-0813,以 1.7T 参数和 DSpark 投机解码在 HLE、Terminal Bench、DeepSWE 等智能体与生产基准上逼近最强闭源模型,并支持三档 reasoning_effort;Google 则推出 Gemini 3.7 Flash,编程与知识工作基准大幅跃升、价格约为前代一半,并立即接入 Gemini Spark。MiniMax 发布 Music 3,可生成长达 5 分钟的结构化歌曲;OpenAI 预告 Ultrafast 服务层,由 Cerebras 支持将 GPT-5.6 Sol 推理速度最高提升 14 倍。产品侧,Google Sheets 加入 Gemini 驱动的 canvas 交互可视化,NVIDIA GeForce NOW 为 Linux、Chromebook 等设备强化云游戏,Hugging Face 展示机器人数据从采集到部署的闭环,LangChain 则押注托管式智能体。工具层面,Simon Willison 发布 sqlite-utils 4.2.1 修复崩溃,并用 llm-gemini 0.33 快速支持新 Gemini 模型。
北美一手(LLMs 官方 & 关联账号)
OpenAI
⭐⭐ [产品更新] Previewing Ultrafast mode: GPT-5.6 Sol at up to 14X the speed
OpenAI News · 2026-08-13 · 原文 ↗
OpenAI 预览了新的 API 服务层 Ultrafast,可让 GPT-5.6 Sol 的推理速度最高提升 14 倍。该服务由 Cerebras 提供算力支持,宣称最高可达到每秒 750 个输出 token。目前消息为官方预览,正文未包含更多定价或可用范围信息。
打分理由
这是官方公布的 API 新服务层,速度提升最高 14 倍/750 tokens每秒,对开发者有实际影响,但仅为预览且信息有限,重要性适中。
⭐⭐⭐ [模型发布] Introducing Gemini 3.7 Flash
Google DeepMind Blog · 2026-08-13 · 原文 ↗
谷歌 DeepMind 发布 Gemini 3.7 Flash,距上一代 3.6 Flash 仅三周。新模型在编程、知识工作和 Web 开发等任务上明显提升,FrontierCode 1.1 Main 达到 43.6%(3.6 为 34.4%)、DeepSWE v1.1 达到 65.3%(49.0%),WebDev Arena Elo 从 1538 提升至 1588,GDP.pdf 和 AutomationBench 也大幅进步。价格方面,年底前输入每百万 tokens 0.75 美元、输出每百万 3.75 美元,约为 3.6 Flash 原价一半。Gemini Spark 即日起升级采用 3.7 Flash,面向 160 多个国家的 Google AI Pro/Ultra 订阅者。开发者体验在多步规划、指令遵循和工具调用方面也有改善。
打分理由
Gemini Flash 系列是开发者常用的非旗舰模型,本次在多项编码与智能体基准上提升显著且价格减半,影响较广,但仍属高频迭代而非旗舰发布,故评 3 分。
⭐⭐ [产品更新] Bring your spreadsheet data to life with Sheets canvas
Google AI (The Keyword) · 2026-08-13 · 原文 ↗
Google 官方宣布为 Google Sheets 推出新功能「Sheets canvas」,由 Gemini 驱动,可将电子表格中的行列数据转化为交互式可视化「mini-apps」。用户只需用自然语言描述需求,例如生成学习追踪器或座位表,无需编写代码。画布与原始表格实时双向同步,修改任一方都会自动更新。该功能以标签页形式存在于 Google Sheets 中,支持像普通表格一样分享与协作。
打分理由
Google Sheets 官方发布基于 Gemini 的可视化 canvas 功能,属于产品功能更新而非模型发布,对表格用户有一定实用价值,故给 2 分。
东亚一手(中国厂商官方 & 模型发布)
DeepSeek
⭐⭐⭐⭐⭐ [模型发布] deepseek-ai/DeepSeek-V4-Pro-0813
DeepSeek Models (HuggingFace) · 2026-08-13 · 原文 ↗
DeepSeek 在 HuggingFace 发布 DeepSeek-V4-Pro-0813 正式版,取代此前的预览版,并强调其在智能体能力与生产环境中的性能显著提升。该模型规模为 1.7T,基于 DeepSeek-V4-Pro(Preview)结构,并加入 DSpark 投机解码模块。在 HLE、Terminal Bench、DeepSWE、Toolathlon-Verified 等多项基准上,它相比预览版有大幅提升,并大致可与当前最强闭源模型竞争。模型支持低、高、最大三档 reasoning_effort 推理强度,并提供编码脚本以兼容 OpenAI 消息格式。官方同时给出 vLLM 与 SGLang 的运行配置,DSpark 可通过单个标志启用。
打分理由
DeepSeek 官方正式发布旗舰系列 V4-Pro 的正式版,基准成绩相对预览版有显著跃升,是一手厂商的重大模型更新。
MiniMax
⭐⭐⭐ [模型发布] MiniMaxAI/MiniMax-Music3
MiniMax Models (HuggingFace) · 2026-08-13 · 原文 ↗
MiniMax 发布 Music 3 音乐生成模型,可生成最长 5 分钟的结构化完整歌曲,支持通过歌词与详细音乐描述控制风格、人声和编曲发展。该模型采用分层自回归架构,8B Global LLM 负责长程音乐结构,0.6B Local LLM 负责帧级声学细节,并通过 Flow Matching 与 Flow-VAE 连续隐状态合成输出 32kHz 16-bit 立体声音频。它建议使用包含全局元数据、人声细节、编曲三部分的结构化描述以获得精细控制。模型已发布在 Hugging Face,并支持 SGLang-Omni 使用。
打分理由
MiniMax 发布垂类音乐生成模型,能生成最长 5 分钟完整歌曲且技术架构较新颖,但非旗舰文本模型,重要度中等。
衍生 & 周边(产品 / Agent / Tools / 观点)
产品更新
⭐⭐ [产品更新] Class Is in Session: GeForce NOW Levels Up Linux, Chromebooks and More
NVIDIA Blog · 2026-08-13 · 原文 ↗
英伟达 GeForce NOW 宣布针对返校季进行云游戏体验升级。GeForce NOW 原生 Linux 应用正式结束测试阶段。同时推出新的云端优化,让帧生成(Frame Generation)在串流时响应更快。此外 Performance 会员将获得更高的帧率表现。整体是围绕 Linux、Chromebook 等设备与会员体验的产品更新。
打分理由
这是 GeForce NOW 的常规产品更新,涉及 Linux 原生应用转正和帧生成优化,对相关用户有价值但非行业级事件。
⭐⭐ [产品更新] Record, train, and deploy from one place with Strands Agents, LeRobot, and Hugging Face Storage Buckets
Hugging Face Blog · 2026-08-13 · 原文 ↗
本文介绍了 AWS 开源 SDK Strands Robots 与 Hugging Face Storage Buckets 的结合,实现机器人数据从记录、训练到部署的单一闭环。数据全程保持 LeRobot 格式,可直接存入 HF Hub 的存储桶,并利用增量同步只上传变化字节,避免重复数据传输。训练时可直接从 Hub 流式读取数据集,按帧解码摄像头视频,无需本地下载。文章提供了可运行的 notebook 示例,并回顾了 Strands Robots 的机器人抽象与 AgentTools 组合能力。
打分理由
这是一篇 AWS 与 Hugging Face 集成的工程博文,提供了可运行 notebook 并展示机器人数据闭环实践,对机器人开发者有实用价值,但属常规产品/工具更新,非模型发布或重大行业事件。
⭐⭐ [产品更新] sqlite-utils 4.2.1
Simon Willison's Weblog · 2026-08-13 · 原文 ↗
Simon Willison 发布了 sqlite-utils 4.2.1,这是一个用于操作 SQLite 数据库的 Python CLI 工具和库。该版本修复了 4.2 中引入的一个崩溃 bug:代码里使用了 typing_extensions 的 Self,但 typing-extensions 并未被列为 sqlite-utils 的直接依赖,在通过 uvx sqlite-utils 直接运行时会导致缺失。作为修复的一部分,作者新增了一个 smoke test,用 uv run --isolated --no-default-groups sqlite-utils --help 来验证 CLI 在没有 dev 依赖的情况下仍可正常工作。
打分理由
sqlite-utils 的小版本 bugfix 修复了实际崩溃并给出了可复现的 smoke test,但对 AI 行业影响有限,属于常规工具补丁更新。
⭐⭐ [产品更新] llm-gemini 0.33
Simon Willison's Weblog · 2026-08-13 · 原文 ↗
Simon Willison 发布 llm-gemini 0.33 插件更新,用于在 LLM 工具中访问 Google Gemini 系列模型。本次更新加入对当日发布的 Gemini 3.7 Flash 以及 gemini-3.6-flash、gemini-3.5-flash-lite 和两个 gemini-embedding 嵌入模型的支持。插件同时升级兼容 LLM 0.32,用户可查看推理轨迹,并可通过如 `llm -m gemini-3.7-flash -T CodeExecution` 的方式启用服务端工具。作者还测试了让 Gemini 3.7 Flash 生成骑自行车鹈鹕图像,并提到不同浏览器对 SVG 滤镜的渲染差异。
打分理由
这是第三方 LLM 工具的常规版本更新,新增支持多个 Gemini 模型和 LLM 0.32 功能,信息量适中,值得一读。
观点
⭐⭐ [观点] Why managed agents are the next big thing in agent building
LangChain Blog · 2026-08-14 · 原文 ↗
LangChain CEO Harrison Chase 撰文认为托管式智能体(managed agents)将成为智能体构建的下一个方向。他回顾了智能体构建的几个阶段:从早期 AI 框架和应用,到 LangGraph、Google ADK、Vercel AI SDK 等更成熟的框架,再到当前大模型在循环中调用工具的智能体模式。过去一年出现两类关键经验:一是持久化执行、沙箱等运行智能体所需的基础设施原语,二是 AGENTS.md、MCP、skills 等驱动智能体的标准。这些趋势催生了托管式智能体体验,通过将智能体 harness 与基础设施捆绑,降低生产环境中运行时、用户体验、沙箱、上下文管理、评估、记忆和鉴权等复杂度。文章围绕上周发布的 Managed Deep Agents 产品展开观点性说明。
打分理由
这是一篇有论证的 LangChain CEO 行业观点,并提及 Managed Deep Agents 产品发布,但属于二手衍生内容且非重大行业发布,因此打 2 分。
每天 3–5 条 agent 生态一手信号,中英双语。不错过重要更新 → 订阅邮件
Loading...