AI 日报 · 2026-08-01

DeepSeek V4-Flash-0731 成为今日焦点,这个 304B 模型经由纯后训练大幅提升代理能力,在终端基准等评测中逼近甚至超越更大参数的前沿模型,且以极低价格开放 API 和权重,引发了「开放权重追赶闭源」的新一波讨论。Simon Willison 等开发者因无状态 MCP 重新投入工…

DeepSeek V4-Flash-0731 成为今日焦点,这个 304B 模型经由纯后训练大幅提升代理能力,在终端基准等评测中逼近甚至超越更大参数的前沿模型,且以极低价格开放 API 和权重,引发了「开放权重追赶闭源」的新一波讨论。Simon Willison 等开发者因无状态 MCP 重新投入工具链简化,推出了 mcp-explorer 等实用组件。此外,OpenAI 在数学与理论计算机科学方向公开多项突破,LangChain 发布面向代码审查智能体的 ReviewBench 基准,Willison 还上线了轻量级评估框架 smevals。

北美一手(LLMs 官方 & 关联账号)

OpenAI

⭐⭐ [研究] Ten advances in mathematics and theoretical computer science

OpenAI News · 2026-08-01 · 原文 ↗
OpenAI 公开了其在数学与理论计算机科学多个长期开放问题上的最新研究成果,涵盖几何、密码学与复杂性理论等方向,展示了在基础科学领域的探索与突破。
打分理由
属于非模型的基础研究进展,对 AI 行业的直接影响有限,但展示了 OpenAI 在理论科学方面的探索。

衍生 & 周边(产品 / Agent / Tools / 观点)

模型发布

⭐⭐⭐ [模型发布] deepseek-ai/DeepSeek-V4-Flash-0731

Simon Willison's Weblog · 2026-07-31 · 原文 ↗
Simon Willison 介绍了 DeepSeek 发布的 V4-Flash-0731 模型,参数规模 304B,主打「大幅增强的智能体能力」。该模型在 Hugging Face 上体积为 167GB,但据 Artificial Analysis 评测,其表现已超越 428B 的 MiniMax M3,且定价极具竞争力(输入 $0.14/百万 token,输出 $0.27/百万 token),可能成为当前智能与成本之比最优的模型。作者在 OpenRouter 上测试了该模型生成骑自行车的鹈鹕图像,使用默认推理级别效果不佳,而将推理努力调至「高」后得到了显著改善的结果。
打分理由
该模型以极低的价格提供了接近顶级智能体的能力,很可能成为性价比标杆,对应用开发有广泛影响。

⭐⭐⭐ [模型发布] [AINews] not much happened today

Latent Space (swyx) · 2026-08-01 · 原文 ↗
本文概述了 DeepSeek V4-Flash 0731 更新,这是一个纯后训练的模型升级,虽未改变架构或参数量,但代理能力显著提升。在 Terminal-Bench 等基准上大幅跃升,已接近 GPT-5.6 的性能前沿,同时通过 98% 缓存命中折扣使成本更低。API 和开放权重同日发布,社区迅速跟进量化与部署,认为这体现了工具使用与长程任务的训练优化,而非规模化预训练的胜利。
打分理由
虽为后训练更新,但性能跃升显著,重新使 DeepSeek 挤入前沿竞争,对开发者有切实参考价值,但未改变行业格局。

产品更新

⭐⭐ [产品更新] smevals - a small eval suite for evaluating models, prompts, and harnesses

Simon Willison's Weblog · 2026-07-31 · 原文 ↗
Simon Willison 与 Jesse Vincent 的 Prime Radiant 实验室合作推出 smevals,一个用于在不同模型配置下运行评估并对结果评分的小型框架。用户定义包含 YAML 任务目录的 eval,通过 uvx smevals run 对指定模型运行,再使用 grade 命令分离评分,最后可通过本地 Web 服务或静态 HTML 查看报告。项目明确定义了 eval、task、config、run、grader 等词汇,并支持自定义检查器。这是 Willison 在评估方法上的第三次迭代,他表示对该工具感到满意,并计划后续应用于自己的项目。
打分理由
面向开发者的评估框架工具,功能实用但非行业重大突破,作为知名博客的个人项目发布,值得开发者留意。

⭐⭐ [产品更新] datasette-agent 0.4a0

Simon Willison's Weblog · 2026-07-31 · 原文 ↗
Datasette 工具「datasette-agent」发布 0.4a0 版本,新增 `await context.browser_task()` 机制。该功能允许代理工具直接在用户浏览器中执行代码,使得 Datasette Agent 插件能够更方便地提供在浏览器端运行自定义 JavaScript 的能力。这是一个 alpha 版本的小幅功能增强。
打分理由
这是一个针对特定开发者工具的小版本 alpha 更新,新增的浏览器内执行功能有一定实用性,但整体影响范围有限。

研究

⭐⭐ [研究] Evaluating code review agents with ReviewBench

LangChain Blog · 2026-07-31 · 原文 ↗
LangChain 团队构建了一个面向代码审查 Agent 的评估基准 ReviewBench,基准源自 LangSmith 代码库中真实评审发现的缺陷,经人工筛选和 LLM 过滤后提炼为可复现的 Harbor 任务。目前 ReviewBench 包含 59 个任务、64 个基线问题,要求 Agent 不仅检查改动行,还需推断跨文件的系统约束(如租户检查、API 行为回归)。评分采用覆盖率与精确度指标,由 LLM-as-judge 对比 Agent 提交的发现与人工整理的问题集。
打分理由
这是一项面向代码审查的有数据支撑的研究性基准,但规模较小、目前仅基于内部代码库,仍处于早期阶段,尚未成为行业通用标准。

观点

⭐⭐ [观点] Stateless MCP has recaptured my interest (and inspired mcp-explorer and datasette-mcp)

Simon Willison's Weblog · 2026-07-31 · 原文 ↗
Simon Willison 对 MCP 2.0(无状态 MCP)重新产生兴趣,指出新规范通过单次 HTTP 请求即可调用工具,大幅简化了客户端和服务端实现,且无需维护会话状态,更适合可扩展的 Web 应用。他基于此构建了 CLI 工具 mcp-explorer,用于交互式探查 MCP 服务器。文章还简述了 legacy MCP 到 stateless MCP 的调用对比。
打分理由
Simon Willison 的个人博客,分享对 MCP 2.0 无状态改进的见解和自己构建的实用工具,对 MCP 开发者有参考价值,但影响范围有限。

⭐⭐ [观点] Oxide and Friends: The Open Weight Revolution with Simon Willison

Simon Willison's Weblog · 2026-07-31 · 原文 ↗
Simon Willison 参加了 Oxide and Friends 播客,讨论开放权重模型的崛起。话题包括 Kimi K3 证明开放模型能与闭源前沿模型抗衡、近期意外网络安全攻击、以及多位 AI 领袖签署的关于开放权重与美国 AI 领导力的公开信。Willison 提到节目录制后很快过时,若晚几天还会涵盖 DeepSeek V4 Flash 0731 和 Anthropic 的安全事件,现场还展开了 Golden Gate Claude、Zizians 等离题讨论,并回顾了年初预测,新增了关于教皇会就开放模型发声的年度预测。
打分理由
知名技术博主围绕开放权重模型最新事件的即兴对话,提供了有价值的行业视角和预测,但属播客回顾,非一手信息。

📬
每天 3–5 条 agent 生态一手信号,中英双语。不错过重要更新 → 订阅邮件
Loading...