AI 日报 · 2026-08-28

国产旗舰模型这轮密集更新:智谱发布 GLM-5.3,强调所有提升来自后训练,并在代码与漏洞利用基准上达到开源 SOTA;腾讯发布 770B MoE 模型 Hy4 preview,以 1M 上下文和工程场景优化回应,内部盲评略胜 GLM 5.3 和 Kimi K3。两者共同指向复杂编码、长时任务与智能…

国产旗舰模型这轮密集更新:智谱发布 GLM-5.3,强调所有提升来自后训练,并在代码与漏洞利用基准上达到开源 SOTA;腾讯发布 770B MoE 模型 Hy4 preview,以 1M 上下文和工程场景优化回应,内部盲评略胜 GLM 5.3 和 Kimi K3。两者共同指向复杂编码、长时任务与智能体/生产力场景,通用聊天不再是唯一焦点。安全侧,研究者展示了针对 Claude Code「Auto Mode」的提示注入攻击,成功率约 80%,再次说明无人值守 agent 需要沙箱隔离并避免暴露凭证。其他动态方面,Hugging Face 为 Open ASR 排行榜首次加入印地语和印度英语,Anthropic 向美国 K-12 学区开放 Claude for Teachers,NVIDIA 则宣布与 AWS 扩大 GPU 基础设施合作。

北美一手(LLMs 官方 & 关联账号)

Anthropic

⭐⭐ [产品更新] Claude for Teachers, now available for schools and districts

Claude Blog (产品/开发者) · 2026-08-27 · 原文 ↗
Anthropic 宣布将「Claude for Teachers」扩展为面向美国 K-12 学校和学区的免费 Enterprise 版本,管理员可在统一组织下管理教师和工作人员,并获得单点登录、基于角色的访问控制、域名认领等企业功能。学校和学区需完成验证并接受 K-12 条款与数据隐私协议,相关数据不用于模型训练,且遵循与 FERPA 对齐的承诺。新学期还新增了与 Learning Commons 合作开发的「备课」和「检查理解」(数学起步)两个教学技能,并更新了现有技能和包含课程、指南与课堂工作流的「Claude for K-12 Academy」。今年秋季 Anthropic 将在底特律公立学校社区学区试点评估该产品对教师福祉和实践的影响;符合条件的组织可在 2027 年 6 月 30 日前注册并获得一年免费访问。
打分理由
这是厂商面向教育垂直领域的产品功能扩展,提供了可用的企业级管理与隐私条款,属于有实际功能的更新,但对 AI 行业整体影响有限,按 primary 非模型内容标准评为 2。

东亚一手(中国厂商官方 & 模型发布)

智谱(GLM)

⭐⭐⭐⭐ [模型发布] zai-org/GLM-5.3

Zhipu GLM Models (HuggingFace) · 2026-08-28 · 原文 ↗
智谱 AI 在 HuggingFace 发布 GLM-5.3,参数量 753B,基于与 GLM-5.2 相同的基座模型,所有提升均来自后训练。官方称其代码能力在开源模型中领先,内测 Z.ai Code Bench 较 GLM-5.2 提升 50%,并在 Terminal Bench 3.0、Agents' Last Exam 等公开基准上达到开源 SOTA。后训练还带来了更强的网络与漏洞利用能力,在 CyberGym 漏洞发现上达到 SOTA,漏洞利用基准得分较 GLM-5.2 翻倍以上。模型支持 SGLang、vLLM、Transformers 等框架本地部署,并可通过 reasoning_effort 参数控制思考预算。
打分理由
这是智谱主线旗舰 GLM 系列的新版本,虽然不是新基座,但后训练带来的编码与网络能力提升显著,且为开源权重模型,具备行业影响。

⭐⭐⭐⭐ [模型发布] zai-org/GLM-5.3-BF16

Zhipu GLM Models (HuggingFace) · 2026-08-28 · 原文 ↗
智谱在 HuggingFace 发布 GLM-5.3-BF16 开放权重模型,参数量为 753B。该模型与 GLM-5.2 使用相同基础模型,所有提升来自后训练,在复杂编码和长时任务上表现明显更强:在自研 Z.ai Code Bench 上较 GLM-5.2 提升 50%,并在 Terminal Bench 3.0、Agents' Last Exam 等公共基准上取得开放权重 SOTA。模型还涌现出网络攻防(cyber)能力,在 CyberGym 漏洞发现上达到 SOTA,在漏洞利用类基准上较 GLM-5.2 翻倍以上。GLM-5.3 支持 SGLang、vLLM 等框架本地部署,并通过 reasoning_effort 参数(low/high/max,默认 max)控制思考预算。
打分理由
GLM-5.3 是智谱主线开放权重旗舰模型的新版本,属于一手厂商发布,自带可下载权重与多项基准数据,按 primary 标准属主力模型发布,评 4 分。

腾讯(混元)

⭐⭐⭐⭐ [模型发布] tencent/Hy4-preview-FP8

Tencent Hunyuan Models (HuggingFace) · 2026-08-28 · 原文 ↗
腾讯混元团队发布新一代旗舰 MoE 模型 Hy4 preview,并开源其 FP8 量化版本(Apache-2.0 许可)。模型总参数 770B,每 token 激活 49B,支持 1M 上下文长度;架构上采用 Gated DSA 注意力与 iHC 残差路径,并内置 MTP 层用于投机解码。官方称其在软件工程、办公分析、游戏开发和科学研究等场景上针对腾讯内部专家的工作流进行了专门优化。内部 163 名专家对 203 个工程任务进行盲测,Hy4 preview 以 2.99 的平均分略高于 GLM 5.3 和 Kimi K3。官方说明该版本为早期版本,预训练和后训练仍有提升空间。
打分理由
腾讯一手发布新一代旗舰模型 Hy4 preview,并开源 FP8 权重,属主力模型发布;但因是 preview 版本且细节有限,给 4 分。

⭐⭐⭐⭐ [模型发布] tencent/Hy4-preview

Tencent Hunyuan Models (HuggingFace) · 2026-08-28 · 原文 ↗
腾讯发布 Hy4 preview,是其新一代 MoE 旗舰模型,总参数量 770B,每 token 激活 49B,上下文长度 1M。模型采用 Gated DeepSeek Sparse Attention(带 IndexCache)与 iHC 残差连接,并内置一层 MTP 用于投机解码。官方称在模型规模、上下文长度和训练数据三方面扩展,重点面向软件工程、办公分析、游戏开发、科学研究等生产力场景。内部盲评显示,Hy4 preview 在 203 项工程任务上以 2.99 的平均分略胜 GLM 5.3(2.92)和 Kimi K3(2.94)。官方同时说明这是早期版本,预训练和后训练仍有提升空间。
打分理由
腾讯推出新一代旗舰 MoE 模型 Hy4 preview,公开了完整参数、架构细节与对照评测,属于一手厂商的重大模型发布,对开源模型生态有较大影响。

衍生 & 周边(产品 / Agent / Tools / 观点)

研究

⭐⭐⭐ [研究] The Open ASR Leaderboard Adds Its First Global South Language

Hugging Face Blog · 2026-08-28 · 原文 ↗
Hugging Face 与 Voice Arena 合作,为 Open ASR Leaderboard 新增针对印地语和印度英语的评估集 Monsoon en-IN 和 Monsoon hi-IN。这是该排行榜多语言标签中首次加入全球南方语言,印地语也是其中首个印度语言。每个评估集分为公开拆分和私有拆分,四个拆分之间说话人不重叠,共包含 4,888 位说话人,并记录每人 12 个语音属性。数据集按地理、年龄、性别、词汇、设备、声学环境、语音类型、语速及多有效转录等九个维度设计,旨在暴露平均词错误率(WER)背后的人群差异。收集方式包括从数百个地区招募、使用贡献者自有设备和网络、室内外场景,以及围绕日常话题的提示词。
打分理由
该基准首次将全球南方语言(印地语/印度英语)纳入 Open ASR Leaderboard,并以九维偏差设计构建说话人不重叠的数据集,是重要的 ASR 评估扩展。

⭐⭐ [研究] Breaking Claude Code Opus 5 Auto Mode

Simon Willison's Weblog · 2026-08-27 · 原文 ↗
Simon Willison 转述了安全研究员 Johann Rehberger 对 Claude Code「auto mode」的攻击研究。Anthropic 已将 Auto Mode 设为默认,并对其防提示注入能力做出大胆宣称;Rehberger 找到一种声称约 80% 成功率的攻击,方法是诱使 Claude Code 下载并解压 zip,再通过导入 base64 的行为实际执行压缩包中的本地 struct.py。报道还指出在部分运行中,即使 Claude 察觉到被入侵并发起清理,Auto Mode 也会阻止终止恶意进程的清理命令。Simon 认同 Rehberger 的结论:只要存在对抗攻击风险,唯一安全的方式就是把无人值守 agent 放进容器、虚拟机或操作系统沙箱,限制网络出口、持续监控,并避免向 agent 运行环境暴露主目录、SSH 密钥和云凭证。
打分理由
该帖属于转述性质,但包含可操作的具体攻击手法与防护建议(沙箱隔离),并非纯观点转引;按次级信源转述帖规则给 2。

其他

⭐⭐ [其他] NVIDIA Announces Upcoming Event for Financial Community

NVIDIA Newsroom · 2026-08-27 · 原文 ↗
NVIDIA 宣布与 AWS 合作,将交付 200 万块额外 GPU 和下一代基础设施,用于智能体(Agentic)AI 与物理 AI 场景。该公告日期为 2026 年 8 月 26 日。
打分理由
这是 NVIDIA 与 AWS 的大规模 GPU 基础设施合作,涉及 200 万块 GPU,对 AI 算力供给有实际影响;但作为次级信源且信息仅一句话、缺乏细节,因此给出 2 分。

📬
每天 3–5 条 agent 生态一手信号,中英双语。不错过重要更新 → 订阅邮件
Loading...