AI 日报 · 2026-08-18
NVIDIA 联合 Apollo、BlackRock、Blackstone、Brookfield、高盛和 KKR 推出目标超 5000 亿美元的 AI 算力融资平台,并锁定俄亥俄州 PORTS-Pike 园区独家托管其 AI 计算设施。模型层,腾讯开源 EVIE-Preview-4.5B 视觉文档检…
NVIDIA 联合 Apollo、BlackRock、Blackstone、Brookfield、高盛和 KKR 推出目标超 5000 亿美元的 AI 算力融资平台,并锁定俄亥俄州 PORTS-Pike 园区独家托管其 AI 计算设施。模型层,腾讯开源 EVIE-Preview-4.5B 视觉文档检索模型,在 ViDoRe 榜单登顶;Together AI 的 DeepSWE 评测显示,DeepSeek V4 Pro 0813 失败后再升级 GPT-5.6 Sol 的级联策略,以每任务 3.35 美元解决 83% 任务,而单独用 Sol 是 8.37 美元解决 72.7%。研究与应用方面,Google PhotoScan 从手机照片估算体脂与胰岛素抵抗风险,Hugging Face 的新 GPU 分配器在相同负载下最高提升 33 个百分点利用率。LangChain 推出代理支付中间件、Replit 增加黑盒渗透测试;Qwen 3.8 27B 在 Artificial Analysis 指数与 GPT-5.6 Luna 同分,另有调查追踪到稀有书籍被送往亚马逊仓库,疑似用于 AI 训练扫描。
北美一手(LLMs 官方 & 关联账号)
⭐⭐ [研究] Seeing beyond BMI: Estimating cardiometabolic risk with smartphone imagery
Google Research Blog · 2026-08-17 · 原文 ↗
Google Research 展示了 PhotoScan,一种从智能手机照片估算身体组成的深度学习方法,并验证其可在临床研究中以接近 DXA 扫描的准确度预测胰岛素抵抗。该框架从普通 2D 照片估计体脂百分比、A/G 脂肪比和 V/S 脂肪比,在 UK Biobank 超 3.5 万参与者数据上预训练,并用 677 名成年人进行微调。验证结果表明,PhotoScan 在体脂百分比准确度上优于智能手表生物电阻抗分析(BIA)传感器,且能提供 BIA 无法给出的 A/G 与 V/S 指标。该方法无需专门临床设备和辐射暴露,有望成为一种可扩展的代谢风险非侵入性筛查手段。
打分理由
谷歌研究院展示了用手机照片估算身体组成并预测胰岛素抵抗的可行性,有数据和验证支撑,但尚属研究阶段,对 AI 行业整体影响中等,故评为 2。
东亚一手(中国厂商官方 & 模型发布)
腾讯(混元)
⭐⭐⭐ [模型发布] tencent/EVIE-Preview-4.5B
Tencent Hunyuan Models (HuggingFace) · 2026-08-18 · 原文 ↗
腾讯混元在 HuggingFace 发布 EVIE-Preview-4.5B 视觉文档检索模型的预览版(Apache-2.0 开源),基于 Qwen3.5-4B 底座,采用 ColPali/ColBERT 风格的后期交互(late-interaction)多向量架构,输出原生 128 维 token 向量。该模型在 ViDoRe V3 和 V1+V2 两个榜单均排名第一,其中 V3 公开域平均 nDCG@10 为 65.36,超过 webAI-ColVec1.1-8b 等参数更大的模型。同一权重支持每页 768 或 1792 个视觉 token 两种部署档位,无需重新训练或导出,轻量档可在 180 GiB 内索引约一百万页文档。
打分理由
腾讯官方一手发布的垂类模型,非旗舰线,但在视觉文档检索基准 ViDoRe V3 与 V1+V2 双榜登顶、给出完整 benchmark 数据且 Apache-2.0 开源,具备实质信息量,故定档 3。
衍生 & 周边(产品 / Agent / Tools / 观点)
产品更新
⭐⭐ [产品更新] AgentCore Payments middleware for LangChain agents
LangChain Blog · 2026-08-17 · 原文 ↗
LangChain 博客宣布推出 AgentCore Payments 中间件,让 LangChain agents 能够直接安全地为付费 API 付费,支付逻辑集中在中件层而非每个 tool wrapper 中。支出上限由 AgentCore 在基础设施层以 session 级预算强制执施,不依赖 LLM prompt,即使 agent 被攻破也能兜底。底层基于 Coinbase 创建、现由 Linux 基金会托管的 x402 协议,通过稳定币微支付在单次 HTTP 请求内完成报价、支付与内容获取,并支持 AgentCore Identity 钱包认证及 Coinbase CDP 与 Stripe (Privy) 的法币/USDC 充值。LangSmith 可记录购买行为与推理过程,支持事后审计与上线前的 eval 测试。
打分理由
这是 agent 支付方向的实质性产品更新,给出了具体架构与安全方案(x402、session 级预算、钱包认证、审计),对 LangChain 生态开发者有可操作价值,但属于合作产品发布而非模型发布或行业级事件,故给 2。
⭐⭐ [产品更新] Black-box pen tests on Replit
Replit Blog · 2026-08-17 · 原文 ↗
Replit 发文介绍其新增的黑盒渗透测试安全能力。过去应用上线前的安全审查需要向第三方厂商采购渗透测试,费用数千美元、来回沟通耗时数周;Replit 希望像推动软件开发大众化一样,让应用安全也变得大众化。其现有扫描方式是由智能体阅读代码、寻找危险模式,每次构建都会执行,能发现不少问题;但恶意黑客看不到代码,而是直接对运行中的应用进行试探,两种方式搜索路径不同、结果也不同。代码看似正常却仍可能泄露数据的漏洞,正是这两种方式之间的盲区,也是真实入侵最常发生的地方。
打分理由
常规产品更新:Replit 为平台上 AI 构建的应用新增黑盒渗透测试能力,对开发者有一定参考价值,但属于平台功能迭代,影响面有限,且正文为宣传性说明,无具体数据或版本细节。
研究
⭐⭐⭐ [研究] DeepSeek V4 Pro 0813 vs GPT-5.6 Sol on DeepSWE: Cost, Coding, and Routing
Together AI Blog · 2026-08-18 · 原文 ↗
Together AI 发布了对 DeepSeek V4 Pro 0813 与 GPT-5.6 Sol 在 DeepSWE 软件工程基准上的对比评测。结果显示,先运行 DeepSeek V4 Pro 0813、测试失败时升级到 GPT-5.6 Sol 的级联策略能以每个任务 3.35 美元的成本解决 83.0% 的任务,而单独使用 Sol 只能解决 72.7%,成本为 8.37 美元。单次尝试(pass@1)Sol 以 72.7% 对 62.8% 领先,但 pass@4 上 Pro 以 88.5% 反超 Sol 的 85.8%。两者每 rollout 成本相差 35 倍(0.24 美元对 8.37 美元),每 100 美元 Pro 可解决 261 个任务而 Sol 仅 9 个。Sol 更快(17 分钟对 35 分钟),但其失败中有 20% 会破坏已有测试,Pro 仅 11%。
打分理由
二级信源中的高信息密度评测,给出了可复现的成本与路由数据,能直接影响开发者的模型选型决策,但并非格局级事件,故定 3 分。
⭐⭐ [研究] Same Cluster, 33 Points More Utilization: What Changed Was the Order
Hugging Face Blog · 2026-08-17 · 原文 ↗
Dharma-AI 团队介绍了一种约束感知的 GPU 分配器,并在七个基准场景中与 FIFO 调度器进行了对比。在相同硬件和相同负载下,GPU 利用率最高提升 33 个百分点,优先级加权输出在所有场景中均有提升,最高达 105%。文章指出真正困难的是在时间步上决定哪个 GPU 运行哪个任务,训练、批量推理和量化等批处理型负载与实时推理的弹性需求在分配形态上存在冲突。FIFO 调度为满足实时推理的峰值需求会全天预留 GPU,导致非峰值时段大量闲置,在两个场景中基线利用率分别只有 51.6% 和 53.6%。
打分理由
作为二手技术博客,文章给出了具体方法(约束感知调度)和可复现的对比数据(利用率提升 33 个百分点),属于有数据、有论证的研究,但未达到改变行业格局的程度,故定档 2。
⭐⭐ [研究] Qwen 3.8 27B scores 52 on the Artificial Analysis Intelligence Index
Simon Willison's Weblog · 2026-08-17 · 原文 ↗
Qwen 3.8 27B 在 Artificial Analysis Intelligence Index 上获得 52 分,与 GPT-5.6 Luna (max) 同分,仅比 GLM-5.2 (max) 和 DeepSeek V4 Pro 0813 (max) 低一分。文中指出 GLM-5.2 参数规模为 753B,DeepSeek V4 Pro 0813 为 1.7T,而 GPT-5.6 Luna 的规模未知但预计远大于 27B。Simon Willison 称这是一个真正令人惊叹的模型。
打分理由
转述帖包含具体的基准分数与模型参数对比,信息密度尚可,对模型评估有一定参考价值;但无方法或可操作做法,按 secondary 标准定档 2。
其他
⭐⭐⭐ [其他] NVIDIA Guarantees SB Energy's PORTS-Pike Technology Campus in Ohio to Exclusively Host NVIDIA AI Compute
NVIDIA Newsroom · 2026-08-17 · 原文 ↗
NVIDIA 宣布与 Apollo、BlackRock、Blackstone、Brookfield、Goldman Sachs 和 KKR 合作,建立 AI 计算基础设施融资平台,目标动员超过 5000 亿美元的第三方资本。同时,NVIDIA 保证 SB Energy 位于俄亥俄州的 PORTS-Pike 技术园区将独家托管 NVIDIA 的 AI 计算设施。
打分理由
涉及多家顶级金融机构和超 5000 亿美元规模的 AI 算力基建融资合作,产业信号强;但属于资本/产业事件而非模型或产品发布,且信源为二手,故定为 3。
⭐⭐ [其他] We Tracked a Shipment of Rare Books. It Ended at an Amazon AI Training Facility
Simon Willison's Weblog · 2026-08-17 · 原文 ↗
404 Media 通过一枚 Apple AirTag 追踪了一批约 1000 本稀有书籍的订单,发现包裹最终被送至拉斯维加斯东北部亚马逊 LAS8 仓库的 VGT3 区域。亚马逊员工的在线论坛讨论确认 VGT3 会大量破坏性扫描书籍。该调查为「匿名大额购书者疑似为 AI 训练采集数据」的说法提供了具体证据,并指向亚马逊可能在批量扫描图书用于 AI 训练。
打分理由
作为 link blog 转述 404 Media 的一手调查,包含具体的追踪方法和明确可核对的事实(订单规模、AirTag 追踪、亚马逊仓库地点与扫描行为),对关注 AI 训练数据来源的读者有信息量,但属于衍生内容且影响面有限,故给 2。
每天 3–5 条 agent 生态一手信号,中英双语。不错过重要更新 → 订阅邮件
Loading...