AI 日报 · 2026-08-26
IBM 发布 Granite 4.2 推理模型家族,3B、8B、30B 稠密模型均以 Apache 2.0 开源,上下文扩展到 512K,支持思考/非思考切换与原生工具调用,训练涵盖 15T tokens 预训练、推理与智能体轨迹 SFT 以及多阶段强化学习。研究侧,量化感知修复让 4-bit 压缩…
IBM 发布 Granite 4.2 推理模型家族,3B、8B、30B 稠密模型均以 Apache 2.0 开源,上下文扩展到 512K,支持思考/非思考切换与原生工具调用,训练涵盖 15T tokens 预训练、推理与智能体轨迹 SFT 以及多阶段强化学习。研究侧,量化感知修复让 4-bit 压缩模型在多数基准上超过全精度原版,EleutherAI 的 AI 谎言检测复盘则发现黑盒裁判模型能有效识别更大模型的欺骗、白盒方法高度依赖场景。LangChain/LangSmith 同日密集更新,从检索抽象、结构化工具、Plan-and-Execute 到 Deep Agents 调试、Rubric 自评和 Engine 问题检测,形成一套更完整的智能体开发与观测能力。此外,Google 发布 XR 手势生成原型 AgentHands,EVE Online 启动从 Stackless Python 2.7 到 Python 3 的迁移。
北美一手(LLMs 官方 & 关联账号)
⭐⭐ [研究] AgentHands: Generating interactive hand gestures for spatially grounded agent conversations in XR
Google Research Blog · 2026-08-25 · 原文 ↗
Google Research 发布了 AgentHands,一个基于 LLM 的 XR 研究原型,该成果发表于 CHI 2026。AgentHands 为对话式 AI 智能体生成与语音同步、富有表现力的手部手势,以在物理空间中提供空间锚定的指导,弥合抽象语言与用户物理环境之间的心理映射差距。文章通过专家形成的多维度分类法(包括手性、手势、空间性、时间动态、交互性和视觉特效)来定义虚拟手的可读性,并介绍了环境感知、手势事件库等工作流关键步骤。系统利用眼动追踪与场景重建将现实物体注册到 3D 空间,并支持指向、描绘、表达三类语义手势。该原型旨在让 XR 中的 AI 助手交流更自然、更具参与感。
打分理由
Google 官方发布的研究原型,提出了面向 XR 的新颖手势生成方法与分类学,但属于研究阶段而非模型发布,近期行业影响有限,故给 2。
衍生 & 周边(产品 / Agent / Tools / 观点)
模型发布
⭐⭐⭐ [模型发布] Granite 4.2 LLMs: How They're Built
Hugging Face Blog · 2026-08-25 · 原文 ↗
IBM 发布了 Granite 4.2 推理模型家族,包含 3B、8B、30B 三个稠密 decoder-only 版本,均以 Apache 2.0 许可开源。模型从头预训练约 15T tokens,采用五阶段训练策略,将上下文窗口扩展到 512K,随后进行链式思考、推理与智能体轨迹数据的监督微调,并经过多阶段强化学习后训练,其中 8B 与 30B 还包含真实沙箱环境中的智能体强化学习。所有模型支持思考/非思考模式切换、低强度思考模式以及原生工具调用,可通过 vLLM 等 OpenAI 兼容接口使用,也支持 SGLang。文章还给出了架构细节,包括 GQA、RoPE、SwiGLU、RMSNorm 等。
打分理由
这是 IBM 新推理模型家族的技术详解,包含完整训练管线、架构参数与 Apache 2.0 开放权重;作为二手信源,其对开发者有实际参考价值,但不构成行业格局级别的重大发布。
产品更新
⭐⭐ [产品更新] Using LangSmith to Support Fine-tuning
LangChain Blog · 2026-08-25 · 原文 ↗
LangChain 团队发布了一份使用 LangSmith 支撑大模型微调的指南,覆盖用 LangSmith 做数据集管理与评估,并可在 Colab 配合 HuggingFace 微调开源模型,也可接入 OpenAI 的微调服务。团队以 LLaMA2-7b-chat 和 gpt-3.5-turbo 为例,用从 LangSmith 导出的训练数据微调知识图谱三元组抽取任务,并用 LangSmith 评估结果。文章认为微调适合有充足样本的明确定义任务,不适合用来注入新知识——微调是学「形式」而非「事实」,可能增加幻觉;同时指出微调流程最大的痛点是数据集的收集清洗与评估。
打分理由
供应商(LangChain)的工程教程,给出了可操作、可复现的微调数据管理与评估方法,并附实测案例与 Colab 指南,对开发者有实用价值;但内容属教程性质、非模型发布,行业影响有限,故定 2 分。
⭐⭐ [产品更新] Timescale Vector x LangChain: Making PostgreSQL A Better Vector Database for AI Applications
LangChain Blog · 2026-08-25 · 原文 ↗
Timescale Vector 发布与 LangChain 的集成,使开发者可以用 PostgreSQL 作为 AI 应用的向量数据库。该集成引入基于 DiskANN 的新搜索索引,在百万 OpenAI Embeddings 数据集上相比 Weaviate 速度提升 243%(召回率约 99%),并比现有 PostgreSQL 搜索索引快 39.39% 至 1590.33%;启用 product quantization 后索引空间比 pgvector 节省 10 倍。它还支持基于时间的相似性搜索,利用 Timescale 超级表的自动时间分区与索引,可按时间范围或文档年龄过滤向量搜索,用于 RAG 的时间上下文检索。集成将向量、关系数据和时间序列数据统一在同一个 PostgreSQL 数据库中,简化 AI 基础设施栈,同时可用 PostgreSQL 数据类型存储和过滤元数据,并将向量搜索结果与关系数据 JOIN。未来版本将支持多属性过滤,官方还提供 90 天免费试用。
打分理由
这是 LangChain 与 Timescale Vector 的合作宣传博文,属于常规产品更新,虽包含具体 benchmark 数字和可用的集成,但并非改变行业格局的重大发布,故定档 2。
⭐⭐ [产品更新] Making Data Ingestion Production Ready: a LangChain-Powered Airbyte Destination
LangChain Blog · 2026-08-25 · 原文 ↗
LangChain 官方博客宣布与 Airbyte 推出更深度的集成:在 Airbyte 中新增一个 LangChain destination。该集成旨在帮助团队将检索类应用从原型推进到生产,特别是解决数据摄入环节的可靠调度与转换问题。Airbyte 提供大量数据源、编排和定时重新索引能力,LangChain 则贡献文本分割(15 种以上实现)和嵌入(50 种以上集成)等转换逻辑。此前的集成方向是让 Airbyte 源作为 LangChain 的 Document Loader,本次则是反向打通,让 LangChain 成为 Airbyte 的目标端。
打分理由
这是 LangChain 官方发布的产品集成更新,提供了可用的 Airbyte destination,对检索类应用的数据摄入管线有实际帮助,但属于常规功能迭代,影响面有限。
⭐⭐ [产品更新] LangServe Playground and Configurability
LangChain Blog · 2026-08-25 · 原文 ↗
LangChain 宣布为部署工具 LangServe 新增 playground 与可配置性功能。playground 可为 chain 和 agent 提供简易 UI,支持流式输出、中间步骤日志以及修改可配置参数,并可通过分享链接方便团队协作。可配置性基于 LangChain Expression Language 新增的语法,任意组件都可设为可配置,并通过 URL 保存和分享不同配置。文章以 WebLangChain 为例,展示了将不同 LLM、prompt 和检索器作为配置项的做法。当前配置不会持久化,但 LangChain 正在 alpha 测试一个可持久化配置的部署平台。
打分理由
这是 LangChain 对 LangServe 的常规产品功能更新,对开发者有实用价值,但并非改变行业格局的重大发布,按 secondary 标准定档为 2。
⭐⭐ [产品更新] Retrieval
LangChain Blog · 2026-08-25 · 原文 ↗
LangChain 官方博客宣布调整检索相关抽象,引入 Retriever 概念:检索器只需暴露 get_relevant_documents(query) -> List[Document] 接口即可接入。这一改动旨在让 LangChain 之外的检索器(如 OpenAI ChatGPT Retrieval Plugin)更易使用,也方便用户尝试混合检索等替代检索方法。同时,原先基于向量数据库的链已改为基于 Retriever:VectorDBQA 更名为 RetrievalQA,ChatVectorDBChain 更名为 ConversationalRetrievalChain 等。该变更向后兼容,现有链仍可继续工作,但官方建议尽快迁移到新的检索链。
打分理由
LangChain 官方博客给出了具体的接口签名与迁移路径,属于有可操作细节的框架更新,但未涉及模型发布或重大行业事件,因此定档为 2。
⭐⭐ [产品更新] Introducing Pytest and Vitest integrations for LangSmith Evaluations
LangChain Blog · 2026-08-25 · 原文 ↗
LangSmith 发布了与 Pytest 和 Vitest/Jest 的测试框架集成(beta),随 LangSmith Python 与 TypeScript SDK v0.3.0 推出,用于以熟悉的测试框架运行 LLM 评估(evals)。该集成保留了 Pytest/Vitest 的开发体验,同时可将测试输入输出、堆栈跟踪、指标与反馈记录到 LangSmith,便于调试、追踪指标变化并跨团队共享结果。文中还介绍了内置评估函数(如 expect.edit_distance)以及 @pytest.mark.langsmith 装饰器的用法,并给出了评估生成 SQL 应用的示例。
打分理由
这是厂商产品更新,提供了可用的新集成(SDK 版本、具体 API 用法和代码示例),对 LangSmith 开发者有实际价值,但属于常规功能迭代,未改变行业格局。
⭐⭐ [产品更新] Cube x LangChain: Building AI experiences with LLMs and the semantic layer
LangChain Blog · 2026-08-25 · 原文 ↗
Cube 宣布与 LangChain 的集成,发布 CubeSemanticLoader 文档加载器,用于将 Cube 语义层的数据模型加载为向量嵌入并存入 FAISS 向量库,以便将自然语言输入与数据模型中的视图和成员匹配,降低 LLM 在文本转 SQL 场景中的幻觉风险。该集成配合一个基于 Streamlit 的聊天演示应用(代码在 GitHub),并附有构造 Cube SQL API 查询的 OpenAI 提示词示例。博客给出了 ingest 元数据、初始化 LLM、查询向量库等核心代码片段。
打分理由
这是 Cube 与 LangChain 的集成发布,属于常规产品更新,提供了可用的加载器、演示代码和清晰的接入方法,对开发者有实用价值,但影响范围有限,未改变行业格局。
⭐⭐ [产品更新] Role Based Access Control (RBAC) for LangSmith
LangChain Blog · 2026-08-25 · 原文 ↗
LangChain 宣布 LangSmith 新增基于角色的访问控制(RBAC)功能,企业版用户可在工作区或组织内为用户分配 Admin、Viewer、Editor 三种系统角色,并可创建自定义角色以细化权限。同时,LangSmith 的 API 密钥分为个人访问令牌和服务密钥两类:个人访问令牌随创建用户生效,用户被删除时一同失效;服务密钥以服务为主体,不受人员变动影响,仅工作区管理员可创建。旧 ls__ 前缀的 API 密钥已迁移为服务密钥,并将在 2024 年 7 月 1 日停止支持。
打分理由
LangSmith 的 RBAC 与 API 密钥更新是面向企业用户的常规产品功能升级,信息具体但影响面有限,按 secondary 标准评为 2。
⭐⭐ [产品更新] Automating Web Research
LangChain Blog · 2026-08-25 · 原文 ↗
LangChain 团队最初尝试构建一个自主 web research agent,但发现 agent 按顺序迭代搜索的效率不高。他们转而利用 AI 可并行发起多次搜索和读取多页面的优势,将方案简化成一个高效的 retriever。该 retriever 的流程是:用 LLM 生成多个搜索查询、并行执行搜索并取每个查询的 top K 链接、并行抓取页面、将内容索引到向量库,再检索最相关的文档块。团队发布了新的 LangChain retriever、相关文档、示例代码和 Streamlit 应用,并支持配置为私有模式运行。
打分理由
这是 LangChain 官方的工程宣传博文,发布了可用的新 retriever、文档和示例应用,并给出了可操作的具体方法,满足给 2 的条件;但属于常规产品更新,未达到重大发布级别。
⭐⭐ [产品更新] Plan-and-Execute Agents
LangChain Blog · 2026-08-25 · 原文 ↗
LangChain 宣布推出一种新的 agent 执行器类型「Plan-and-Execute」,与此前基于 ReAct 的「Action」agents 形成对比。该方案将高层规划与短期执行分离:先由一个语言模型作为 planner 规划步骤,再由一个 Action Agent 充当 executor 逐步执行。团队认为它更适合复杂长期规划,并因关注点分离而提升可靠性,同时便于未来替换为更小的微调模型;主要代价是语言模型调用次数显著增加。初始版本已放入实验模块,提供 Python 和 JS/TS 文档。
打分理由
LangChain 官方发布新的实验性 agent 执行器架构,有可用实现和文档,属常规产品更新;按 secondary 标准评 2 分。
⭐⭐ [产品更新] Workspaces in LangSmith for improved collaboration and organization
LangChain Blog · 2026-08-25 · 原文 ↗
LangSmith 推出工作空间(Workspaces)功能,允许组织内按团队、业务单元或部署环境对用户和资源进行逻辑分组,以提升大型企业的协作效率与安全性。资源(如 trace 项目、数据集、标注队列、prompts)现在归属单个工作空间,不再跨空间共享;用户管理改为组织级,区分组织管理员与组织用户,并支持 RBAC 做细粒度权限控制。企业版最多可创建 10 个工作空间,可申请提高上限;计费席位方式和 API 密钥作用域规则不变。
打分理由
这是 LangSmith 的一个常规产品功能更新(工作空间与权限管理),对大型团队协作有价值,但属于增量改进,对 AI 行业整体影响有限,按 secondary 标准给 2。
⭐⭐ [产品更新] LLMs and SQL
LangChain Blog · 2026-08-25 · 原文 ↗
LangChain 团队与社区成员 Francisco Ingham 和 Jon Luo 合写了这篇博客,介绍如何让 LLM 更可靠地生成 SQL 查询。文章指出主要挑战包括幻觉(LLM 编造不存在的表或字段)、上下文窗口限制,以及生成的 SQL 出错时的处理。提出的解决方案包括在 prompt 中描述数据库的 schema 和示例行、将探索性查询限制为前 K 行或汇总统计、以及让 LLM 从错误中学习并重写查询。文中还提到 LangChain 提供了 SQL chains 和 SQL agents,并预告了 3 月 22 日的网络研讨会。
打分理由
属于厂商产品/工程宣传博文,但给出了可操作的方法(描述数据库 schema、限制 top K、出错重试)并附有论证过程,因此按判据给 2 分;作为衍生内容未超过 4 分上限。
⭐⭐ [产品更新] Multi-modal RAG on slide decks
LangChain Blog · 2026-08-25 · 原文 ↗
LangChain 发布了一篇多模态 RAG 教程,并提供了面向幻灯片(slide decks)的模板与公开基准。文章介绍了两种方案:一是用多模态 embedding 直接嵌入幻灯片图像并检索;二是先用 GPT-4V 生成每页图像摘要,再由多向量检索器根据摘要与用户问题的相似度召回原图。两种方案最终都把检索到的图像交给 GPT-4V 生成回答。作者用 Datadog 财报演示文稿的 10 个问题做了评估:纯文本 RAG 准确率 20%,多模态 embedding 方案 60%,多向量检索器 + 图像摘要方案 90%。结果显示多模态方法明显优于纯文本 RAG,但基于图像摘要的方案复杂度与成本更高。相关模板、评估 notebook 与 LangSmith 对比页均已公开。
打分理由
这是一篇有具体实现、公开基准和量化对比的技术教程,对构建多模态 RAG 应用有实操价值,但属于衍生产品与技术分享,未构成行业级重大事件,故给 2。
⭐⭐ [产品更新] Debugging Deep Agents with LangSmith
LangChain Blog · 2026-08-25 · 原文 ↗
LangChain 博客介绍了 LangSmith 新增的深度智能体调试能力。作者指出,深度智能体运行时间长、涉及数十上百个步骤和多人机交互回合,调试难点在于长提示词、超长 trace 和多轮对话。LangSmith 通过 run、trace、thread 三层结构记录执行数据。为此推出两项工具:Polly,一款应用内 AI 助手,可在 Trace 和 Thread 视图中用自然语言提问来定位问题;以及 langsmith-fetch,一个为 Claude Code 等编码智能体配备调试能力的命令行工具。
打分理由
该内容为 LangChain 的产品更新,发布了两个可用于调试深度智能体的实际工具(Polly 与 langsmith-fetch),对开发者有实用价值,但并非改变行业格局或一手模型发布,按 secondary 标准定为 2 分。
⭐⭐ [产品更新] Structured Tools
LangChain Blog · 2026-08-25 · 原文 ↗
LangChain 宣布推出「结构化工具」(structured tools)抽象,并配套一个新的 agent 类。此前工具只能接收单个字符串输入,现在工具可以接收任意数量、任意类型的输入,从而支持更复杂的模型与工具交互。结构化工具由名称、描述、args_schema(基于 Pydantic 的参数校验模型)以及 _run/_arun 实现函数组成。文章回顾了从 ReAct 链到多动作 agent 的演进,并解释了工具命名、描述与参数 schema 对 agent 选择与校验输入的作用。
打分理由
这是 LangChain 官方的产品功能更新公告,具体介绍了新的工具抽象和配套 agent 类,提供了可操作的技术细节(name、description、args_schema、_run/_arun),但属于开发者框架的常规迭代,并非模型发布或行业格局级事件,按 secondary 标准给 2。
⭐⭐ [产品更新] Multi-Vector Retriever for RAG on tables, text, and images
LangChain Blog · 2026-08-25 · 原文 ↗
LangChain 博客发布了三个新 cookbook,演示用 multi-vector retriever 对包含表格、文本和图像的混合文档做 RAG。核心思路是把用于生成答案的原始文档与用于检索的引用解耦:对文档摘要做向量检索,命中后将完整文档或表格/图像交给 LLM 合成答案,避免丢失上下文。文中用 Unstructured 将 PDF 等文件切分为表格、图像和文本块,并为表格生成摘要以适配自然语言检索。三个 cookbook 分别覆盖半结构化(表格+文本)、多模态(文本+表格+图像)以及私有多模态场景,并给出将多模态 LLM 与 multi-vector retriever 结合以支持图像 RAG 的思路。
打分理由
LangChain 官方博客发布了三个可复用的 cookbook,给出了针对半结构化/多模态文档 RAG 的具体做法和代码产物,属于有实际产出的产品/工程内容,按 secondary 标准评为 2。
⭐⭐ [产品更新] Introducing Rubrics: Build Agents that Evaluate and Correct Their Work
LangChain Blog · 2026-08-25 · 原文 ↗
LangChain 宣布为 Deep Agents 新增 RubricMiddleware,让智能体在完成任务前对照 rubric 自行评估并迭代修正。该实现使用一个专门的 grader 子智能体进行评估,它可调用工具、查看完整对话记录,并逐条返回反馈;当任一标准未达时,反馈会被注入对话并触发新一轮运行,直到全部满足或达到迭代上限。博客给出了从定义中间件到在 invoke 时传入 rubric 的完整代码示例,并指出该方法最适用于有明确可验证成功标准的任务,例如通过测试、避免禁用模式、覆盖必需章节。
打分理由
LangChain 为 Deep Agents 新增的 RubricMiddleware 属于常规产品功能更新,对使用该框架的开发者有实用价值,但不构成改变行业格局的事件。
⭐⭐ [产品更新] LangSmith Engine Improves Agent Issue Detection by 2x
LangChain Blog · 2026-08-25 · 原文 ↗
LangChain 发布 LangSmith Engine 的更新,称其识别代理问题的能力在内部基准上提升超过 2 倍,在修复问题的公开基准(如 Terminal-Bench)上提升 25%。Engine 是平台内的深度代理,可自动分析生产轨迹、定位问题、生成修复 PR 并持续监控回归。新版本还支持自托管部署、Slack 告警和 Linear 集成,并新增降低成本的精简分析模式。自 5 月推出以来,Engine 已扫描超 6000 万条轨迹,发现逾 2 万个问题,节省数万小时工程时间。
打分理由
这是 LangSmith 平台的功能更新(非新模型发布),虽然带来了显著的性能提升和新的集成,但对更广泛的 AI 生态影响有限,属于常规产品更新,因此给 2 分。
⭐⭐ [产品更新] Using skills with Deep Agents
LangChain Blog · 2026-08-25 · 原文 ↗
Anthropic 提出了 agent skills 概念:skills 是包含 SKILL.md 文件及关联文件的文件夹,agent 可以动态发现并加载它们以更好完成特定任务。LangChain 已将 skills 支持加入其开源工具 deepagents-CLI。文章指出通用 agent(如 Claude Code、Manus)倾向于只使用少量工具,关键在于给 agent 提供文件系统和 shell 访问权,而不是为每项任务绑定专用工具。与传统工具相比,skills 的优势在于 token 效率(渐进式披露,默认只加载 YAML frontmatter)和降低认知负担。使用 deepagents-CLI 时,可将示例 skills 复制到 skills 文件夹,通过 deepagents skills list 查看,相关请求会自动触发读取对应 SKILL.md。
打分理由
这是 LangChain 自家 deepagents-CLI 对 Anthropic skills 概念的产品功能跟进,提供了可复现的使用方法,但属于常规产品更新、无重大行业影响,按 secondary 标准应给 2。
⭐⭐ [产品更新] Building Self-Correcting Memory in OpenWiki
LangChain Blog · 2026-08-25 · 原文 ↗
OpenWiki 构建了一套可自纠错的记忆系统,解决长期记忆中知识随时间过时的问题。它要求 agent 在写 wiki 页面时,同时记录页面中的事实性论断及支持这些论断的代码证据,并用文件路径加行号定位。运行时为每条证据保存版本号,当来源代码版本与当初支持论断的版本不一致时,该论断就会被标记为过期。过期后 OpenWiki 会重新核对当前代码:论断仍成立则刷新证据版本,不成立则同步更新 wiki 内容与证据。由此形成自纠错闭环,而不是每次从零重新生成 wiki;文中还提到这些论断与 OKF v0.2 相关联。
打分理由
secondary 信源;正文提出了一套可操作的自纠错记忆方案(论断与版本化证据绑定、过期检测与修正流程),符合工程宣传博文给 2 分的判据,但既非模型发布也非行业级事件。
研究
⭐⭐ [研究] What We Learned Trying to Catch AI Liars: An Aletheia's Quest Retrospective
EleutherAI Blog · 2026-08-25 · 原文 ↗
EleutherAI 回顾了参与 Aletheia's Quest 比赛的经历,这是一项由 Cadenza Labs 和 NDIF 主办、Schmidt Sciences 资助的 AI 谎言检测竞赛,共有 19 支团队参加。他们使用黑盒与白盒方法,在 27B 到 120B 参数规模的多个模型上测试了数百种检测器变体。主要结论是:黑盒监控表现超出预期,一个较小的可信裁判模型就能有效识别更大模型的多数欺骗行为,而白盒方法的效果高度依赖具体场景。团队发布了包含最佳方法和精选欺骗数据集「gauntlet」的配套仓库,供后续研究使用。比赛中他们在大部分时间排名第一,最后几天被 SAIN Groningen 反超,最终名次待未公开测试数据公布。
打分理由
这是二次来源的研究复盘文章,包含具体实验结论和释出的数据集/代码,对 AI 欺骗检测领域有参考价值,但不属于改变行业格局的重大事件。
⭐⭐ [研究] Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original
Hugging Face Blog · 2026-08-25 · 原文 ↗
该研究提出量化感知修复(QAH)方法:直接从压缩前的全精度模型蒸馏到量化后的学生模型,而非从已修复的 bfloat16 检查点蒸馏,从而消除精度上限。作者将 GPT-OSS 120B 压缩至 60B 并量化为 MXFP4 后,QAH 在 9 个基准中的 7 个上超过了其全精度(bfloat16)原版,且模型更小、运行更便宜。文章指出常规的量化感知训练(QAT)和量化感知蒸馏(QAD)在结构压缩后失效,因为不存在独立训练的较小架构全精度版本,只能以质量有损的恢复检查点为教师,限制了恢复效果。
打分理由
二次信源的研究文章,提出了可操作的量化感知修复方法并给出具体 benchmark 数据,但属于技术改进而非行业格局级事件。
⭐⭐ [研究] Benchmarking Question/Answering Over CSV Data
LangChain Blog · 2026-08-25 · 原文 ↗
LangChain 团队发布了一篇关于对 CSV(表格)数据进行自然语言问答的深度技术博客。他们先搭建了简易 Streamlit 应用收集真实用户问题,并用 LangSmith 记录反馈,从而构建问题与标准答案数据集;随后用 LLM 辅助评估来比较不同方案。调试中发现初始方案的不足,最终改进为一个基于 OpenAI functions 的自定义 agent,配备 Python REPL 与检索器两个工具。团队已将收集反馈的应用、数据集和评估脚本开源,并提供了配套视频。
打分理由
这是来自周边厂商的技术研究类博客,包含完整评估流程、可复现做法和开源数据集,对构建表格问答应用有参考价值,但并非改变行业格局的重大发布。
观点
⭐⭐ [观点] The rise of "context engineering"
LangChain Blog · 2026-08-25 · 原文 ↗
LangChain 创始人 Harrison Chase 在博客中提出「上下文工程(context engineering)」概念,即构建动态系统,以正确格式为 LLM 提供所需信息与工具,使其有望完成任务。文章认为智能体(agent)失控大多不是因为模型能力不足,而是缺少合适上下文、指令或工具。他强调上下文来源多样且动态变化,提示构建逻辑也需动态化,同时信息格式与工具入参设计同样关键。文章还区分了上下文工程与提示工程:在复杂应用里,提供完整、结构化的上下文远比措辞技巧重要。
打分理由
来自 LangChain CEO 的观点文章,系统阐述「上下文工程」概念并给出可操作的设计原则,对 AI 工程师有参考价值,但无具体产品发布或数据,属于优质深度观点而非重磅新闻。
⭐⭐ [观点] Agentic Engineering: How Swarms of AI Agents Are Redefining Software Engineering
LangChain Blog · 2026-08-25 · 原文 ↗
本文提出 agentic engineering 概念:将 AI 智能体视为有明确角色、共享记忆和统一可观测性的数字团队成员,通过多智能体协调贯穿软件交付全流程。与 Codex、Claude 等编码智能体不同,agentic engineering 定位为更高抽象层的控制平面,编排跨团队工作流、维护长期记忆与状态;二者互补,编码智能体可作为 worker 智能体内的推理与代码生成引擎。在 20 多个调试工作流的试点中,协调式多智能体执行将定位根因的时间较历史基线减少 93%,一个月内 512 个会话节省逾 200 工程小时;开发工作流执行时间减少 65%,主要收益来自压缩下游测试环节。系统基于 LangChain 工具套件(LangSmith、LangGraph)实现,核心理念是让系统模仿真实工程团队的协作方式,而非打造更快的单点编码工具。
打分理由
有数据支撑的深度观点文:提出 agentic engineering 概念并给出试点量化结果与参考架构,但属厂商博客上的客座文章,无模型或产品发布,按 secondary 标准定 2。
其他
⭐⭐ [其他]
LangChain Blog · 2026-08-25 · 原文 ↗
LangChain 博客发布了一份 cookbook,演示如何结合 Deep Agents 与 Parallel Task API 构建自动化的公司尽职调查 agent。该 agent 编排五个研究维度:公司概况、财务健康、诉讼监管、新闻声誉、竞争格局,每个维度由独立 subagent 负责。竞争格局返回前三名竞争对手后,编排器会并行派发多个竞争者分析 subagent,并在最后交叉核对工作底稿、处理低置信发现、生成带引用和风险标记的最终报告。Parallel 的 Task API 返回带逐字段引用、推理轨迹和 Basis 置信度的结构化结果,并支持基于上下文的追问。文章包含完整实现代码,并已在 Rivian Automotive 上端到端验证:约 23 分钟完成 9 次调用。
打分理由
这是厂商发布的技术 cookbook,包含可复现的代码、具体架构和验证数据(Rivian 上 9 次调用约 23 分钟),读者可以照着构建类似 agent,因此达到 2 分而非噪声。
⭐⭐ [其他] How LangSmith and LangChain OSS Help You Meet EU AI Act Requirements
LangChain Blog · 2026-08-25 · 原文 ↗
欧盟 AI 法案对高风险 AI 系统(如金融、医疗、HR 等领域)设定了合规要求,截止日期为 2026 年 8 月 2 日,不合规最高面临 €15M 或全球年营业额 3% 的罚款。文章逐条对应法案条款(风险管理系统、自动事件日志、可追溯决策、数据治理与偏见审查等),介绍 LangSmith 与 LangChain OSS 如何满足这些要求。LangSmith 提供端到端 tracing、执行图可视化(LangSmith Studio)以及基于 trace 数据自动聚类失败模式的 Insights Agent,支持自定义仪表盘与告警。数据方面提供 14 天基础保留与 400 天扩展保留,并支持自托管、BYOC 及欧盟境内数据驻留。文章还说明持续评估工具用于生产流量的质量与安全度量。
打分理由
厂商产品宣传博文,但提供了可操作的方法(将 tracing、日志、评估等具体能力对应到 EU AI Act 的具体条款)和具体数据(截止日期、罚款额、数据保留期限),符合「提出可操作的方法并给出论证过程」的定档条件,故给 2。
⭐⭐ [其他] How Lyft Built a Self-Serve AI Agent Platform with LangGraph and LangSmith
LangChain Blog · 2026-08-25 · 原文 ↗
Lyft 使用 LangGraph 构建了一个面向客户支持的多智能体系统,日处理数百万次骑手和司机的交互。该系统采用路由器多智能体架构:元智能体作为有状态路由器,将请求分发至专门的子智能体,每个子智能体都是完整的 LangGraph StateGraph。平台让运营团队、VoC 负责人和产品经理通过自然语言和配置直接定义及迭代智能体,减少了对机器学习工程师的依赖,将单个智能体的开发周期从约六个月缩短到几周。在生产质量方面,团队借助 LangSmith 进行追踪、看板监控和 LLM-as-a-judge 评估,并发现结构化的提示词编写是决定智能体可靠性的关键因素之一。
打分理由
这是一篇有具体架构细节、可操作方法和量化成果的工程案例,对构建客服 Agent 的团队有参考价值,但属于衍生内容,未构成重大行业影响。
⭐⭐ [其他] How We Build Agent Environments & Tasks
LangChain Blog · 2026-08-25 · 原文 ↗
LangChain 的工程师在博客中分享了他们构建合成 agent 环境与任务的方法。核心是一条两阶段流水线:先根据 traces、代码或人工输入生成详细的任务 spec(用自然语言描述输入、环境和测试脚本),再把 spec 转成具体的 eval 任务及对应环境。他们引入了「world spec」概念,用于沉淀项目共享知识、脚本和辅助函数。团队强调这一过程高度迭代,并已把流程打包进更新后的 eval-engineering skill,方便各团队自行复用。
打分理由
二级信源,提供了一套可操作的 agent 评测任务构建方法,但属于工程实践分享,没有新的 benchmark 数据或重大产品发布。
⭐⭐ [其他] EVE Online: The Move to Python 3 Begins!
Simon Willison's Weblog · 2026-08-25 · 原文 ↗
EVE Online 宣布开始从 Stackless Python 2.7 迁移到 Python 3。自 2003 年上线以来,该游戏一直运行在 Stackless Python 上,上一次重大升级是 2010 年到 Python 2.7。此次迁移将先用 futurize 脚本处理约 240 万行代码,再对约 2 万个 Python 2 与 Python 3 行为差异点进行人工审查,例如整数除法从向零取整变为浮点结果。公告未说明如何替代 Stackless,但去年会议曾介绍在 EVE Frontier 的 Carbon 引擎中用调度库替换 Stackless 的方案,相关库 carbonengine/scheduler 已开源。
打分理由
作为一手厂商消息的转述,提供了具体可操作的迁移方法(futurize 脚本、人工审查差异点、替代 Stackless 的开源方案),读者可从中获取实际做法;但事件本身并非重大 LLM 或行业格局级变化,故定为 2。
每天 3–5 条 agent 生态一手信号,中英双语。不错过重要更新 → 订阅邮件
Loading...