本周顶级 AI 论文精选(2026-05-04) · 乔木博客 向阳乔木 2026-05-07

乔木博客

全部

AI工具

AI教程

AI生成

AI资讯

健脑房

播客解读

论文学习

本周顶级 AI 论文精选(2026-05-04)

论文学习

·

2026年5月7日

·

105 次阅读

·

约 14 分钟

原文: 🥇Top AI Papers of the Week

1. 智能体工具链工程(Agentic Harness Engineering)

目前大多数编程智能体的工具链(harness)仍依赖手动调优或脆弱的试错式自我演化来维持运行。本文提出了智能体工具链工程(AHE)框架,使工具链的演化过程变得可观测、可证伪。AHE 将系统拆分为三层:以可回滚文件形式存储的组件、从数百万条轨迹 token 中提炼出的结构化经验,以及以预测形式编写并可根据任务结果验证的决策。每一次修改都变成了一份可验证或可回退的契约。

三层演化模型: 组件、经验和决策各自作为一等工件管理。组件是版本化文件,经验是从完整轨迹日志中压缩提取的证据,决策则是附带预期结果的显式假设。该结构将黑盒式的工具链调优转变为可审计的工程闭环。

Terminal-Bench 2 上 Pass@1 显著提升: 经过十轮迭代,Pass@1 从 69.7% 攀升至 77.0%,超越了人工设计的 Codex-CLI(71.9%)以及 ACE、TF-GRPO 等自我演化基线。在 SWE-bench-verified 上,该框架还比种子工具链减少了 12% 的 token 消耗。

跨模型迁移能力: 演化后的工具链在不同模型家族间迁移时可获得 +5.1 至 +10.1 个百分点的增益,表明这些优化是结构性的,而非对特定骨干模型的过拟合——这正是工具链工程最需要的特性。

重要意义: 工具链工作是大多数智能体系统中最大的隐性成本。AHE 是首个可信的方案,能让工具链在不陷入噪声漂移的前提下自我改进,堪称本周最重要的智能体系统论文。

论文 | 推文

2. AgenticQwen-30B-A3B:3B 活跃参数媲美 235B 模型

阿里巴巴证明,一个 30B 参数的 MoE 模型在仅激活 3B 参数的情况下,就能在真实工具调用任务上匹敌 Qwen3-235B。AgenticQwen-30B-A3B 在 TAU-2 与 BFCL-V4 Multi-Turn 上的平均得分为 50.2,AgenticQwen-8B 为 47.4,两者均比原始 Qwen 基线提升了一倍以上,几乎追平 235B 模型。其核心方法基于两个并行运行的强化学习飞轮,并引入模拟用户主动误导智能体。

基于自身失败的推理飞轮: 第一个循环挖掘模型自身的错误,并在每轮中将其转化为更难的推理问题。训练分布随模型进步自动变难,无需新增人工标注的推理数据。

面向工具调用的智能体飞轮: 第二个循环将简单的线性工具调用轨迹扩展为多分支行为树。模拟用户测试智能体从误导性指令、模糊目标和失败工具调用中恢复的能力——这正是传统监督微调最容易崩溃的地方。

生产级推理效率: 推理时仅激活 3B 参数的 30B MoE 模型,其部署成本远低于 235B 的稠密或 MoE 替代方案。对于前沿推理能力过剩的工具调用场景,这将彻底改变生产级智能体的成本结构。

可复用的训练范式: 飞轮方法并不局限于 Qwen。团队可以从自身智能体的失败中生成高难度样本,而非依赖静态合成数据,这是领域专用智能体更具可扩展性的路径。

论文 | 推文

3. 智能体世界模型:大规模综述

这篇由 40 位作者合著的大规模综述,给出了迄今为止智能体研究中最清晰的世界模型分类体系。论文提出了一个"层级×定律"框架,涵盖三个能力层级和四种定律体系,综合梳理了 400 余篇文献和 100 多个代表性系统,横跨基于模型的强化学习、视频生成、网页与 GUI 智能体、多智能体仿真和科学发现等领域。当智能体从聊天机器人转向目标执行者时,瓶颈从语言转移到了环境——本文首次为此前各自为战的研究社区提供了一套共享词汇。

三个能力层级: L1 预测器处理单步状态转移,L2 模拟器执行多步动作条件展开,L3 演化器在环境变化时自我修正。该层级体系便于定位现有系统并识别真正的能力缺口。

四种定律体系: 物理定律、数字定律、社会定律和科学定律各自对世界模型提出不同约束。框架将它们视为正交维度,清楚解释了为何一个强大的物理模拟器在社会或数字任务上仍可能失败。

失败模式目录: 综述从 100 多个系统中提取了反复出现的失败模式,包括奖励塑造偏差、非平稳性下的漂移以及跨体系的脆弱迁移。每种失败模式都映射到具体的层级与定律组合,使诊断有据可依。

分层级评估原则: 作者为每个能力层级提出了专属评估标准,而非使用单一基准。这是正确的做法,因为 L1 的预测准确率与 L3 的自我修正质量根本无法在同一坐标轴上衡量。

4. RecursiveMAS:用潜空间递归取代文本通信

多智能体系统通常在每一步都传递完整的文本消息,导致 token 膨胀、延迟增加和上下文稀释,且这些问题随团队规模增长而加剧。RecursiveMAS 提出了一个不同的思路:如果智能体通过共享潜空间中的递归计算来协作,而非通过文本交流,会怎样?该系统将多智能体团队视为一个递归计算过程,每个智能体如同一个 RLM 层,迭代地将潜表示传递给下一个智能体,形成循环交互。少说话,多思考。

RecursiveLink 潜通信模块: RecursiveLink 模块生成潜在思维并在异构智能体之间直接传递状态,用内部表示替代自然语言消息,消除了每次协调步骤中重新编码和解析文本的开销。

内外循环学习: 训练算法使用内循环进行逐步潜表示更新,外循环进行团队级功劳分配,并在智能体间共享基于梯度的更新。这使联合优化变得可行,无需依赖手动调优的通信协议。

9 个基准上的强劲表现: 在数学、科学、医学、搜索和代码生成任务中,RecursiveMAS 平均准确率提升 8.3%,端到端推理加速 1.2 至 2.4 倍,token 使用量减少 34.6% 至 75.6%。效率提升的意义不亚于准确率的提升。

突破智能体通信瓶颈: 如果智能体间通信是下一个真正的瓶颈,潜空间递归是扩展协作最干净的方式之一。大规模运行多智能体系统的团队应将其视为一种严肃的设计替代方案,而非仅仅是研究上的新奇之物。

论文 | 推文

5. OneManCompany:像劳动力市场一样组织多智能体系统

如果你在构建多智能体系统,你大概率在搭建静态的组织架构图。本文认为它们应该更像一个劳动力市场。OneManCompany(OMC)用"人才(Talents)"——捆绑了技能和工具的可移植智能体身份——以及一个按任务动态招募智能体的"人才市场(Talent Market)"取代了固定团队。一种"探索-执行-审查"的树搜索机制对工作进行层级分解并向上聚合结果。在 PRDBench 上,OMC 达到 84.67% 的成功率,比此前 SOTA 高出 15.5 个百分点。

人才作为可移植身份: 一个"人才"将技能集、工具访问权限和行为先验捆绑为可复用的智能体身份。人才可以被雇佣到任何任务中而无需重新布线编排图,消除了预设多智能体流水线中的大部分脆弱性。

通过人才市场动态招募: 任务发布需求,市场根据能力匹配度和当前负载将人才分配到相应角色。这用按需组装取代了"为每个工作流设计一个团队"的标准模式,能随任务群体变化而自适应。

探索-执行-审查树搜索: 工作自顶向下分解为子任务,由招募的人才并行执行,然后沿树结构向上审查和聚合。该结构天然支持重试、分支和交叉验证,无需手动编写协调逻辑。

重要意义: 预设的多智能体流水线一旦任务偏离设计范围就会崩溃。将智能体视为可招募的劳动力,默认就能获得自组织和持续改进的能力——这正是开放式智能体系统所需要的。

论文 | 推文

6. SSL:技能的结构化表示语言

SKILL.md 文件将调用接口、执行流程和工具副作用混杂在一段自然语言中。随着技能注册表规模扩大,下游的发现和风险审查变得越来越脆弱。本文提出了 SSL,一种三层类型化 JSON 表示,灵感来源于 Schank 和 Abelson 关于脚本、MOP 和概念依赖的经典理论。基于 LLM 的归一化器可将现有 SKILL.md 文件自动转换为该结构,因此无需手动重写注册表即可完成迁移。

三层清晰分离: 调度层(Scheduling)捕获调用信号和触发条件,结构层(Structural)编码执行场景和顺序,逻辑层(Logical)指定原子操作及资源和副作用标注。这种分离使发现、风险评估和执行各自只需关注自己所需的层。

技能发现 MRR 从 0.573 跃升至 0.707: 将技能视为类型化结构而非散文,即使不进行任何模型微调,检索准确率也显著提升。增益来自于结构暴露了技能的实际功能,而非仅仅是它们的自我描述。

风险评估宏 F1 达 0.787: 逻辑层的资源标注使风险分类从 0.744 跃升至 0.787。审计人员现在可以直接推理副作用,而非从自由格式的散文中推断。

发布 6,184 个技能的语料库: 作者发布了包含 6,184 个归一化技能、403 个任务查询和 500 个风险标注技能的语料库。当技能注册表突破百万条目时,结构化表示是保持发现和审查可行性的唯一路径。

论文 | 推文

7. Latent Agents:将多智能体辩论蒸馏为单一模型

多智能体辩论能提升模型推理能力,但也会在产出答案之前消耗大量 token 生成冗长的对话记录。Latent Agents 通过两阶段微调流水线将整个辩论过程蒸馏进单个 LLM:模型先学习辩论结构,再通过动态奖励调度和长度裁剪将其内化。内化后的模型在匹配甚至超越显式多智能体辩论效果的同时,最多可节省 93% 的 token,使辩论级推理在生产规模下变得切实可行。

两阶段内化流水线: 第一阶段通过在对话记录数据上进行监督微调,教会模型辩论的结构(轮次交替、批评、修正)。第二阶段使用动态奖励调度和长度裁剪,将该结构压缩为单次推理过程,同时保留多智能体设置带来的增益。

最高节省 93% 的 token: 内化后的模型在大幅降低推理成本的同时,匹配或超越了显式辩论的准确率。对于大规模运行推理工作负载的团队而言,这种效率提升足以将一个研究想法变为部署默认方案。

激活引导揭示智能体子空间: "智能体"在蒸馏后作为激活空间中可识别的电路存活下来。探测发现了对应不同智能体视角的可解释方向,这意味着即使外部对话记录消失,内部结构依然存在。

值得关注的安全角度: 当恶意智能体通过蒸馏被故意嵌入时,负向引导能比引导基础模型更干净地抑制它们,且对通用性能的影响更小。内化辩论可能不仅仅是 token 节省器,还将成为有用的可解释性和对齐基础设施。

论文 | 推文

8. OCR-Memory:用视觉记忆解决智能体的上下文遗忘

大多数智能体记忆系统将轨迹压缩为文本摘要,然后寄希望于模型记住关键信息——而信息损失恰恰隐藏于此。OCR-Memory 将智能体的交互历史渲染为带有索引视觉锚点的图像,然后通过"定位-转录"流水线进行检索:模型扫描视觉记忆,预测相关区域的索引,再从数据库中逐字提取原始文本。较旧的轨迹以低分辨率缩略图存储,并支持主动回忆式上采样。该方法在严格上下文限制下,于 Mind2Web 和 AppWorld 上达到了 SOTA。

论文 | 推文

9. ReaLM-Retrieve:推理感知的动态检索

大多数 RAG 系统在模型开始推理之前只检索一次。而 o1、R1 等大型推理模型并非如此工作——它们生成 12k 到 25k token 的思维链,在推理中途遭遇知识缺口时,检索窗口早已关闭。ReaLM-Retrieve 是一个推理感知的检索框架,能在多步推理过程中注入证据,以推理步骤粒度检测不确定性,并学习一个策略来判断外部证据何时真正有帮助。在 MuSiQue、HotpotQA 和 2WikiMultiHopQA 上,它比标准 RAG 绝对 F1 提升 +10.1%,检索调用次数比固定间隔的 IRCoT 减少 47%,在 2-4 跳 MuSiQue 上以每个问题仅 1.8 次检索调用达到 71.2% 的 F1。

论文 | 推文

10. 决策与技能的协同演化框架

长时间跨度的智能体以两种方式失败:决策器无法良好分解任务,或者技能库变得过时。本文提出了一个协同演化框架,其中 LLM 决策智能体与动态技能库通过迭代精炼相互提升。决策智能体选择并链接技能,性能反馈同时更新策略和技能,新技能通过泛化成功序列自然涌现,而非预先手工编码。大多数长时间跨度智能体架构将技能和决策视为独立的优化问题,这正是它们陷入瓶颈的原因。协同演化通过单一循环同时提供自适应规划和不断增长的可复用行为库——这正是任务结构不可预设的场景(机器人、游戏智能体、复杂规划)所真正需要的。

论文 | 推文

© 2026

·

向阳乔木

📌 文中提及的人物和组织

关键字: agent-systems ai-research multi-agent-systems llm-optimization