标签:agent-evaluation
鼠力隐喻与心智模型:破解 AI Agent 的价值度量困局
📝
🎙️ AI Engineer
9/10/2026
📄 Yutori 创始设计师 Maximillian Piras 探讨了当前 AI Agent 面临的核心瓶颈:能力增长与价值度量之间的脱节。类比瓦特发明'马力'来破除用户对蒸汽机的认知阻碍,文章提出了'鼠力'(Mouse Power)概念,并基于香农信息熵构建了涵盖'执行步骤不确定性'与'验收标准不确定性'的二维评估矩阵,指出理想的 Agent 场景应具备类似 NP 问题的特征——验证难度远低于执行难度,从而实现以算力速度度量价值。
高效电商 AI 智能体解剖指南 | 选自 Anthropic 的 Claude 博客 | 宝玉的分享
🎙️ baoyu.io
9/2/2026
📄 本文是一份关于构建高效电商 AI 智能体的解剖指南,重点探讨了架构设计、延迟与成本优化、生产环境中的记忆管理、安全性约束以及评估实践。核心思想是优先使用技能而非子智能体,将 UI 组件工程化为工具,并通过提示词缓存、模型选择和严格的评估套件来平衡模型智商、延迟和成本,最终实现用户体验和业务指标的统一。
从单体到多智能体:Navan 生产级 AI Agent 架构演进与落地实践
📝
🎙️ AI Engineer
8/29/2026
📄 Navan 首席架构师 Roberto Milev 与架构团队成员 Uday 分享了生产级 AI Agent 的参考架构演进。内容涵盖运行时持久化、动态上下文与技能管理、基于轨迹评估与 Hooks 的可观测性体系、企业级安全护栏,以及从单 Agent 渐进式加载到 A2A 协议的编排权衡。
重构长视界任务的强化学习环境:Theta Software 的探索与实践
📝
🎙️ AI Engineer
8/1/2026
📄 本访谈由 Theta Software 联合创始人团队分享,深入探讨了人工智能代理在长视界(Long-Horizon)任务中的评估与训练环境重构。讨论涵盖了 METR 等基准的局限性、模型与人类评估尺度的差异,并系统性地提出了利用评判代理(Judge Agents)、可查询轨迹(Queryable Trajectories)和高密度评估红线(Rubrics)来提升模型在复杂软件及金融领域学习能力的核心设计原则。
从轨迹到模拟:智能体评估与优化的新范式
📝
🎙️ AI Engineer
7/25/2026
📄 Snorkel AI 平台团队负责人 Rustem Feyzkhanov 探讨了将生产环境中的智能体轨迹(Traces)转化为离线模拟(Simulations)的工程实践。通过构建贴近真实业务的私有基准测试,团队能够引入成本、延迟等多维指标,建立可靠的发布门禁与持续优化闭环。
评估的未来:从大模型裁判到智能体裁判
📝
🎙️ AI Engineer
7/24/2026
📄 Arize AI 联合创始人 Aparna Dhinakaran 探讨了 AI 评估(Evals)的演进趋势。随着 Frontier 模型引入工具调用和推理,评估对象从单一 Prompt 升级为复杂的长周期 Agent。针对动态且不可预测的执行轨迹,传统基于固定标准的大模型裁判已无法满足需求,而自适应的智能体裁判(Agent as a Judge)将成为未来趋势,Arize AI 对此发布了主动分析并修复代码缺陷的 Signal 智能体。
YouTube Ads 团队分享:如何通过评估系统(Evals)与提示词塑造 Agent 的行为
📝
🎙️ AI Engineer
7/24/2026
📄 本文是 YouTube Ads 团队专家关于构建生产级 Agent 评估系统(Evals)的深度分享。文章详细阐述了如何从优化基础工具集、初期的直觉评估(Vibing)阶段,逐步过渡到人类评估与 LLM 裁判的规模化评估,并重点探讨了通过 Trace 分析排查非确定性问题以及 launch 指标爬坡的实践路径。
构建切实有效的 AI Agent 评估体系:Lyft 客服大模型系统的演进与实践
📝
🎙️ AI Engineer
7/19/2026
📄 本文深入整理了 Lyft 在构建客服 AI Agent 系统过程中的评估体系演进。详细阐述了离线模拟器与在线评估的双阶段架构,分析了评估失败的核心原因,提出了微调用户模型以模拟真实非理性用户、将 LLM 评判器作为分类器进行精度校验以及建立持续错误分析闭环等核心实践,为企业级 Agent 的落地提供了系统化的方法论。
SWE-Marathon:十亿 Token 预算下的长航时软件工程 Agent 评测
📝
🎙️ AI Engineer
7/7/2026
📄 Abundant AI 的 ML 工程师 Rishi Desai 介绍了针对编码 Agent 的全新长航时基准测试 SWE-Marathon。该基准用于评估 Agent 在面对十亿级别 Token 预算和项目级任务(如从头构建 Slack 复制品、C 编译器,或重写整个框架)时的协调与控制能力。目前最强配置(Opus 4.8 + Claude Code)仅能达到 26% 的解决率,且长航时测试也引入了更为复杂的“奖励作弊(Reward Hacking)”与“验证码规避”攻击面。研究表明,长航时智能体的核心瓶颈在于鲁棒的多通道验证和反作弊防御。