标签:llm-as-a-judge
-
评估视频垃圾:Character.ai 如何重构 AI 视频生成评估体系
📝
🎙️ AI Engineer
📄 本文根据 Character.ai 工程师 Maor Bril 的分享整理。文章深入探讨了 AI 视频生成评估面临的挑战,详细介绍了 Character.ai 如何将评估方法从主观绝对评分转向相对对比(A vs B),如何通过蒸馏技术将复杂的“专家委员会”模型转化为超快速的轻量级视觉语言模型(VLM),以及如何利用 Agentic 工作流将评估机制前置并嵌入生成闭环中,从而实现低成本的视频自动校正与优化。
-
从信号到PR:构建自我修复的智能体与可观测性2.0时代
📝
🎙️ AI Engineer
📄 Arize创始人Jason Lopatecki探讨了可观测性在AI智能体时代的演进。他指出,传统面向人类的可观测性正转向面向智能体的“可观测性2.0”。通过遥测追踪、组合式技能以及安全沙箱,智能体能够自主定位代码路径并生成修复PR,重构了软件调试的工作流。
-
构建切实有效的 AI Agent 评估体系:Lyft 客服大模型系统的演进与实践
📝
🎙️ AI Engineer
📄 本文深入整理了 Lyft 在构建客服 AI Agent 系统过程中的评估体系演进。详细阐述了离线模拟器与在线评估的双阶段架构,分析了评估失败的核心原因,提出了微调用户模型以模拟真实非理性用户、将 LLM 评判器作为分类器进行精度校验以及建立持续错误分析闭环等核心实践,为企业级 Agent 的落地提供了系统化的方法论。
-
生产级 AI 行动指南:企业级智能体的部署与落地
📝
🎙️ AI Engineer
📄 本文基于 Databricks 技术负责人 Sandipan Bhaumik 的演讲整理,分享了将 AI 系统和智能体推向生产环境的五大核心支柱:评估、可观测性、数据基座、多智能体编排和治理,并通过零售银行聊天机器人的真实案例,详细阐述了如何构建可见、可衡量、可问责的生产级 AI 系统。
-
AI系统黑盒破局:可观测性、评估与自动化实验
📝
🎙️ AI Engineer
📄 Arize AI架构师Dat Ngo深入剖析了企业级AI应用开发的三大核心支柱:可观测性、系统评估与实验改进。文章详细拆解了如何通过OpenTelemetry追踪智能体轨迹,探讨了五种核心评估信号源,并展望了由AI自动完成评估与优化的软件工程新范式。
-
系统提示词学习:重构 AI 编码智能体的核心进化引擎
📝
🎙️ AI Engineer
📄 本文探讨了由 Andrej Karpathy 提出的“系统提示词学习”范式,对比了强化学习(RL)在数据效率上的局限性,提出利用 LLM-as-a-Judge 生成的自然语言反馈来驱动提示词迭代。通过在 SWE-bench 基准测试上对 Claude Code 和 Cline 进行实测,证明了该方法仅需少量样本即可显著提升智能体的工程问题解决能力。