标签:evaluation-metrics
多模态模型的价值,不在看懂图,在会自己去看
🎙️ yage.ai
8/30/2026
📄 文章探讨了多模态模型的核心价值在于其自主行动能力,即模型不再是被动地接收输入,而是能够自主决定何时观察、聚焦哪个区域、并根据观察结果主动调用工具进行修正和迭代。这标志着视觉能力从单纯的输入通道转变为模型自主决策的行动步骤,并强调了从静态流程向具备自我验证闭环的 Agentic 模式的转变,以及相应的训练和评估范式的调整。
停止空转 Token:为什么智能体自我进化需要注入领域专家经验
📝
🎙️ AI Engineer
7/18/2026
📄 本文探讨了如何构建高效的 AI Agent 自效优化循环。Langfuse 的 Annabell Schäfer 指出,传统的宽泛评估指标由于缺乏确定性,难以作为有效的反馈信号。为了避免 Token 的无谓消耗,开发者应与领域专家紧密合作,将行业经验提炼为高强度的确定性“是/否”评估器与具体案例,从而引导 Agent 围绕特定边界进行精准、渐进的自我迭代与泛化验证。
对话 OpenAI 首席研究官 Mark Chen:关于 AGI、o1、评估危机与 Scaling Laws 的深度探讨
📝
🎙️ Latent Space
6/25/2026
📄 在这期特殊的 Latent Space 烹饪访谈中,OpenAI 首席研究官 Mark Chen 与主持人 Alan 边做韩国豆腐汤边畅谈 AI 前沿。对话涵盖了交易员背景对 AI 研究的独特价值、通过复现经典论文培养研究品味、o1 模型背后的强化学习探索过程、面临饱和的评估标准危机,以及大模型如何从“氛围研究”迈向全自动的端到端研究等核心议题。
从流量控制到任务调度:AI Agent 开发范式转换
📝
🎙️ AI Engineer
5/30/2026
📄 Philipp Schmid 在 Google DeepMind 的实践经验基础上,深度解析了构建 AI Agent 与传统软件工程的五个核心差异,包括从确定性流程到目标导向、语义化状态管理、错误处理机制、从单元测试到评估体系的演进,以及 API 设计原则的变革。
构建与优化提示词学习循环
📝
🎙️ AI Engineer
1/6/2026
📄 本次访谈深入探讨了提示词学习(Prompt Learning)的构建与优化,强调其在AI智能体(Agent)开发中的关键作用。演讲者详细介绍了提示词学习如何通过结合人类反馈和LLM评估来动态改进系统提示词,从而提升智能体的可靠性和性能。通过一个编码智能体的案例研究,展示了仅通过添加规则而非微调或架构更改即可实现显著性能提升。讨论还涵盖了提示词学习与传统强化学习、元提示词以及GA优化方法的对比,并强调了高质量评估在整个优化过程中的重要性。最后,提供了构建JSON网页提示词优化循环的实践指导。