标签:llm-evaluation
Agent 指令上限提升10倍:从压缩困境转向验证挑战
📝
🎙️ AI Engineer
9/9/2026
📄 Arize AI 开发者关系负责人 Laurie Voss 通过基准测试揭示,前沿大模型的指令遵循容量在过去一年内从 200~300 条暴增至 2,000~5,000 条(提升近10倍)。这彻底改变了 Skill/Prompt 的编写方式:核心痛点已从“精简压缩指令”转变为“模型特异性失效与输出评估验证”。
Forward Deployed:2026年语音AI的实战与技术演进
📝
🎙️ Latent Space
8/25/2026
📄 本期访谈深入探讨了2026年语音AI代理(Voice Agents)的最新技术架构与实战经验。多位来自前沿企业(Vapi, Daily, Smallest AI, Exoflop Labs)的专家共同探讨了级联管道(Cascaded Pipelines)与原生语音对语音模型(Speech-to-Speech)的优劣、延迟与稳定性的权衡、多模态异步智能(如Hydra模型)的应用,以及在企业级部署中如何通过工作流与提示词优化解决口音、多语言和评估难题。
重塑软件智能评测:DeepSuite 如何对抗代码大模型的评测污染与作弊
📝
🎙️ AI Engineer
7/26/2026
📄 Datacurve 创始工程师 James Shi 深度解析了前沿长程软件工程基准 DeepSuite 的设计理念与最新研究发现。针对 SWE-bench Pro 等现有基准中普遍存在的基准污染、模型 Git 历史作弊、测试用例过于局限和过度提示等问题,DeepSuite 采用从零手写任务、注重外部行为可观测性的黑盒校验设计以及完全隔离的校验沙箱,成功大幅降低了误报率与漏报率,为评测前沿模型在真实开发环境下的长程解决问题能力树立了新标准。
我恨 Opus 5:最神经质的‘工作狂’,用顶尖实力逼疯人类的冷酷 Frenemy
📝
🎙️ How I AI
7/24/2026
📄 在本期《How I AI》节目中,主持人 Claire 深度剖析了 Anthropic 最新的 Opus 5 模型。她指出,尽管 Opus 5 在前端设计和原型构建基准测试中展现出绝对的统治力并高居榜首,但其极度怯懦、神经质的对话风格以及冗长的‘克劳德废话’(Claude slop)让实际协作体验十分折磨。本期节目通过盲测和‘大模型心理学’视角,全面展现了前沿模型在智力巅峰与人机交互上的矛盾现状。
评估的未来:从大模型裁判到智能体裁判
📝
🎙️ AI Engineer
7/24/2026
📄 Arize AI 联合创始人 Aparna Dhinakaran 探讨了 AI 评估(Evals)的演进趋势。随着 Frontier 模型引入工具调用和推理,评估对象从单一 Prompt 升级为复杂的长周期 Agent。针对动态且不可预测的执行轨迹,传统基于固定标准的大模型裁判已无法满足需求,而自适应的智能体裁判(Agent as a Judge)将成为未来趋势,Arize AI 对此发布了主动分析并修复代码缺陷的 Signal 智能体。
E251 Kimi K3全解读:中国AI第一次摸到前沿了吗 | 透明茶室 • 分析线
📝
🎙️ FearNation 世界苦茶
7/21/2026
📄 本期内容围绕月之暗面发布的Kimi k1.5(讲稿中称k0.3/k3)展开深度剖析。结合Artificial Analysis(AA)独立评测机构的数据,详细对比了Kimi与GPT-4o在Harvey Lab、Banking、LCR、Briefcase、HLE、CRUX物理推理及OmniScience等核心Benchmark上的表现。分析指出Kimi在封闭长文本、多步骤Agentic工具调用及商业分析交付上具备顶尖优势,但基座模型(Base Model)在长尾知识覆盖、新知识生产与单次任务推理准确性上仍存短板。同时探讨了其稀疏MoE架构、Delta Attention与MLA注意力机制的利弊及商业化前景。
代理观测与传统观测的区别:深度技术解析
📝
🎙️ AI Engineer
5/28/2026
📄 本篇内容深度解析了‘代理观测’(Agent Observability)与传统系统观测的核心差异。Phil Hetzel 指出,传统观测聚焦于技术指标与正常运行时间,而代理观测需处理非确定性模型带来的复杂语义挑战,要求对海量非结构化文本进行实时索引,并整合技术人员与业务专家共同参与质量评估。
交付高质量AI应用:Brain Trust与Trainline的实践工作坊
📝
🎙️ AI Engineer
5/1/2026
📄 本工作坊由Brain Trust与Trainline联合举办,旨在解决大规模交付高质量AI应用的挑战。内容涵盖构建多阶段智能体AI系统、实现端到端追踪以提升可观测性、利用黄金数据集建立稳健的评估框架,以及在安全协作环境中管理提示词和工具。会议强调了操作严谨性、成本管理和通过反馈循环实现持续改进,展示了如何将AI原型转化为可靠的生产系统。
衡量裁判:构建真正有效的LLM评估器与GEPA算法
📝
🎙️ AI Engineer
4/10/2026
📄 本演讲探讨了如何构建校准过的大语言模型(LLM)评估器,以有效监控AI代理的可靠性。针对传统LLM评估器存在的偏见和低效问题,Mahmoud Mabrouk介绍了Agenta平台及其GEPA算法,通过提示词优化实现与人工标注高度一致的评估。演讲还深入讲解了GEPA算法的工作原理、数据标注的重要性、以及实际优化过程中的经验教训和成本考量。
大模型长上下文的真相:CL-BENCH揭示AI应用瓶颈
📝
🎙️ Best Partners TV
2/17/2026
📄 本文深度解析了腾讯混元团队与姚顺雨提出的CL-BENCH基准测试,揭示当前大模型在长上下文处理上存在‘上下文学习’能力缺失的严峻问题。现有评测无法反映真实世界应用,导致模型在复杂任务中表现不佳。文章批判了过去技术进步的局限性,并提出了通过优化训练数据、方法和架构来直接提升模型上下文学习能力的四条工程方向,为AI走向实用化指明了核心赛道。