标签:observability
-
从单体到多智能体:Navan 生产级 AI Agent 架构演进与落地实践
📝
🎙️ AI Engineer
📄 Navan 首席架构师 Roberto Milev 与架构团队成员 Uday 分享了生产级 AI Agent 的参考架构演进。内容涵盖运行时持久化、动态上下文与技能管理、基于轨迹评估与 Hooks 的可观测性体系、企业级安全护栏,以及从单 Agent 渐进式加载到 A2A 协议的编排权衡。 -
从轨迹到模拟:智能体评估与优化的新范式
📝
🎙️ AI Engineer
📄 Snorkel AI 平台团队负责人 Rustem Feyzkhanov 探讨了将生产环境中的智能体轨迹(Traces)转化为离线模拟(Simulations)的工程实践。通过构建贴近真实业务的私有基准测试,团队能够引入成本、延迟等多维指标,建立可靠的发布门禁与持续优化闭环。 -
从信号到PR:构建自我修复的智能体与可观测性2.0时代
📝
🎙️ AI Engineer
📄 Arize创始人Jason Lopatecki探讨了可观测性在AI智能体时代的演进。他指出,传统面向人类的可观测性正转向面向智能体的“可观测性2.0”。通过遥测追踪、组合式技能以及安全沙箱,智能体能够自主定位代码路径并生成修复PR,重构了软件调试的工作流。 -
评估的未来:从大模型裁判到智能体裁判
📝
🎙️ AI Engineer
📄 Arize AI 联合创始人 Aparna Dhinakaran 探讨了 AI 评估(Evals)的演进趋势。随着 Frontier 模型引入工具调用和推理,评估对象从单一 Prompt 升级为复杂的长周期 Agent。针对动态且不可预测的执行轨迹,传统基于固定标准的大模型裁判已无法满足需求,而自适应的智能体裁判(Agent as a Judge)将成为未来趋势,Arize AI 对此发布了主动分析并修复代码缺陷的 Signal 智能体。 -
重构智能体:通过三层解耦与持久执行层突破半衰期瓶颈
📝
🎙️ AI Engineer
📄 本文深度解析了智能体系统架构快速迭代下的应对之道,提出了将系统解耦为执行层、上下文层和计算层的三层模型。文章重点论述了执行层在状态持久化、断点续传、柔性编排原语及全链路可观测性中的关键作用,并展示了如何通过自适应审查闭环与基于业务结果的评分机制实现智能体的自我迭代。 -
停止空转 Token:为什么智能体自我进化需要注入领域专家经验
📝
🎙️ AI Engineer
📄 本文探讨了如何构建高效的 AI Agent 自效优化循环。Langfuse 的 Annabell Schäfer 指出,传统的宽泛评估指标由于缺乏确定性,难以作为有效的反馈信号。为了避免 Token 的无谓消耗,开发者应与领域专家紧密合作,将行业经验提炼为高强度的确定性“是/否”评估器与具体案例,从而引导 Agent 围绕特定边界进行精准、渐进的自我迭代与泛化验证。 -
生产环境中的AI Agent:OpenGov如何构建与规模化OG Assist
📝
🎙️ AI Engineer
📄 本文详细介绍了OpenGov在生产环境中构建和规模化AI Agent系统(OG Assist)的实战经验。团队放弃了LangGraph,全面转向基于TypeScript Effect库的自研Agent循环,实现了高细粒度的并发控制、日志追踪和错误处理。同时,文章探讨了Google的A2A协议应用、隔离安全沙箱机制、长上下文滚动摘要管理,以及运行时的生成式UI设计,为企业级Agent的落地提供了系统化的技术参考。 -
AI商业发展暗藏4大前瞻趋势!提前埋伏这些机会,押注下一轮AI暴涨?
📝
🎙️ 美投讲美股
📄 本期视频深度梳理了财报季AI应用层软件公司的前沿动态,指出互联网流量结构正从人主导转向AI Agent主导,企业内部Agent爆发带来了AI Observability监测与身份权限管理的新需求,客户正从无脑充AI转向关注ROI并倒逼按结果收费的定价模式,同时AI原生企业的集体崛起为数据库、监控和云服务商带来了不俗的增长点。 -
生产级 AI 行动指南:企业级智能体的部署与落地
📝
🎙️ AI Engineer
📄 本文基于 Databricks 技术负责人 Sandipan Bhaumik 的演讲整理,分享了将 AI 系统和智能体推向生产环境的五大核心支柱:评估、可观测性、数据基座、多智能体编排和治理,并通过零售银行聊天机器人的真实案例,详细阐述了如何构建可见、可衡量、可问责的生产级 AI 系统。 -
自驱动产品:从“产品信号”到“自动生成 Pull Request”
📝
🎙️ AI Engineer
📄 PostHog 工程师分享了如何通过 AI 智能体将“产品观测数据”直接转化为可合并的 Pull Request。文章深入探讨了“信号注入”、“基于语义的分组”、“沙盒研究”以及自动化修复的工程实践,并总结了评估机制和嵌入模型优化的核心经验。 -
AI系统黑盒破局:可观测性、评估与自动化实验
📝
🎙️ AI Engineer
📄 Arize AI架构师Dat Ngo深入剖析了企业级AI应用开发的三大核心支柱:可观测性、系统评估与实验改进。文章详细拆解了如何通过OpenTelemetry追踪智能体轨迹,探讨了五种核心评估信号源,并展望了由AI自动完成评估与优化的软件工程新范式。 -
AI Agent 评估实战:从“氛围感”驱动转向工程化闭环
📝
🎙️ AI Engineer
📄 本文基于 Arize AI 开发者体验负责人 Laurie Voss 的深度分享,系统性地阐述了 AI Agent 的评估(Evals)体系。文章探讨了从 Trace 追踪到代码评估、LLM 评判(LLM-as-a-judge)及元评估的全流程,并提出了“数据质量 > 提示词 > 模型”的优化层级,旨在解决 AI 开发中难以量化和回归的问题,助力开发者建立可靠的 Agent 迭代飞轮。 -
产品工程中的 LLM 实践:Cronulla 的经验教训与创新之路
📝
🎙️ AI Engineer
📄 本文探讨了在产品工程中集成大型语言模型(LLM)所面临的挑战,特别是通用 LLM 功能在实际应用中的局限性,如输出不符需求、工具调用成本与稳定性问题。演讲者分享了 Cronulla 公司如何通过构建自定义追踪工具来增强 LLM 可观测性,以及如何为桌面应用开发创新的 Web Shell,实现高效测试和迭代。核心观点是,成功的 LLM 集成依赖于细致的迭代和反馈循环,而非简单的“一枪毙命”式优化,最终目标是为用户创造无缝、直观的体验。 -
Ramp 如何构建自维护软件:AI 驱动的自动化与可观测性深度解析
📝
🎙️ The MAD Podcast with Matt Turck
📄 本次分享深入探讨了 Ramp Labs 如何通过 AI 自动化软件开发生命周期,从代码编写转向维护,并介绍了其自研的 'Inspect' 代理及基于 'Monitors' 的动态可观测性系统。演讲者分享了构建自维护软件的关键洞察,强调了信号-噪声比、客户同理心以及构建软件工厂的重要性,为行业提供了前瞻性的视角。 -
AI Agent堆栈的演变:LangChain CEO Harrison Chase谈代理、框架与未来
📝
🎙️ The MAD Podcast with Matt Turck
📄 LangChain创始人兼CEO Harrison Chase深入探讨了AI代理技术的演变,从早期模型局限到当前代理架构的突破。他详细阐述了代理核心组件,如系统提示、规划工具、子代理、文件系统和技能,并强调了Harness(代理线束)在模型应用中的关键作用。对话还涵盖了不同类型的代理(对话型与长周期型)、上下文压缩、记忆机制、沙盒安全以及LangChain的产品演进和未来发展方向,为AI开发者提供了构建高效、可靠代理的洞见。 -
AI Agent 2025:行业报告解读与落地趋势
📝
🎙️ Best Partners TV
📄 本报告基于LangChain2025年调查,深入分析AI Agent的生产部署现状、企业规模与行业应用差异、核心痛点(质量、延迟、安全),强调可观测性与评估的重要性,并探讨模型选择与个人使用趋势,揭示Agentic Everything的早期阶段。