标签:coding-agents
-
大模型价格战反常变局:Meta Muse Code低价绞杀与DeepSeek逆势涨价背后的算盘
📝
🎙️ Best Partners TV
📄 分析2026年8月6日AI圈的两大反常事件:Meta发布首款低价编程智能体Muse Code,而DeepSeek却宣布API涨价。文章深入拆解了Muse Spark 1.2模型的性能跑分、智能体运行时的设计细节,以及厂商以低价换取开发者代码数据的商业飞轮,揭示了AI编程赛道从“猜代码”走向“工程运行时”的时代变革。
-
GLM 5.2 深度评测:开源模型能否以 3.36 美元挑战 Opus 级编码能力?
📝
🎙️ How I AI
📄 本文深度评测了智谱 AI 的开源模型 GLM 5.2。通过代码库探索、前端设计重构和长时间自主 Bug 修复三个真实场景,验证了其接近 Opus 级别的推理能力。评测显示,该模型在 HTML/CSS 设计和后端自主任务上表现出色,但在 React/TypeScript 编写上存在明显短板。最终以 3.36 美元处理 600 万 Token 的成本,证明了开源模型在特定场景下对商业 API 的替代潜力。
-
AI 时代的软件工程:利用智能体应对复杂架构与自动评估
📝
🎙️ How I AI
📄 在本期播客中,Braintrust 首席执行官 Ankur Goyal 深入探讨了如何将 AI 智能体应用于高度复杂的架构和基础设施问题。他们不仅详细解析了自动化评估(Evals)的重要性与实操细节,还分享了如何优化开发者工作流、强化持续集成(CI),以及为何优秀的工程团队必须将构建数据反馈循环作为核心任务。
-
从评估到训练:构建真实世界代码智能体的经验与挑战
📝
🎙️ AI Engineer
📄 Nebius 的研究员 Ibragim Badertdinov 分享了通过其 SWE-Rebench 排行榜评估代码智能体的宝贵经验。他强调,在模型能力飞速发展的今天,依赖直觉或简单测试选择模型是危险的,尤其是在生产环境中。报告深入探讨了构建一个可靠、无污染(decontaminated)的软件工程任务评估基准所面临的挑战,例如如何定义和筛选高质量的真实世界任务、模型如何通过“作弊”(如查看未来 Git 历史或直接网络请求答案)来破解评估,以及如何设计能够捕捉这些行为的强大基础设施。最终,他指出,一个优秀的评估流水线不仅能用于模型选型,更能转化为高质量的训练数据集,从而推动更强大、更可靠的代码智能体的诞生,并指明了未来需要关注长时程任务和代码质量等方向。
-
Anthropic 营收神话:300亿美金背后的 AI 军备竞赛、Mythos 安全博弈与中东地缘政局
📝
🎙️ All-In Podcast
📄 本期访谈深度剖析了 Anthropic 令人惊叹的财务增长——营收从 10 亿暴涨至 300 亿美金,标志着 AI 商业化的爆发。Besties 讨论了 Anthropic 扣留 Mythos 模型的“安全营销”策略,以及其与 OpenClaw 的竞争黑幕。此外,节目还探讨了特朗普推动下的伊朗停火协议,以及 X 平台自动翻译功能对打破地缘政治信息壁垒的深远影响。
-
AI未终结Web,而是与Web共生共荣
📝
🎙️ AI Engineer
📄 本次会议探讨了AI创新如何改变Web开发,从AI编码代理、调试工具集成、浏览器内置AI API到代理化Web应用。演讲者展示了AI如何通过技能实现自动化编码工作流、通过Chrome DevTools MCP控制浏览器进行性能分析,以及如何利用Web AI API在本地浏览器进行文本摘要、校对和多模态Prompt交互。最后,他们讨论了LLM.txt和Web MCP等新提案,旨在优化网站以适应未来的AI代理浏览,强调了Web开发者需要适应这一新趋势。
-
OpenAI的极致Harness工程实践:AI智能体驱动的软件开发与企业级部署
📝
🎙️ Latent Space
📄 本次访谈深入探讨了OpenAI Frontier团队如何通过极致的Harness工程实现由AI智能体驱动的软件开发,达到前所未有的生产力。Ryan Lopopolo分享了其团队在零人工代码、百万行代码库的内部工具开发中,如何通过Prompt工程、系统思维和持续的智能体行为调整,克服模型局限性并实现高度自动化。对话还涵盖了AI在代码审查、协作、依赖管理及企业级平台(Frontier)中的应用,展示了AI智能体如何改变软件工程的未来。
-
AI代理与软件的未来:Peter Yang深度解析
📝
🎙️ a16z
📄 本次访谈深入探讨了AI代理(Agent)的兴起,特别是OpenClaw和Claude Code等工具的应用。嘉宾Peter Yang分享了他对编码代理如何重塑知识工作、颠覆SaaS模式的看法。对话触及了AI对公司结构、工作体验的潜在影响,以及未来企业和个人如何适应这一变革。此外,还讨论了AI在提升生产力、改变用户交互方式以及创业新模式方面的机遇与挑战。
-
编程智能体的核心组件【译】 | 宝玉的分享
🎙️ baoyu.io
📄 本文深入剖析了编程智能体(Coding Agent)及其配套的运行框架(Coding Harness)的核心组件。文章区分了大语言模型、推理模型与智能体,并阐述了 Harness 如何通过代码库上下文、提示词缓存、工具调用、上下文瘦身、会话记忆及任务委派等功能,极大地增强 LLM 在软件开发中的实用性。作者以其开源项目 Mini Coding Agent 和 Claude Code、Codex CLI 为例进行说明。
-
Notion 联合创始人 Simon Last:我从去年夏天起就没写过一行代码了 | 宝玉的分享
🎙️ baoyu.io
📄 本文访谈 Notion 联合创始人 Simon Last,深入探讨了 Notion AI 的演进历程,从写作助手到通用 Agent 的开发挑战与策略。文章强调了 AI 系统需要持续重写以适应模型进步,编码 Agent 是 AGI 的核心且彻底改变了 Simon 的工作方式,使其成为 Agent 管理者。Notion 奉行“模型界瑞士”策略,不绑定厂商,并为 Agent 重新设计了 API。其核心使命已转变为“管理 Agent 替人做事”,预示着生产力工具的新范式。
-
Simon Willison:编码助手的高效工程实践与未来展望
📝
🎙️ The Pragmatic Engineer
📄 本次访谈深入探讨了 Simon Willison 在人工智能时代下的开发者工作流演变。他分享了如何利用编码助手进行测试驱动开发(TDD)、遵循规范进行开发,并警示了提示注入等安全风险。访谈还触及了沙盒技术的重要性、AI 对软件开发模式的影响,以及对开源社区未来的思考,并回顾了使用现代技术重构 Django 的设想。
-
编程 Agent 如何重塑工程、产品和设计 | 宝玉的分享
🎙️ baoyu.io
📄 这篇文章探讨了编程 Agent 如何深刻重塑软件公司的工程(Engineering)、产品(Product)和设计(Design)部门(EPD)。文章指出,编程 Agent 极大地降低了代码实现成本,导致传统 PRD 流程的终结,瓶颈从实现转向评审,并提升了通才和系统思维的重要性。作者强调,使用编程 Agent 已成必选项,优秀的 PM 和设计/工程能力会更有价值,每个人都需要产品意识,专业化门槛提高。最终,EPD 角色将融合,形成“建设者”和“评审者”两类新角色。
-
在煮担担面中聊透 Context Engineering:HumanLayer 创始人 Dex Horthy 访谈录
📝
🎙️ Latent Space
📄 HumanLayer 创始人 Dex Horthy 在《In-Context Cooking》节目中,边下厨边分享了其在 AI 上下文工程(Context Engineering)领域的深度见解。他探讨了模型能力的边界、‘愚蠢区’(Dumb Zone)的规避、AI 工程师的直觉培养,以及软件工程师角色如何从‘编写代码’向‘促成代码生成’转型的趋势。
-
Coding Agent 有个甜蜜点,多数人直接跳过了 | 宝玉的分享
🎙️ baoyu.io
📄 本文通过 Simon Willison 和 Cloudflare 的案例,深入探讨了 Coding Agent 的“甜蜜点”。文章总结出四个关键要素:明确的参照物、自动化验证、架构蓝图以及人来把控方向。遵循这些原则能极大提升 AI 编程的效率和质量。