Agent Harness的独立价值将下降
大家好,这里是最佳拍档,我是大飞。Google DeepMind的核心负责人洛根·吉尔帕特里克(Logan Kilpatrick)在最近红杉资本的访谈里抛出了一个很值得琢磨的判断:现在整个行业都在扎堆搭建的Agent Harness,再过12个月就会变得一文不值。这话听起来有点反常识,毕竟现在不管是大公司还是创业团队都把Agent Harness当成核心壁垒,觉得模型本身大家差距不大,编排和脚手架才是真正的alpha来源。如果这个判断成立,那么接下来一年里很多团队的技术投入方向可能都要重新调整了。
Agentic AI的时代定义与主线升级
我们先从Agentic AI这个大话题说起。今年Google I/O的开场,桑达尔直接把当下定义成了“Agentic Gemini时代”。很多人可能觉得这是个新提法,但其实在Gemini 2.0的时候Google就提过相关概念,只是那时候技术还没到落地的火候,到了Gemini 3.5这个阶段才真正到了产品化落地的节点。现在对Google来说,所有的Gemini相关产品本质上都是Agent产品,而支撑这一切的底层主线就是Antigravity这套Agent Harness。
这条主线和之前的Gemini有什么区别呢?应该说,过去Google五十多款产品里贯穿始终的技术主线是Gemini大模型本身,所有产品都是接入模型能力;而现在,主线升级成了Antigravity,所有产品都在往Agent原生的方向重构。从搜索、Gemini App到云服务、AI Studio底层用的都是同一套Harness,相当于从“模型贯穿”升级成了“Agent Harness贯穿”。
很多人以为Antigravity就是一个编程IDE,其实不是。洛根说,它是一整个生态,除了核心的IDE,还有面向网页端的Agent优先体验,还有命令行工具和开发套件,甚至你直接通过Gemini API就能调用它的托管Agent不用自己搭基础设施。更关键的是,它不是一个独立的开发者工具,而是Google全产品线的Agent底座。搜索里的Agent功能、消费级产品里的智能助理底层跑的都是同一套框架。当然这套底座也不是完全一刀切的,大概80%的基础能力是通用的,剩下20%会根据不同场景做专门优化。比如AI Studio里用的版本会针对编程场景做深度定制,而Gemini App里面向普通用户的7x24小时智能助理就会偏向消费级场景的交互逻辑,本质上是同一个基础框架长出的不同分支。
AI对搜索与业务的增量效应
聊到这儿自然会带出一个很多人都关心的问题:Agent能力越来越强,会不会反过来蚕食Google自己的现有业务呢?比如以后Agent直接帮你查邮件、回消息,用户都不用自己打开邮箱了,那产品的用户停留时长不就下降了吗?放在搜索上也是一样,以前用户要翻好多页搜索结果,现在AI直接给答案,大家搜得少了怎么办?
洛根的看法刚好相反,他觉得AI对搜索不仅不是零和,反而是极其正和的游戏。实际数据显示,有了AI之后,人们搜索的次数反而更多了,能做的事情也更多了。而且除了人在搜索,Agent本身也会产生大量的搜索需求,相当于凭空多出来一个全新的市场。虽然每个人的时间总量是有限的,但是从整个生态的价值创造来看,AI带来的增量远大于存量的减少。而且从产品的本质来说,做技术的初衷本来就是帮用户把事情做完,好让他们去过自己的生活,所以Google的战略方向已经从过去的“最大化用户眼球停留时间”慢慢转向**“最大化客户的成果”**。用户能用产品更快更好地完成目标本身就是产品的成功,不一定非要盯着停留时长看。
Agent落地阶段与产品形态演进
说到这儿可能有人会好奇,Google全线产品都在做Agent化,那现在到底做到什么程度了呢?访谈里用了爬行、行走、奔跑三个阶段来划分,洛根的判断是整体还处在爬行阶段。这个其实也很好理解,Google有13个十亿级用户的产品,每一步改动都影响亿级用户,不可能激进推进。大部分用户其实还没准备好把所有事情都交给AI处理,更愿意自己掌控节奏慢慢尝试。所以像搜索这样的核心产品都会走得格外谨慎,保证用户能跟上节奏而不是突然彻底改变产品的使用逻辑。
相对走得更靠前的,一个是Gemini App里面的Spark Agent可以7x24小时帮用户执行一系列操作,已经很接近行走阶段了;另一个就是Antigravity里面的自主编程Agent已经能处理数十亿token的任务,甚至能自主重构操作系统,属于非常前沿的探索。整体来说,DeepMind团队在往前探路,其他产品线跟着逐步落地是个渐进推进的节奏。
聊到产品形态,还有个很有意思的观点:现在很多人都在聊生成式UI,觉得以后所有界面都是AI动态生成的,听起来很酷,但洛根觉得这其实会给用户带来更多认知负担。你想想,我们平时用日历App点进去就知道日程在什么位置,用久了形成肌肉记忆,不用费脑子;如果每次打开界面都是AI重新生成的,每次布局都不一样,反而要花精力去适应。产品的分门别类和专业化不是没有道理的,不同工具对应不同需求,确定性的体验反而是用户真正需要的。所以他认为未来大概率不会出现一个包揽所有事的超级产品,还是会有不同领域的专业产品各自做好自己的场景。
编程Agent与模型迭代的驱动力
接下来我们聊到大家最关心的编程领域,这也是目前Agent落地最成熟的赛道。现在行业里有个普遍的感受说来说去真正能跑通的Agent好像只有编程Agent,洛根也认可这个观察,核心原因还是其他领域的模型质量还没跨过可用的阈值,解决不了复杂问题。但这个情况也正在快速变化。一个很直观的指标就是Agent任务的持续时长:现在新模型一发布,对应的长任务数据就在飙升,虽然整体基数还不高,但已经能看到往长时任务发展的明显趋势。可能很多企业还没感觉到编程之外的变化,不过今年之内应该就能感受到很多其他场景的Agent体验都会上一个台阶。
对DeepMind来说,长程Agent本身就是非常核心的KPI,尤其是编程Agent,更是重中之重,因为强大的编程模型本身就是所有业务的加速器,能帮其他领域更快地迭代产品。访谈里主持人也问了个很尖锐的问题:现在开发者圈子里用Claude和Codex的人很多,很少听到有人用Gemini做编程Agent,这是为什么?洛根没有回避这个问题,他先拉了个时间线:去年12月Gemini 3刚发布的时候,行业叙事还是Google在模型能力上的大幅领先,结果假期之后Agent编程的赛道突然爆发,市场的风向很快就变了。而Google在这个领域起步慢,核心原因其实不是模型能力不行,而是缺少一个能跑长任务的产品载体。做编程Agent的人应该都懂,长任务的运行数据是打磨模型最好的养料,如果你没有一个真正被开发者高频使用、能持续跑长任务套件的产品就拿不到真实的反馈数据,编程模型就很难迭代到最好用的状态。Google之前缺的就是这个环节,所以才会收购Windsurf组建Antigravity团队,本质上就是补全这个产品飞轮。现在内部的编程团队被他形容成为是“AI界的复仇者联盟”,都是Google内部最顶尖的人才在全力推进这个方向。而且有个很值得关注的点,刚发布的Gemini 3.5 Flash纯靠后训练优化,编程能力就超过了之前所有的Pro版本模型,这说明不用靠更大规模的预训练,只靠后训练就能实现能力跃升,这个路径其实比很多人想象的更高效。
超级智能与Vibe Code的应用前景
聊到这里就延伸出另一个话题:现在AI编程能力越来越强,是不是已经到了窄域超级智能(Narrow Super Intelligence)的程度呢?洛根的判断是现在的编程领域确实已经有这种感觉了,AI的编程能力已经强大到接近超人水平。但这不是说程序员会被取代,反而更像是给每个开发者装了加速器。以前很多想法你会觉得遥不可及,做起来工程量太大,现在反过来了,你甚至可以把目标定得更宏大,因为AI能帮你搞定大部分基础工作,相当于技术直接拉高了每个人的野心边界,你能处理的问题复杂度比以前高了好几个量级。而且这种超级智能不会是均匀到来的,不会突然某一天所有领域都同时达到超人水平,而是会呈现一种锯齿状超级智能的突破形态:哪个领域的结果更容易验证,哪个领域就会先突破,比如数学、金融、科学研究这些领域对错标准清晰,可验证性强,就会比其他领域更早摸到超级智能的门槛。
说到这里可以提个有意思的方向,就是用Vibe Code做游戏。去年洛根还发过推文说2025年底每个人都能靠Vibe Coding开发电子游戏,现在看来这个目标已经很近了。当然不是说能做出3A大作,但普通人有个点子就能做出可玩的小游戏今年之内大概率就能实现。现在AI Studio里已经有很多人在做游戏了,早期数据里游戏类应用能占到20%,现在占比最高的是金融类,大概也是20%,主要集中在加密货币相关的工具,剩下的还有大量个人生产力工具和生成式媒体相关的应用。AI Studio上线Android应用的生成功能才一周就产出了35万个应用,其中大部分都是以前根本不会被做出来的个人用途工具。这个现象其实很有代表性,以前做一个App需要专业的开发团队,现在普通人有个想法就能靠AI快速做出来解决自己的问题,软件开发的门槛被大幅拉低,个人开发者的能力比以前大太多了。
Omni世界模型与生成式媒体的未来
聊完编程和应用,我们再说说这次Google I/O上最受关注的技术之一——Omni世界模型。很多人听到世界模型第一反应是那种动作条件驱动的视频模型,就是输入动作输出对应视频画面的传统架构。但洛根说,现在大家说的世界模型定义已经变了,像Omni这样的模型核心是对世界有深度的理解能力,同时具备强大的多模态生成能力,和传统的技术架构有本质区别,扩展性也强得多。最关键的一点是,Omni是真正的单一模型,不是那种把多个模态模型拼在一起、靠路由调度的架构。以前Google要分别训练八个不同的模型分别处理文本、音频、音乐、视频这些不同模态,现在一个Omni模型就能搞定所有事。
现在放出的是第一版Omni Flash,最先落地的能力是视频编辑,其他模态的能力还在优化后续会逐步放出来。访谈里举了个很生动的例子:有次洛根在台上做演讲,有人当场用Omni编辑现场的视频,在画面里加了一只走上台的狗,还做出了台下嘉宾低头看狗、轻声发笑的细节,甚至连他自己低头回应、抚摸小狗的动作都衔接得非常自然。这种级别的细节处理需要模型对人物动作、场景逻辑、情绪反应都有很深的理解,不是简单的画面拼接能做到的,也正是因为这种对世界的理解能力德米斯·哈萨比斯(Demis Hassabis)才会把它定义成世界模型,它不是只能生成视频,而是真的能理解场景里的逻辑和关系,这也是和传统生成模型最核心的区别。
顺着视频编辑的话题对话聊到了生成式媒体的发展方向。洛根自己的立场很明确:生成式媒体应该做增强而不是替代。他自己做内容的时候从来不用AI替代自己的话语、声音和形象,他觉得真实性本身就有巨大的价值,而Omni这类工具应该改的,是那些非人格化的部分,比如背景、布景、环境这些元素保留人的表达和存在感,用AI优化周边的呈现效果,这才是生成式媒体正确的打开方式,而不是做一堆AI虚拟人去替代真人。
核心判断:模型会吞噬脚手架的逻辑
接下来就是整场访谈最核心的判断,也就是我们开头提到的:模型会吞噬脚手架。12个月内Agent Harness的独立价值就会大幅下降。洛根先指出,两年前大家说的“模型”指的就是一组权重,就是输入token输出token的核心模型本身,但现在我们说的模型早就不是单纯的权重了,而是围绕权重搭建的一整套庞大系统,包括工具调用、代码执行、搜索、托管服务这些都已经变成了模型系统的一部分。行业的规律一直是这样:脚手架技术会先领先模型几步,然后模型慢慢就会把这些能力原生集成进去,把外部的脚手架变成自己的内置功能。现在的Agent Harness就是当下最典型的脚手架,所有人都觉得自己搭一套Harness是核心竞争力,是alpha的来源,但是再过12个月,至少现在我们理解的这种独立Harness价值就会大打折扣,因为模型本身就会原生支持这些能力,根本不用你自己去搭。
说到这儿肯定有人会问:那很多公司自研Harness不就是为了不被单一模型厂商锁定吗?如果都用模型自带的,不就又被绑定死了吗?洛根的看法是这种顾虑在早期是成立的,但是随着模型能力提升这个问题会慢慢淡化。真正的通用模型本来就应该能适配不同的Harness,如果做不到,那就称不上通用。所以行业接下来需要一个**“Harness基准测试”**专门评测不同模型适配各类脚手架的能力,等模型都能通用适配各种框架的时候,自研Harness的防锁定价值也就没那么大了。
创业机会:从收窄到扩大的逻辑
那如果脚手架的价值会被模型吃掉,创业公司还有机会吗?洛根的判断反而很乐观,他觉得现在的创业机会不是在收窄而是在扩大。原因很简单,大公司虽然模型能力强,但是摊子铺得大,没办法在单个领域极度专注,而专注就是创业公司的超能力。你深耕一个垂直领域,懂客户、懂场景,就能比大模型公司跑得更快。以前大家担心大模型公司什么都做,创业公司没有空间,现在看来根本不是这样。编程能力的普及反而缩小了创业公司和大公司的研发差距,你不用养庞大的技术团队也能快速迭代产品。而且Agentic原生能力本身就是个全新的品类,有大量新的产品形态可以探索,再加上不同用户对风险的接受度不一样,大公司不敢做的高风险探索创业公司可以做照样能拿下对应的用户群体,只要你足够专注找到自己的细分场景,机会比以前任何时候都多。
DeepMind的组织文化与战略定位
最后我们聊聊DeepMind的组织文化,这部分其实能帮我们理解为什么Google会走出这样的技术路线。洛根总结了三个核心特点:第一个是组合能力极强但偶尔会有专注力不足的问题。Google的产品线太广,技术储备也足够厚,整体的组合优势非常明显,但难免会在某些细分领域投入不够,被更专注的对手暂时领先,这也是大公司的常态。第二个是深入骨髓的科学家基因。这一点是从Demis身上渗透下来的,Demis本身是拿过诺贝尔奖的科学家,整个DeepMind的文化里科学探索的底色非常重,对比来看的话OpenAI的商业气质会更浓,Anthropic的风格会更深奥一些,而DeepMind更偏向用科学的方法去解决问题,做技术的初衷也是为了解决疾病、能源这类人类真正的核心问题。第三个就是**“Google引擎室”的定位**。现在DeepMind的官方账号简介里就是这么写的:一方面有很深的研究能力,另一方面又要对接Google的十亿级产品生态,把前沿技术落地到海量用户的产品里。能同时做好前沿研究和大规模工程部署的公司全世界也没几家,把Gemini部署到13个十亿用户级的产品里这种规模的工程挑战也是非常少见的。
总结:Agent时代的核心竞争力转移
聊到这里整场访谈的核心信息基本就覆盖完了。其实整场看下来,核心的主线就是一句话:Agent时代的核心竞争力往模型原生能力、产品飞轮和场景落地的方向转移。对行业里的每个人来说,搞清楚哪些能力是模型迟早会吃掉的,哪些是真正能沉淀下来的壁垒,可能是接下来一两年最重要的选择题。那大家觉得现在我们熟悉的哪些Agent能力会最先被大模型原生消化掉?欢迎留言。感谢收看,我们下期再见。