Gemini 3.5 的真正野心,是把 AI 从聊天推向行动 · 乔木博客 向阳乔木 2026-05-20

乔木博客

全部

AI工具

AI教程

AI生成

AI资讯

健脑房

播客解读

论文学习

Gemini 3.5 的真正野心,是把 AI 从聊天推向行动

AI资讯

·

2026年5月20日

·

29 次阅读

·

约 12 分钟

很多人对 AI 的期待,已经从“帮我回答一句话”,变成了“帮我把这件事办完”。

这两个要求看起来只差一步,实际上中间隔着一整套能力。

回答问题,模型只需要在几秒钟里把话说对。

办完事情,模型要理解目标、拆任务、查资料、调用工具、写代码、改错、继续推进,还要在失败时自己绕回来。

Google 这次发布 Gemini 3.5,真正想讲的就是这件事:AI 正在从回答层,往行动层迁移。

图:Google 发布 Gemini 3.5,把关键词放在了 frontier intelligence 和 action 上。

Google 这次没有先端出 Pro,而是先推 Flash

按照很多人的惯性,旗舰模型发布应该先看 Pro。

但 Google 这次先把 Gemini 3.5 Flash 推出来了。

这个选择挺有意思。

Flash 过去给人的印象是“快、便宜、够用”,更像一个高频调用模型。

3.5 Flash 的定位被明显抬高了。

Google 说它在多个维度上已经能接近大型旗舰模型,同时保持 Flash 系列的速度优势。

原文给了几个数字:

指标

Gemini 3.5 Flash 表现

说明

Terminal-Bench 2.1

76.2%

偏真实终端任务和编码能力

GDPval-AA

1656 Elo

偏长任务和代理能力评估

MCP Atlas

83.6%

偏工具和协议环境里的代理能力

CharXiv Reasoning

84.2%

偏多模态理解与推理

输出速度

约快 4 倍

相比其他 frontier models 的输出 token 速度

这些数字当然要谨慎看。

厂商发布会里的 benchmark,永远带着一点“最会考试的那一面”。

但它释放的信号很明确。

Google 不想让 Flash 只做便宜替补,它想让 Flash 成为大规模 agent 工作流的默认发动机。

原因也很现实。

Agent 的成本结构和聊天不一样。聊天可能是一轮问答,Agent 往往是几十次、上百次模型调用。

一次任务里要规划、搜索、写文件、跑测试、复盘、再修改。

如果每一步都用最贵、最慢的模型,很多看起来很酷的 agent 产品,算账时会立刻冷静下来。

所以 3.5 Flash 的关键不只是“聪明”,还有“聪明到足够能干,同时快到可以频繁调用”。

Agent 最怕的不是不会说话,是撑不完整个流程

Google 在原文里反复提到 long-horizon tasks。

这个词翻译成人话,就是“需要持续推进很久的任务”。

比如开发一个小应用,维护一个旧代码库,整理一批财务文件,分析复杂数据,或者把一堆没有命名规则的素材重新归类。

这类任务和普通问答最大的区别,是中途会不断出现小岔路。

文件找不到怎么办?

测试没过怎么办?

用户的需求和代码现状冲突怎么办?

数据格式不统一怎么办?

真正的 agent 能力,往往就藏在这些麻烦里。

模型不能只会给一个漂亮计划,它要能在执行时不断修正计划。

Google 把 3.5 Flash 和 Antigravity 放在一起讲,也说明它的重点已经从“模型单体能力”转向“模型在工作台里的执行能力”。

Antigravity 更新后,可以让 3.5 Flash 部署协作式 subagents,在监督下并行处理复杂问题。

您的浏览器不支持视频播放

视频:3.5 Flash 在 Antigravity 里执行多步骤流程,自动重命名和分类一批非结构化素材。

您的浏览器不支持视频播放

视频:3.5 Flash 用 Antigravity 把一个混乱的旧代码库迁移到 Next.js。

这句话背后有一个很重要的产品方向:

以后 AI 的单位,可能不再是一个聊天窗口,而是一组被调度的工人。

一个负责读代码。

一个负责写测试。

一个负责查文档。

一个负责评审结果。

主模型像项目经理一样拆分任务、检查结果、决定下一步。

您的浏览器不支持视频播放

视频:3.5 Flash 调度多个 subagents,在 Antigravity 里并行生成城市景观。

您的浏览器不支持视频播放

视频:一个 builder agent 和一个 player agent 进入快速自我改进循环,用来开发游戏。

这也是为什么速度和成本突然变得特别重要。

单个模型再强,如果不能在经济上支撑成百上千次调用,就很难进入真实工作流。

从写代码到做 UI,模型开始碰到“手感”问题

原文里还有一个容易被忽略的点:3.5 Flash 可以生成更丰富、更互动的网页 UI 和图形。

过去模型写代码,常见问题是“逻辑能跑,但体验很粗”。

按钮能点,页面能看,组件也有,但整体像临时拼出来的样子。

到了 agent 阶段,模型如果要真的替人完成任务,就不能只交付一段代码。

它还要交付一个能被人继续使用、继续判断、继续迭代的结果。

比如 Google 提到,3.5 Flash 可以在 AI Studio 里为研究论文生成互动动画,也可以在 Search 里生成解释 Gyroid pattern 的互动视觉。

您的浏览器不支持视频播放

视频:3.5 Flash 在 AI Studio 里把研究论文内容转成互动动画。

您的浏览器不支持视频播放

视频:3.5 Flash 根据一段文字描述生成可交互的硬件演示界面。

这说明模型正在从“生成文本答案”走向“生成可操作界面”。

这里的难点不只是会不会写 HTML、CSS、JavaScript。

难点是理解一个界面为什么这样组织,什么信息应该优先出现,什么交互会让人少犯错,什么视觉表达能帮助理解。

当 AI 开始替人做事,UI 就变成了它和人类交接工作的地方。

您的浏览器不支持视频播放

视频:3.5 Flash 并行生成多个品牌概念,用于学校筹款活动。

您的浏览器不支持视频播放

视频:3.5 Flash 在 60 秒内为结账流程生成不同 UX 方案。

这也是未来 agent 产品很可能拉开差距的地方。

模型能力会越来越接近,但谁能把任务过程、风险、证据和结果呈现得更清楚,谁就更容易被信任。

企业场景先落地,因为那里最缺“耐心”

Google 举了几个企业例子。

银行和金融科技公司,把多周工作流自动化。

数据科学团队,在复杂数据环境里挖掘洞察。

Shopify 用并行 subagents 做长期数据分析,帮助预测全球商家的增长。

您的浏览器不支持视频播放

视频:3.5 Flash 借助 Antigravity,让两个代理合成 AlphaZero 论文并在 6 小时内写出可玩的游戏。

这些例子听起来很企业宣传,但方向是对的。

企业里有大量工作,本质上拼的不是创意,拼的是耐心。

反复查数据。

反复核对文件。

反复整理例外情况。

反复把一个系统里的信息搬到另一个系统里。

人做这些事会累,会烦,会漏。AI 做这些事,只要工具链和权限边界设计得好,反而很适合。

但这里也有一个现实约束:企业不会因为模型在榜单上赢了几分就放心让它接管流程。

它们更关心三件事。

第一,能不能接入现有系统。

第二,出错时能不能追责和回滚。

第三,成本能不能解释给财务听。

所以 Gemini 3.5 Flash 的企业价值,未必来自“最强模型”这个标签,而是来自一个组合:足够强的模型、足够快的速度、足够低的调用成本,再加上 Google 自己的企业平台和开发工具。

Spark 是这篇文章里最值得盯住的产品信号

原文锚点落在 Personal AI agents 这一节,其实这也是最有想象空间的部分。

Google 发布了 Gemini Spark,一个基于 3.5 Flash 的个人 AI 代理。

它的定位很直白:24 小时运行,帮人管理数字生活,在用户指令下替用户采取行动。

目前 Spark 先给 trusted testers,计划下周向美国的 Google AI Ultra 订阅用户推出 Beta。

这里真正重要的地方,不是 Google 又做了一个聊天机器人。

Spark 更像是 Google 想把 agent 放进个人生活的入口。

搜索、Gmail、Calendar、Docs、Android、Chrome、YouTube,这些东西如果被一个长期运行的个人代理串起来,想象空间会非常大。

它可以帮人盯邮件里的行程变化。

可以把搜索结果变成后续行动。

可以在文档、日历、网页之间帮人整理上下文。

可以在用户确认后替人预约、归档、提醒、生成材料。

您的浏览器不支持视频播放

视频:Search 调用 3.5 Flash,生成解释 Gyroid 图案的互动视觉组件。

但这件事也会立刻碰到信任问题。

一个会回答问题的 AI,说错了最多让人皱眉。

一个会行动的 AI,做错了可能会误发邮件、误删文件、误订东西、误解一个人的真实意图。

所以个人代理的关键不只是能力,还包括边界感。

什么时候自动做?

什么时候必须问?

什么时候只建议?

什么时候完全不能碰?

这些产品细节,可能比模型多会几个 benchmark 更决定 Spark 能不能进入日常生活。

安全框架被放进正文,说明 Google 知道自己在打开哪扇门

Google 说 Gemini 3.5 按照 Frontier Safety Framework 开发,并加强了 cyber 和 CBRN 相关防护。

这类表述看起来很标准,但放在 agent 语境下,重量会变得不一样。

普通聊天模型的安全,主要是回答边界。

Agent 模型的安全,还要关心行动边界。

它会不会调用工具?

会不会写入文件?

会不会访问敏感数据?

会不会在长任务里逐步偏离用户原意?

会不会为了完成目标而采取用户没预期到的路径?

Google 还提到使用 interpretability tools,去检查和理解 AI 在给出回答前的内部推理。

这一点原文没有展开太多,但方向很关键。越是让模型行动,越需要知道它为什么这么做。

未来强大的 agent,不只是要能干活,还要能解释自己的工作轨迹。

没有可解释性,就很难形成信任。

没有信任,个人代理和企业代理都会卡在演示阶段。

Gemini 3.5 的真正看点,是 Google 想把模型塞进更多“执行场”

Google 的优势一直不是只有模型。

它还有搜索、移动系统、办公套件、浏览器、云平台、开发工具和企业客户。

当模型能力进入 agent 阶段,这些入口会变得更重要。

因为 agent 要做事,就需要上下文、工具、权限和场景。

OpenAI 强在消费者心智和模型体验。

Anthropic 强在编码、长文档和安全叙事。

Google 的牌面,是把 Gemini 放进人们已经在用的工作和生活系统里。

这也是 Gemini 3.5 这篇发布文最值得读的地方。

它表面上是在发布一个模型系列。

更深一层,它是在说:下一轮 AI 竞争,不只是谁回答得更好,而是谁能在更多场景里真正把事情往前推。

聊天窗口只是入口,行动网络才是战场。

原文链接:Gemini 3.5: frontier intelligence with action

© 2026

·

向阳乔木

📌 文中提及的人物和组织

关键字: ai-agent agentic-workflow long-horizon-tasks frontier-intelligence personal-ai