Google I/O 2026:从编码到执行的 AI 超速进化 Best Partners TV 2026-05-20

全栈 AI:从编码工具到执行系统

Google I/O 2026 开幕式上,Sundar Pichai 强调当前 AI 处于超速进步时期,Google 全面转向 AI-First 战略已满 10 年。本次大会的核心信号明确:AI 的下一阶段将不再仅仅局限于“编码辅助”,而是全面向“替用户行动”的执行系统 (Execution System) 转型。Google 展示了包含 AI 基础设施层、安全层、顶级研究层、模型和工具层、产品和平台层的“五层架构”,并强调通过“全栈 AI”实现快速迭代。

算力基石:TPU 与 Token 规模的爆发

作为全栈 AI 的底层保障,Google 发布了第八代 TPU,采用专精于训练和推理的双芯片架构:TPU 8tTPU 8i。TPU 8t 原始算力比上一代提升近 3 倍,支持基于 JAX 和 Pathways 跨全球站点的大规模预训练;TPU 8i 则极致优化推理延迟,现场演示 Flash 模型在 8i 上实现每秒 1500 token 的输出速度。衡量进展的指标 Token 处理量在一年内增长了 7 倍,达到 3.2 千万亿,Sundar 将此称为“token maxing”(Token 拉满),证明了 Google 产品矩阵的高效普及。

Gemini Omni:理解与编辑现实

Demis Hassabis 明确表示 AGI(通用人工智能)离我们只剩几年。为此 Google 推出新模型 Gemini Omni,其定位是从“任何输入生成任何输出”,并融合了生成式模型 Veo、Nano Banana 等能力,在物理一致性和多模态编辑上实现阶跃。Omni 不仅能基于语言指令生成物理一致的科普动画,更赋予了视频“丝滑编辑”能力:用户只需自然语言对话,即可实时改变视频中的物体形态、场景氛围、光线与节奏。

Antigravity:Agent 驱动的开发范式

本次大会展示了最具科幻感的产品:Antigravity 平台及独立桌面应用 Antigravity 2.0。该系统彻底贯彻 agent-first 理念,通过 Gemini 3.5 Flash 配合子 Agent、hooks 和异步任务管理原语,实现了从零构建操作系统内核的“炸场”演示:在 12 小时内,93 个子 Agent 并行协作,处理了 26 亿 token 并成功跑通了经典游戏 Doom。这证明了 Agent 在处理复杂、长时、多步工程任务上的巨大潜能,也大幅降低了开发门槛。

Gemini Spark:迈向消费级 Agent 时刻

Gemini Spark 的发布预示着个人 AI Agent 的正式到来。它支持 24/7 后台运行,哪怕笔记本合上也能持续推进长时任务。Spark 将深度集成于浏览器、手机主屏及 Google 工具链中。现场演示显示,用户只需通过自然语言或语音指令,Spark 即可跨 Google 文档、邮箱、聊天搜集信息并按特定语气起草邮件,或是自主组织复杂的社区活动并实时同步跟踪。

AI Search 与 Generative UI

Google 搜索正式升级为 AI Search。核心变革在于“智能搜索框”的重构,不仅支持更长的句子,还支持多模态跨模态搜索。Information agents 的引入允许用户启动多个后台 Agent 持续监控财经、公寓、购物等信息。最炫酷的特性是 Generative UI:AI 能够为每一个搜索问题现场编写理想的交互界面,甚至能生成可交互的动画演示黑洞效应。这种能力还能扩展为长期任务的“小型应用”,自动调用 Gmail、Photos 和 Calendar 等数据,实现高度个性化的规划与交互。

电商与创意工具的重塑

在电商领域,Google 推出了 UCP(通用商业协议,Universal Commerce Protocol),旨在通过开源标准让所有 Agent 说同一种语言;AP2(Agent 支付协议,Agent Payments Protocol)则在隐私与透明的前提下,解决 AI 替用户下单的信任与责任问题。在创作领域,Google Pics 增强了图像编辑控制权,Stitch 则让用户通过语音实时调整 UI,Google Flow 的多模态能力让创作流程全面并行化。最后,Google 还官宣了将于秋季上市的智能 音频眼镜,作为脱离手机直接唤起 Agent 的核心硬件入口。

Demis Hassabis 在大会最后总结道:“当我们回望这段时间会意识到,自己当时正站在奇点的山脚下。”