标签:multimodal-model
-
多模态模型的价值,不在看懂图,在会自己去看
🎙️ yage.ai
📄 文章探讨了多模态模型的核心价值在于其自主行动能力,即模型不再是被动地接收输入,而是能够自主决定何时观察、聚焦哪个区域、并根据观察结果主动调用工具进行修正和迭代。这标志着视觉能力从单纯的输入通道转变为模型自主决策的行动步骤,并强调了从静态流程向具备自我验证闭环的 Agentic 模式的转变,以及相应的训练和评估范式的调整。 -
从代码生成到自我博弈:Google DeepMind 副总裁 Benoit Schillings 谈 AI 编程与未来科学
📝
🎙️ AI Engineer
📄 Google DeepMind 研究副总裁 Benoit Schillings 探讨了软件工程从手工编写代码向 AI 驱动的转变,指出未来代码编写将变得几乎免费,开发重点将转向系统架构、安全漏洞预防及自我博弈技术,并展望了 AI 在化学、生物等科学领域的应用潜力。 -
15分钟克隆数字分身:利用 Gemini Omni 生成 AI 视频体验
📝
🎙️ How I AI
📄 播客主持人 Claire Ho 尝试使用 Google Flow 和 Gemini Omni 模型在15分钟内创建自己的AI虚拟化身,并生成一段宣传视频。该视频展示了AI在快速创意生成中的巨大潜力,同时分析了当前技术在人物一致性、情感表达及细节处理上存在的“恐怖谷”效应。 -
Google I/O 2026:从编码到执行的 AI 超速进化
📝
🎙️ Best Partners TV
📄 Google I/O 2026 全面展示了 AI 从编码辅助向自主执行系统(Agentic System)的战略转型。大会发布了 Gemini 3.5 Flash、Omni 多模态模型、Antigravity 平台以及 Gemini Spark 等一系列产品,旨在通过‘全栈 AI’架构,将 Agent 力量融入搜索、工作流、购物及 XR 设备,标志着 AI 助理正式进入消费级行动阶段。 -
Google I/O 2026 深度盘点:Gemini 3.5 闪速编程与 Omni 创意大爆发
📝
🎙️ How I AI
📄 本视频深度测评了 Google I/O 2026 首日发布的核心产品与模型。主讲人 Claraveville 现场实测了超高速的 Gemini 3.5 Flash 模型、全新 Agentic IDE Anti-gravity 2.0、AI Studio 的 Workspace 工作流集成,以及颠覆性的 Omni 视频生成大模型、Stitch 设计协作平台与 Pomelli 营销生成器,直击谷歌新一代 AI 工具生态的实测表现与痛点。