标签:video-generation
Google DeepMind 多模态先锋对谈:Veo、Imagen 与全模态智能的未来演进
📝
🎙️ AI Engineer
8/30/2026
📄 来自 Google DeepMind 的核心研究与产品专家 Dumitru Erhan、Shane Gu 与 Nicole Brichtova 深度探讨了生成式多模态媒体模型的前沿进展。内容涵盖 Veo 视频生成、Nano Banana(Imagen 3 轻量版)、Omni 全模态端到端交互、强化学习在推理与媒体生成中的应用、多模态评估难题以及人机协同创作的未来范式。
评估视频垃圾:Character.ai 如何重构 AI 视频生成评估体系
📝
🎙️ AI Engineer
7/25/2026
📄 本文根据 Character.ai 工程师 Maor Bril 的分享整理。文章深入探讨了 AI 视频生成评估面临的挑战,详细介绍了 Character.ai 如何将评估方法从主观绝对评分转向相对对比(A vs B),如何通过蒸馏技术将复杂的“专家委员会”模型转化为超快速的轻量级视觉语言模型(VLM),以及如何利用 Agentic 工作流将评估机制前置并嵌入生成闭环中,从而实现低成本的视频自动校正与优化。
HTML即画布:用网页技术栈重构AI智能体视频生成
📝
🎙️ AI Engineer
7/21/2026
📄 HeyGen Hyperframes 技术负责人 James Russo 分享了为何 HTML/CSS/JS 是 AI 智能体生成视频的最佳媒介。由于大语言模型天然熟悉网页代码,Hyperframes 采用极简的 HTML 封装,并通过冻结时钟、逐帧渲染等机制解决浏览器异步加载问题,实现了确定性的高画质视频输出。项目已开源并支持人机协同微调,致力于降低产品发布视频的制作门槛。
15分钟克隆数字分身:利用 Gemini Omni 生成 AI 视频体验
📝
🎙️ How I AI
6/3/2026
📄 播客主持人 Claire Ho 尝试使用 Google Flow 和 Gemini Omni 模型在15分钟内创建自己的AI虚拟化身,并生成一段宣传视频。该视频展示了AI在快速创意生成中的巨大潜力,同时分析了当前技术在人物一致性、情感表达及细节处理上存在的“恐怖谷”效应。
xAI 访谈录:Ethan He 揭秘 Grok Imagine 研发内幕、世界模型与视频智能的未来
📝
🎙️ Latent Space
6/1/2026
📄 前 xAI 工程师 Ethan He 分享了在 3 个月内从零构建 Grok Imagine 的历程。他提出“视觉智能本质上源于语言智能”的核心主张,探讨了视频生成与世界模型的本质区别,并预言视频智能体 (Video Agents) 和生成式 UI 将重构人机交互的未来。
Google I/O 2026 深度盘点:Gemini 3.5 闪速编程与 Omni 创意大爆发
📝
🎙️ How I AI
5/20/2026
📄 本视频深度测评了 Google I/O 2026 首日发布的核心产品与模型。主讲人 Claraveville 现场实测了超高速的 Gemini 3.5 Flash 模型、全新 Agentic IDE Anti-gravity 2.0、AI Studio 的 Workspace 工作流集成,以及颠覆性的 Omni 视频生成大模型、Stitch 设计协作平台与 Pomelli 营销生成器,直击谷歌新一代 AI 工具生态的实测表现与痛点。
AI 终于学会"听歌起舞"了,而且跳得比人类还整齐 · 乔木博客
🎙️ 向阳乔木
5/11/2026
📄 文章介绍了 MACE 模型,通过级联混合专家架构(MoE)实现了高质量、音乐驱动的舞蹈视频生成。该模型将动作生成与视频渲染分离,结合 BiMamba、扩散模型及 GFT 等技术,并在自建的 MA-Data 数据集上进行了训练,在动作同步性和视频视觉质量上均达到 SOTA 水平,并展示了 MoE 架构在复杂 AI 任务中的优势。
LPM 1.0:AI虚拟角色的性能革命与未来展望
📝
🎙️ Best Partners TV
5/2/2026
📄 本文深入解读了米哈游创始人蔡浩宇旗下Anuttacon公司发布的LPM 1.0(大型表演模型)。该模型首创性地解决了AI虚拟角色交互中的'表演三难困境'(高表现力、实时推理、长时身份稳定性),通过构建高质量对话数据集、170亿参数的Base LPM基础模型、多阶段蒸馏实现的Online LPM流式模型,以及交互式角色表演基准LPM-Bench,实现了虚拟角色如真人般自然、实时、稳定的对话表演。文章详细阐述了数据构建、模型设计、蒸馏框架、基础设施优化及评估体系,并探讨了LPM 1.0的局限性与未来发展方向,预示着AI虚拟角色在游戏、直播等领域的广泛应用前景。
新春特辑:即梦Seedance 2.0引爆春节,字节跳动AI视频生成能力深度解析
📝
🎙️ 人民公園說AI
2/17/2026
📄 本期节目深入探讨了字节跳动推出的AI视频生成工具**即梦Seedance 2.0**及其在春节期间的火爆现象。嘉宾们通过对比**即梦**与**Veo**、**Sora**等竞品,分析了字节跳动在训练数据(尤其是抖音短视频数据)和工程化方面的独特优势,以及其原生多模态、方言生成和“不遵守物理规则”的创作风格。节目还就**即梦**的市场定位(ToC与ToB)展开辩论,并延伸讨论了中国AI应用场景(如阿里“抢奶茶”、腾讯“元宝”红包)与美国AI发展路径的差异,强调了全民参与AI的重要性。