LPM 1.0:AI虚拟角色的性能革命与未来展望 Best Partners TV 2026-05-02

大家好,这里是最佳拍档,我是大飞。今天咱们来聊一项在AI虚拟角色交互体验领域里的突破技术——LPM 1.0,它的全称是Large Performance Model,也就是大型表演模型。如果你用过一些数字人或虚拟人做视频或直播,一定被很多痛点折磨过,比如数字人永远只会机械对口型,无法像真人一样做出自然的反应;或者只要时间一长,人物的形象就会发生漂移,甚至动作非常僵硬,几个固定动作来回循环。

这些问题的背后,实际上是困扰了整个行业多年的“表演三难困境”:高表现力、实时推理、长时身份的稳定性。这三个核心需求在现有技术框架下似乎永远无法同时满足。而LPM 1.0,就是全球第一个从系统层面彻底破解表演三难困境的视频生成模型。它是由米哈游创始人蔡浩宇旗下AI公司Anuttacon研发,专注于单人全双工音视频对话表演生成。简单来说,LPM 1.0能让虚拟角色像真人一样,在对话中自然说话、专注倾听、实时反应、流露情绪,同时保持身份特征的长期稳定,还能实现低延迟的实时流式交互,直接成为对话智能体、直播虚拟形象、游戏NPC的核心视觉引擎。今天我们就来解读一下这篇论文,另外关于模型的各种演示片段,我们专门做了一个集锦,会在单独一个视频中给大家呈现,我们这里先放一个片段。

接下来,我们将深入解读LPM 1.0的核心技术与创新贡献。

核心贡献与数据基础

LPM 1.0的核心定位是基于视频的角色表演模型,其核心目标是打造一个能学习真人表演行为的视觉引擎。整个项目的核心贡献有五点:

第一,提出了全球首个支持单人全双工对话表演的视频生成系统,同时满足高表现力、实时推理、长时稳定三大需求。

第二,构建了大规模高质量的多模态以人为中心数据集。通过严格过滤、说话和倾听音视频配对,以及身份感知多参考提取,让模型能规模化学习真实的对话表演行为。

第三,研发了170亿参数的Base LPM基础模型,基于扩散Transformer架构,联合学习语音驱动动作、倾听反应、文本控制、多参考身份保留四大能力。

第四,创新了多阶段自回归蒸馏框架,将高精度的Base模型蒸馏为支持实时交互的Online流式模型。

第五,打造了全球首个交互式角色表演基准LPM-Bench,实现了对话自然度、可控性、情绪表演、长时一致性的系统化评估。

想要训练出能还原真人表演的AI模型,数据是一切的基础,这也是LPM 1.0最核心的突破之一。LPM 1.0的数据集专门针对对话表演设计,整个数据构建流程分为四大核心模块。

首先是高质量以人为中心视频的制备。研究团队收集了覆盖各类表演场景、对话场景的大规模视频语料,包含不同人物、情绪、互动关系的内容。所有数据都经过人工团队的质量与内容审核,确保视觉保真度、内容相关性和对话有效性。随后通过四阶段严格过滤流水线处理原始视频:第一阶段通过场景检测分割出连贯的单镜头片段,剔除短于3秒的无效内容;第二阶段通过人体检测模型,剔除无人物或人群过于密集的片段;第三阶段通过人工+模型的联合过滤,剔除视频剪辑瑕疵、画质缺陷、合成内容、构图问题、音视频不同步的无效数据,最终让质量缺陷数据占比低于1%;第四阶段按可见人数分类,最终得到高质量、连贯、带有人数标注的单镜头片段。整个过滤流程十分严格,原始数据的最终保留率低于10%,最终得到3100万个可训练片段,其中说话片段2300万个、对话倾听片段500万个、闲置片段300万个。

接下来是对话音视频数据处理,这是LPM 1.0区别于所有模型的核心数据环节,因为它首次实现了帧级说话、倾听和闲置三状态的标注。在自然对话中,人物会在说话、倾听、闲置之间快速切换;倾听时的点头、微笑、眼神变化是对话自然的关键。现有的主动说话人检测模型只能识别谁在说话,无法标注倾听状态,更无法处理多人对话的角色分配。研究团队为此优化了LR-ASD主动说话人检测模型,将其微调为帧级三状态分类模型,再结合语音检测和音视频同步性,精准标注每一帧的状态:嘴唇与音频同步为说话;嘴唇静止且有背景语音为倾听;无语音且嘴唇静止为闲置;音视频不同步的数据直接剔除。对于多人视频,团队还设计了角色和音频的分离与分配模块:先通过人体跟踪裁剪出单人视角,再通过帧级重排序模块聚合时序概率、施加平滑约束、解决角色分配问题,最终分离出了仅说话音频和仅倾听音频两条轨道,让每个单人片段都能配对对应的专属音频。为了避免标注错误,团队还基于千问3-Omni(Qwen3-Omni)微调了音视频理解模型做语义验证,该模型的整体F1值达到78.37%,比Gemini 2.5 Pro高出7.9个百分点,有效剔除了虚假倾听、非对话倾听的错误标注,让数据的对话属性更纯粹。

然后是音视频理解与标注。为了让模型实现细粒度的动作和情绪控制,研究团队用音视频理解模型为每个片段生成自然语言描述和结构化标签,覆盖动作、情绪、环境、镜头、表情等维度,并专门制定了完整的分类体系。这里有一个关键的细节:自然对话视频中,倾听片段只占总时长的10%,而且绝大多数是中性、低能量的静态倾听,高情绪、高动态的倾听反应极度稀缺。为了平衡数据分布,团队专门筛选了47万个包含清晰情绪反应、主动互动的倾听片段,对情绪、表情、能量、动作四个维度做重平衡,下采样中性数据,上采样稀有行为,还专门保留了情绪对比、表情振荡两种关键时序模式,让模型能学会丰富的倾听反应。同时,倾听片段的标注只保留外观、性格、关系等不变属性,不做逐帧行为描述,让模型直接学习音频到视觉反应的映射,而不是依赖文本中介。

最后是身份感知参考图像流水线,这是解决长时身份漂移的核心技术。现有模型只依赖单张参考图像,模型只能“脑补”侧脸、表情、衣物细节,长时间生成必然不一致。LPM 1.0创新设计了三类型多粒度参考图像,为每个角色提供完整的身份先验:第一类是全局外观参考,从长视频中随机采样不同帧,避免模型直接复制像素,锚定角色的整体外貌、着装、场景;第二类是多视角身体参考,基于SMPL 3D人体模型和GVHMR动作恢复方法,计算人体与相机的角度,分为正面、背面、左侧脸、右侧脸四类视角,提供不同角度的外观信息,解决视角变化后的身份漂移;第三类是面部表情参考,从1080P高清视频中提取8种基础表情,通过图像理解模型验证表情准确性,让模型学会角色专属的微笑、皱眉、大笑细节,避免表情同质化。这三类参考图像结合,让模型能从任意角度、任意表情还原角色身份,彻底告别脑补带来的不一致。

在完成了核心数据的构建之后,LPM 1.0的研究团队将目光投向了模型的核心设计。

Base LPM 基础模型设计

整个模型分为Base LPM基础模型和Online LPM流式模型两部分。Base模型负责生成高精度、高可控的表演视频;Online模型通过蒸馏实现实时、无限长的交互部署。先看Base LPM:它是一个170亿参数的DiT模型,基于140亿参数的Wan2.1-I2V图像转视频预训练模型优化而来,额外增加了30亿参数的交错说话和倾听音频交叉注意力模块,在数亿级片段上完成训练。它的核心架构设计完全围绕对话表演的需求展开。

首先是多模态条件注入,这是Base LPM能同时处理说话、倾听、文本控制的关键。对话生成需要两条音频流:说话音频驱动口型同步和表情,倾听音频触发反应动作。如果将两条音频同时注入每一层,会导致参数翻倍、计算量激增,还会混淆两种信号。LPM 1.0创新采用了交错式双音频注入策略:在偶数层Transformer注入说话音频,奇数层注入倾听音频。两条音频分支拥有独立的键、值、输出投影参数,最后和文本交叉注意力的结果融合输出。这种设计有三大优势:第一,对齐动作分布——说话对应高频面部动作,倾听对应低频姿态变化,分层处理避免梯度冲突;第二,参数和计算效率提升50%——只在一半层注入单条音频;第三,时序对齐更精准——说话音频用局部窗口保证口型同步,倾听音频用大窗口响应长时语义。

然后是多参考身份条件注入,这是长时身份稳定的核心。Base LPM没有用传统的CLIP全局特征或单独的交叉注意力分支,而是将所有参考图像编码为和视频潜变量同空间的patch token,直接拼接到视频token序列末尾,参与自注意力计算,让视频内容和参考图像实现双向细粒度的信息交互。同时,为表情参考、多视角参考分配不同的3D RoPE偏移量,让模型可以自动区分两种参考的语义,无需额外可学习参数。这种设计实现了三大效果:包括多视角的一致性(支持转头、侧脸、过肩镜头),同时动态表情保真(可以还原角色专属的表情细节),以及长视频的稳定输出(参考token作为身份锚点,10分钟内无明显漂移)。

Base LPM的训练采用了多阶段策略,基于流匹配(Flow Matching)的方法,逐步实现多模态控制和身份一致性:第一阶段是多模态条件对齐,先从零训练说话音频通路,保留预训练的文本和自注意力权重,音频交叉注意力的值投影权重初始化为零保证稳定;随后训练倾听音频通路,混合说话和倾听数据,让模型学会响应式的非语言行为;最后融合语音、静默、倾听和对话数据,完成音频对齐训练,同时移除原始CLIP图像交叉注意力模块来简化架构。第二阶段是身份一致性保留,全程提供全局参考,30%的片段加入多视角和表情参考,让模型学会利用多粒度身份线索。第三阶段是时序扩展训练,采用分块自回归生成,随机丢弃前2到5帧真实的潜变量,解决训练和推理的不匹配问题。第四阶段是采用DPO(Direct Preference Optimization),针对说话时的肢体畸变、口型同步误差,倾听时的静态僵硬问题,通过人类偏好数据优化模型,无需显式奖励模型,提升动作真实性和行为自然度。

Base LPM的推理流程分为三步:第一步是视觉身份设定,输入角色描述,生成首帧肖像和多粒度参考图像;第二步是音频准备,说话音频由语音合成模型生成,倾听音频直接来自用户输入;第三步是文本提示,通过大模型生成逐块的动作、表情、场景描述。推理时,两条音频分支可独立开关,支持纯说话、纯倾听、全对话三种模式。虽然训练片段只有3-8秒,但是通过分块延续生成,可以稳定生成10分钟无画质退化的视频。

尽管Base LPM在视频生成精度上表现出色,但其离线特性限制了其实时交互能力。

Online LPM 流式模型设计

虽然Base LPM能够生成高精度的表演视频,但可惜它是离线模型,无法直接用于直播、实时对话等交互式场景。因为实时交互需要因果推理、低延迟以及无限长稳定,控制信号是流式增量输入的,未来信息不可用,小误差会累积导致漂移。因此研究团队将Base LPM蒸馏为Online LPM流式模型,从而实现实时部署。Online LPM的核心设计是先解决流式控制信号的训练和推理不匹配,再通过骨干和精炼器架构,分离轨迹和重见细节,破解自回归rollout的误差累积问题。

首先是流式音视频输入适配:音频是帧级驱动信号,对截断和边界最敏感。团队采用了重叠感知分块音频编码,每一步处理3秒音频窗口,步长1秒,重叠保证时序连续。同时用60万个流式格式数据微调模型,提升在线稳定性。文本控制则采用增量更新,因为文本指令的时效性更长,无需频繁调整,避免成为实时部署的瓶颈。

然后是Online LPM架构:团队将双向DiT蒸馏为因果骨干DiT+因果精炼器DiT的两阶段架构,基于分布式匹配蒸馏(DMD)框架。骨干模型是2步蒸馏模型,负责稳定的时序锚定,基于带噪声的历史KV缓存,提升对自生成历史误差的健壮性。精炼模型是1步蒸馏模型,负责高精度细节恢复,基于干净的历史KV缓存,在稳定轨迹上还原高清细节。两个模型都采用分块因果注意力,视频token只关注当前块和历史块,保证因果生成。这种架构把复杂的生成问题拆解为两步:先保证轨迹不漂移,再还原高清细节,完美平衡了稳定性和画质。

Online LPM的训练采用了四阶段课程蒸馏,逐步降低优化难度,缩小训练和推理差距:第一阶段是基于常微分方程的初始化,用教师模型的去噪轨迹做监督回归,让因果骨干学会在线分块去噪;第二阶段是off-policy分布匹配蒸馏,用教师模型的潜变量重新加噪做训练,稳定过渡到分布匹配优化;第三阶段是on-policy分布匹配蒸馏,用骨干自身的自回归生成结果训练,让模型学会修正自身预测误差,这是长时稳定的关键;第四阶段是精炼器蒸馏,用骨干生成的潜变量重新加噪,训练精炼器还原最终高清细节,修正骨干的残留误差。

Online LPM的推理采用滑动窗口解码,从而实现实时和无限时长的生成。模型只处理固定大小的时序窗口,包含当前块、最近几块视频和参考图像token,避免无限历史带来的计算压力。同时缓存RoPE编码前的历史KV状态,动态更新相对位置,避免重复计算,以及保留少量Sink token作为注意力锚点,减少长时抖动和漂移。这种设计让模型在训练仅用5秒片段的情况下,能够无限时长rollout生成,满足实时交互的需求。

强大的模型和精良的数据需要与之匹配的基础设施来支撑训练与部署。

基础设施与部署优化

有了模型和数据,还需要强大的基础设施支撑训练和部署。LPM 1.0的基础设施优化覆盖了训练、在线系统和部署全链路。训练优化基于TorchTitan框架,针对大模型和长序列视频做了四大优化:第一是数据加载与负载均衡,包括离线预计算VAE、音频和文本嵌入,数据加载只传递紧凑潜变量,通过在线负载均衡器将样本分配到token桶,平衡GPU负载,减少填充开销;第二是混合并行策略,用PyTorch FSDP v2分布式训练,大集群切换为混合FSDP,高分辨率长序列用Ulysses上下文并行,解决序列过长的计算和内存问题;第三是内存高效激活管理,用算子级选择性激活检查点,只保存计算密集型操作,结合CPU异步卸载,节省GPU的内存;第四是高效注意力与内核优化,统一调用FlashAttention2/3/4、CuTe内核,用可变长度实现无填充开销,自定义Triton内核融合RMSNorm、激活函数以及旋转位置编码;因果模型用FlexAttention实现块稀疏掩码,在保证因果性的同时,达到稠密内核的吞吐量。

在线交互视频系统是LPM 1.0落地的核心,它需要满足低延迟连续生成、状态自适应响应、长时一致性三大要求。系统围绕Online LPM搭建,采用三大架构设计:第一是流水线推理执行,将自回归生成离散为1秒时长、总共24帧的块,分为生成器、精炼器、VAE三阶段流水线,并行执行降低延迟;第二是多模态状态自适应控制,根据流式音频、文本、控制信号,在预热、闲置、倾听、响应状态间进行低延迟切换,保证身份一致和音视频同步;第三是高效上下文管理,采用3块Sink token+2块滑动窗口的混合缓存,固定内存实现无限长稳定生成。系统还可对接音频转音频(A2A)模块,实现全双工实时对话交互。

部署端的优化分为模型推理和系统两级:模型推理通过融合内核、高效注意力、torch.compile优化,单GPU上每块推理时间低至0.35秒,满足24帧的实时流;系统级则通过状态分离、边界对齐更新、受控前瞻,实现对中断、角色切换的快速响应,保证交互流畅性。

为了全面验证LPM 1.0的能力,研究团队还开发了一套创新的评估体系。

评估基准与结果

在评估方面,LPM 1.0的研究团队专门打造了全球首个交互式角色表演基准LPM-Bench,填补了行业空白。现有视频生成基准只关注画质和短文本生成,无法评估对话表演的表现力、自然度和长时一致性。LPM-Bench包含1000个测试用例,覆盖五大场景:包括说话、倾听、对话、多样化人体动作以及角色泛化,从外观、表演、音频三个维度保证多样性。外观包含不同人种、年龄、艺术风格、镜头;表演包含22种基础表情、78种情绪、5000+动作描述、400种头部姿态;音频包含不同音色、情绪、语言。10%的长时用例覆盖3分钟到1小时,专门测试长时一致性。评估维度分为四个核心:一、动作动力学,评估动作时序连贯、物理合理性,惩罚畸变、闪烁、静态;二、身份一致性,评估面部、身体、外貌是否始终匹配参考;三、文本可控性,评估是否精准遵循文本的动作、表情、眼神指令;四、音视频同步,评估说话口型、倾听反应、对话切换的同步性。评估采用成对好坏相同(GSB)对比和1-5李克特量表绝对评分,保证结果的客观性。

Base LPM的评估在720P分辨率下,对比Kling-Avatar-2、OmniHuman-1.5、Wan2.1-I2V三大顶尖模型。人类偏好结果显示,Base LPM整体偏好率为64.3%,远超Kling-Avatar-2的24.4%。优势最明显的是身份一致性和文本可控性,分别达到了58.5%和55.7%;动作动力学也达到了46.2%。绝对评分显示,倾听场景评分最高,平均4.51分;音视频同步满分5.0分;说话场景平均3.91分;对话场景平均3.70分。核心瓶颈是长时多段落动作执行,而最核心的优势是Base LPM能生成分钟级稳定视频,而对比模型最多只能生成30秒,并且动作、表情、身份一致性全面落后。

Online LPM的评估在480P分辨率下,对比LiveAvatar、SoulX两大实时生成模型。结果显示,Online LPM整体偏好率为82.5%,远超LiveAvatar的12.5%。SoulX仅在身份一致性上占优,因为它限制了动作幅度;而Online LPM在动作动力学、文本可控性、音视频同步上全面领先。人类更偏好真实有活力的角色,而非僵硬但稳定的角色。对比Base LPM,Online LPM在倾听场景的细微表情上略有损失,但是在对话场景的长时身份一致性上反而更优,说话场景的动作流畅度更好,音视频同步几乎无差异,证明蒸馏没有牺牲核心能力,还提升了实时部署的稳定性。

最后,我们对LPM 1.0的整体成就、局限性及其未来发展方向进行总结。

总结、局限与未来方向

最后,我们来总结一下。LPM 1.0的核心突破是证明了表演三难困境可以通过数据、模型、蒸馏、部署的系统级协同设计解决。它是第一个能还原真人对话表演的视觉引擎,让虚拟角色真正成为参与者,而不只是一个播放画面。

不过,当前LPM 1.0的局限也很明确:交互仅支持单人面向镜头的场景,弱依赖于社交、物理、叙事环境;而且不支持长时对话记忆、多人交互、动态环境中的行为,以及任意视角的3D一致性。这些都是当前技术的边界。

而LPM 1.0未来的研发方向有三个:第一是时序维度,加入对话级记忆、角色人格持久化,让行为和历史事件连贯;第二是社交维度,支持多人交互、眼神分配、群体话轮转换;第三是物理维度,让角色行为和场景几何、物体、接触交互结合。最终实现统一的演员模型,联合决定说什么、怎么表达、行为如何展开。

从传统3D动画管线到AI视频生成,从单一说话头到全双工对话表演,LPM 1.0的出现标志着AI虚拟角色正式从画面走向表演,从工具走向伙伴。它破解的不仅是技术上的三难困境,更是虚拟角色交互的体验瓶颈。未来,我们很可能会看到游戏NPC能够自然倾听你的对话,直播间的虚拟人能实时回应你的情绪,甚至AI助手能像真人一样和你交流,很可能都是LPM在背后的支撑。

感谢收看本期视频,我们下期再见。

📌 文中提及的人物和组织

公司/组织: Anuttacon, 米哈游

产品/模型: LPM 1.0, Base LPM, Online LPM, Qwen3-Omni

关键字: virtual-characters conversational-ai video-generation real-time-interaction performance-modeling