乔木博客
全部
AI工具
AI教程
AI生成
AI资讯
健脑房
播客解读
论文学习
Qwen3.5-Omni:一篇读懂阿里最新全感官AI的深度解析
论文学习
·
2026年4月23日
·
1076 次阅读
·
约 31 分钟
2026年4月21日,阿里巴巴Qwen团队发布了Qwen3.5-Omni的技术报告。
这是目前公开的最强全模态大模型之一,在215个音视频评测任务上拿到了最高分,在多个关键指标上超越了谷歌的Gemini 3.1 Pro。
但数字本身不是最有意思的部分。
这篇文章会带你把技术报告里真正重要的内容都过一遍,包括那些藏在细节里、没有被大多数人注意到的东西。
https://www.alphaxiv.org/abs/2604.15804
一、先搞清楚"全模态"到底意味着什么
现有模型的工作方式
市面上大多数"多模态"模型,本质上是一条流水线:
语音输入 → 语音识别(ASR)转成文字 → 大语言模型处理文字 → 生成文字回复 → 语音合成(TTS)输出语音
这流水线有个根本性的问题:每一次转换都会丢失信息。
语气、情绪、停顿、背景声音、说话人的特征,在转成文字的那一刻全部消失了。
模型看到的是"我今天很好",但它不知道这句话是用颤抖的声音说的,还是用轻松愉快的语气说的。
视频也一样。
把视频帧转成图片描述,再喂给语言模型,模型失去了时间维度,失去了声音和画面的同步关系,失去了动作的连贯性。
Qwen3.5-Omni的做法
它直接处理原始信号。
音频就是音频,视频就是视频,不经过中间的文字转换步骤,它能同时理解视觉和听觉在时间轴上的对应关系。
二、为什么要把"思考"和"说话"分开
Qwen3.5-Omni的整体架构叫做Thinker-Talker(思考者-说话者)架构。
Thinker(思考者):负责理解世界
Thinker是模型的"大脑",负责接收所有输入并生成文字回复。
它接收三种信号:
文字:使用Qwen3.5的分词器(tokenizer,把文字切成模型能处理的小单元的工具),词表大小从上一代的15万扩展到25万,覆盖更多语言,编解码效率提升10%到60%。
音频:先把音频重采样到16kHz(每秒1.6万个采样点),转成梅尔频谱图(一种把声音转成视觉化频率分布图的方法),再通过专门训练的音频编码器AuT处理,每160毫秒输出一个音频token。
图像和视频:使用Qwen3.5的视觉编码器,对图像和视频帧统一处理,支持动态帧率采样。
Talker(说话者):负责开口说话
Talker不是独立的语音合成系统,而是一个专门负责生成语音的模块,直接从Thinker获取高层语义表征(也就是Thinker对内容的深度理解),而不是只拿到最终的文字。
这个设计的好处是:Talker知道的不只是"说什么",还知道"为什么这么说",因此能根据对话上下文动态调整语速、音量、情绪。
一个具体的例子:在多轮对话中,如果上文是一段紧张的讨论,Talker会自动调整语调,而不是每次都用同样的播报腔。
为什么要分开?
理解和生成是两种完全不同的认知模式,用同一套参数处理会相互干扰。
多模态理解需要海量异构数据(各种语言、各种场景的文字、图像、音频、视频),语音生成需要高质量的文字-语音配对数据。
把这两个目标塞进一个模型里,训练时会产生目标冲突。
分开之后,两个模块可以针对性优化,互不干扰,最终效果反而更好。
这和人脑的设计是一致的:神经科学发现,大脑的语言理解区域(韦尼克区)和语言生成区域(布洛卡区)是分开的,通过神经束连接协同工作。
三、AuT:专门为音频设计的"耳朵"
AuT(Audio Transformer,音频变换器)是Qwen3.5-Omni的音频编码器,从零开始训练。
训练规模
AuT消耗了4000万小时的音频-文字配对数据,由Qwen3-ASR自动生成标注。
这个数字什么概念?如果一个人不睡觉连续听,需要听4566年。
数据分布:中文、英文、多语言各占35%、35%、30%,覆盖超过20种语言。
技术细节
音频信号经过4个二维卷积模块(Conv2D,一种提取局部特征的神经网络层)进行16倍下采样,然后进入自注意力层,最终以6.25Hz的频率输出token,也就是每秒输出6.25个token,对应每个token覆盖约160毫秒的音频。
这个设计有个重要的工程考量:同时支持实时流式处理和离线完整音频理解。
通过动态注意力窗口大小训练机制,模型在两种场景下都能保持稳定性能,不需要为不同场景部署不同版本。
四、时间戳设计:让AI真正理解"什么时候发生了什么"
这是报告里一个被严重低估的技术细节。
旧方案的问题
上一代Qwen3-Omni使用TMRoPE(时间感知旋转位置编码,一种让模型理解时间顺序的技术),直接把绝对时间编码成位置ID。
这个方案有两个致命问题:
-
稀疏性问题:长视频中,视频帧的位置ID会变得极其稀疏。比如一段10分钟的视频,帧与帧之间的位置ID差距很大,模型很难从这些稀疏的数字里学到有意义的时间关系。
-
数据成本问题:要让模型学好这种编码方式,需要大量不同帧率的训练样本,而且分布要均匀,数据构建成本极高。
新方案:直接插入文字时间戳
Qwen3.5-Omni的解决方案出人意料地简单:在每个视频帧或音频片段前面,直接插入一个格式化的文字时间戳,比如"[00:01:23]"。
对于音频,还会在随机位置插入额外的时间戳,进一步强化时间对齐。
这个方案虽然会略微增加上下文长度,但带来了三个好处:
模型可以用处理自然语言的方式学习时间关系,更自然
不需要特殊的位置编码设计,泛化性更好
支持任意时长的流式输入,没有长度上限
技术细节:音频每160毫秒一个时间ID,视频帧的时间ID根据实际时间戳动态调整,确保每个时间ID对应160毫秒的一致时间分辨率。
多模态输入时,位置编号连续不重叠,每种模态从上一种模态的最大位置ID加1开始编号。
五、ARIA:解决"AI说话磕巴"的根本方案
这是Qwen3.5-Omni最重要的技术创新之一,也是最难解释清楚的一个。
问题的根源
流式语音合成(边生成边播放,而不是等全部生成完再播放)有一个长期存在的稳定性问题:文字和语音的编码效率不匹配。
什么意思?一个英文单词"hello",文字tokenizer(分词器)可能把它切成1个token,但语音tokenizer可能需要10个音频token来表示它的发音。
一个中文词"人工智能",文字可能是2个token,语音可能是20个音频token。
如果按固定比例交错生成文字token和语音token,遇到长词、复杂词、或者不同语言时,比例就会失衡,导致:
跳字(某些词被跳过没有发音)
发音错误(音节被截断或重复)
数字读法混乱("1314"该读"一三一四"还是"一千三百一十四")
ARIA的解法
ARIA(Adaptive Rate Interleave Alignment,自适应速率交错对齐)的核心思想是:不用固定比例,改用动态约束。
具体规则是:在已生成的序列中,语音token的累计数量与文字token的累计数量之比,不能超过全局的平均比例。
这个约束看起来简单,但效果很强:
遇到短词,语音token少,比例低于上限,没问题
遇到长词,语音token多,但只要累计比例不超标,就继续生成
系统自动在短词和长词之间平衡,整体比例始终稳定
更重要的是,ARIA把原来Qwen3-Omni的"双轨生成"(文字和语音分两条轨道并行生成)改成了"单轨交错生成"(文字和语音在同一条序列里交替出现)。
这减少了两条轨道之间的同步开销,让调度更高效,也更适合流式交互的场景。
实际效果
延迟数据:
版本
音频输入首包延迟
视频输入首包延迟
Qwen3.5-Omni-Flash
235ms
426ms
Qwen3.5-Omni-Plus
435ms
651ms
235毫秒是什么概念?人类感知对话延迟的阈值大约是300毫秒,低于这个值基本感觉不到卡顿。
Flash版本已经低于这个阈值。
六、Hybrid MoE:让千亿参数模型跑得起来的关键
Qwen3.5-Omni的Thinker和Talker都采用了Hybrid MoE(混合专家混合注意力)架构。
这是理解模型为什么能在保持超大规模的同时,还能做到低延迟的关键。
什么是MoE
MoE(Mixture of Experts,混合专家)是一种让模型"按需激活"的架构。
传统模型处理每个token时,所有参数都会参与计算。
MoE模型则把参数分成很多组"专家",每次只激活其中几组,其他的保持休眠。
结果是:模型总参数量很大("百亿级别"),但实际每次推理时激活的参数量只有一小部分,计算量大幅降低。
Hybrid(混合)的含义
"Hybrid"指的是把标准注意力层和GDN(Gated Delta Net,门控增量网络)混合使用。
GDN是一种专门针对长序列的优化模块。
标准注意力机制(Transformer的核心)在处理长序列时,KV缓存(Key-Value Cache,存储历史信息的缓存)会随序列长度线性增长,I/O开销极大。
GDN通过增量更新的方式,显著减少了长音视频序列的缓存读写开销。
实际影响:在高并发场景下,生成吞吐量更高,能同时服务更多用户。
并发性能数据
几个关键数字:
Generation RTF(实时因子,生成速度与播放速度的比值):Flash版本在8并发下是0.257,Plus版本是0.334。这意味着模型生成语音的速度是播放速度的3-4倍,有足够的缓冲余量保证流畅播放。
Thinker TPS(每秒生成token数):Flash版本单并发177个/秒,8并发时达到942个/秒,规模效应明显。
七、预训练:4万亿token,三个阶段
Qwen3.5-Omni的预训练数据规模和策略,是理解它为什么强的基础。
数据规模
总训练数据约4万亿token,分布如下:
模态
数据量
纯文本
0.92万亿token
音频
1.99万亿token
图像
0.95万亿token
视频(无音频)
0.14万亿token
视频+音频
0.29万亿token
一个值得注意的细节:音频数据占了将近一半。
这说明阿里在这一代模型上对音频理解的重视程度远超视觉。
另外,Qwen3.5-Omni还使用了超过1亿小时的音视频内容进行训练,这是多模态联合理解能力的基础。
三个训练阶段
第一阶段:编码器对齐(S1)
冻结语言模型参数,只训练视觉编码器和音频编码器,让它们学会把视觉、音频信号转换成语言模型能理解的表征。
这一步先训练适配器(adapter,连接编码器和语言模型的桥接层),再训练编码器本身。
第二阶段:通用训练(S2)
解冻所有参数,用全部4万亿token数据进行大规模联合训练,序列长度32768个token。
这一阶段引入了更多样的多模态数据和任务类型,提升跨模态理解和交互能力。
第三阶段:长上下文训练(S3)
把最大序列长度从32768扩展到262144(约256k),同时提高长音频和长视频在训练数据中的比例。
这一阶段专门针对长内容理解能力进行优化。
八、后训练:Thinker的三阶段精调
预训练完成后,模型还需要经过后训练才能真正"好用"。
Thinker的后训练分三个阶段,每个阶段解决不同的问题。
第一阶段:专家蒸馏
先训练一批"专科老师"模型:文字推理专家、视觉理解专家、音频理解专家,分别在各自领域做到最强。
然后用这些专家生成的高质量数据,蒸馏(distillation,让学生模型学习老师模型的输出)到Qwen3.5-Omni这一个统一模型里。
这个方法的好处是:不需要在一个模型里同时优化所有能力,而是先让专家做到极致,再把知识合并。
第二阶段:在线策略蒸馏(OPD)
这一阶段解决一个具体问题:模型在文字输入下的回复质量,明显好于音频输入下的回复质量。
原因很直觉:文字是模型最熟悉的输入形式,训练数据也最多。
音频输入经过编码后,表征质量相对较低,导致回复质量下降。
OPD(On-Policy Distillation,在线策略蒸馏)的做法:对于同一个问题,先用文字版本获得高质量回复,再把这个回复作为音频版本的训练目标。
让模型学会:不管输入是文字还是音频,输出的质量应该一样高。
这个方法有个技术细节值得注意:是"在线"蒸馏,意味着蒸馏目标是模型当前状态下生成的回复,而不是固定的历史数据。
这让训练目标始终与模型当前能力匹配,避免了目标过高或过低的问题。
第三阶段:交互对齐强化学习
前两个阶段解决了"能力"问题,第三阶段解决"体验"问题。
在多轮对话中,模型会出现三类问题:
语言代码切换:中文对话里突然冒出英文
人设不一致:同一个对话里,模型的"性格"前后矛盾
长上下文指令遵循退化:对话轮数越多,越容易忘记前面的指令
通过构建多轮对话轨迹,设计针对这些问题的奖励信号,用强化学习让模型学会在长对话中保持稳定、一致、符合用户期望的行为。
九、Talker的四阶段训练
语音生成模块Talker有独立的四阶段训练流程,每个阶段针对不同的质量维度。
第一阶段:通用预训练
使用超过2000万小时的多语言语音数据,配合多模态上下文进行训练。
这一阶段不只是学习"文字到语音的映射",还要学习根据上下文调整副语言特征(paralinguistic features,包括语速、音调、情绪等超出文字内容本身的语音特征)。
第二阶段:长上下文精调
通过专门的数据质量筛选流程,对高质量子集进行持续预训练(CPT),同时用Qwen3-Omni-Captioner(一个专门生成音视频描述的模型)增强数据质量,减少噪声数据引入的幻觉。
最大上下文长度扩展到64k token。
第三阶段:强化学习对齐
使用DPO(Direct Preference Optimization,直接偏好优化,一种让模型学习人类偏好的训练方法)进行多语言偏好对齐,结合规则奖励和GSPO(Group Sequence Policy Optimization,组序列策略优化,一种提升训练稳定性的方法)进一步提升整体能力和训练稳定性。
第四阶段:说话人微调
在基础模型上进行轻量级说话人微调,让模型能够精准捕捉目标说话人的音色特征,同时提升自然度、表现力和可控性。
这一阶段是零样本声音克隆能力的基础。
十、多语言能力:数字背后的真实含义
三个数字的非对称性
语音识别(输入):113种语言
语音合成(输出):36种语言
文字理解:201种语言
这个非对称性不是技术限制,而是刻意的产品决策。
语音识别的价值在于覆盖面,能识别就有价值。
语音合成的价值在于质量,合成质量差的语音会直接伤害用户体验。
Qwen选择在36种语言上做到极致,而不是在100种语言上做到"能用"。
中文方言的覆盖
报告里列出了39种中文方言的语音识别支持,包括粤语(广东和香港两个版本)、闽南语、客家话、四川话、上海话、天津话等。
这个覆盖范围在目前所有公开模型中是最广的。
语音合成支持7种中文方言:四川话、北京话、天津话、南京话、陕西话、粤语、闽南语。
评测数据的亮点
在FLEURS测试集(一个覆盖60种语言的标准语音评测集)上,Qwen3.5-Omni-Plus的平均词错率(WER,越低越好)是6.6%,优于Gemini 3.1 Pro的7.3%和GPT-4o-Transcribe的10.4%。
特别值得注意的是粤语:Qwen3.5-Omni-Plus的词错率是2.2%,Gemini 3.1 Pro是6.3%,差距接近3倍。
这反映了中文系语言上的明显优势。
十一、评测结果全景:215个任务说明了什么
文字能力:全模态不牺牲单模态
这是最反常识的发现。
Qwen3.5-Omni-Plus在纯文字任务上的表现,与同规模的纯文字模型Qwen3.5-Plus-Instruct几乎持平:
几个关键数字:
MMLU-Pro(综合知识评测):Qwen3.5-Plus-Instruct 86.8,Qwen3.5-Omni-Plus 85.9
IFEval(指令遵循):两者都是89.7,完全持平
GPQA(研究生级科学问答):Qwen3.5-Plus-Instruct 85.9,Qwen3.5-Omni-Plus 83.9
在指令遵循任务(IFBench)上,Qwen3.5-Omni-Plus得分51.1,甚至超过了纯文字模型的51.1分(原文显示Omni-Plus为52.6,略高于基线51.1)。
这打破了"多模态模型必然牺牲文字能力"的假设。
音频能力:全面超越Gemini 3.1 Pro
几个亮点:
音乐理解:RUL-MuchoMusic评测中,Qwen3.5-Omni-Plus得分72.4,Gemini 3.1 Pro只有59.6,差距超过12个百分点。
语音对话:VoiceBench评测中,Qwen3.5-Omni-Plus得分93.1,Gemini 3.1 Pro为88.9。
ASR(语音识别):在LibriSpeech(英语标准测试集)上,词错率1.11%(干净音频)和2.23%(嘈杂音频),均优于Gemini 3.1 Pro的3.36%和4.41%。
中文方言ASR:在Common Voice测试集上,粤语词错率1.95%,Gemini 3.1 Pro为13.40%,差距接近7倍。
歌声识别:在MIR-1K(人声分离)测试集上,词错率4.56%,优于Gemini 3.1 Pro的8.76%。这说明模型不只是识别正常说话,还能理解歌唱中的歌词。
视觉能力:与专门视觉模型持平
Qwen3.5-Omni-Plus在大多数视觉任务上与Qwen3.5-Plus-Instruct(专门的视觉语言模型)持平,在视频理解任务上甚至更强:
VideoMME(无字幕):Omni-Plus 81.9 vs Plus-Instruct 81.0
MLVU(长视频理解):Omni-Plus 86.8 vs Plus-Instruct 85.1
MVBench(多任务视频理解):Omni-Plus 79.0 vs Plus-Instruct 76.7
视频任务上的优势,来自于音视频联合训练带来的时序理解能力提升。
音视频联合理解
在DailyOmni(日常音视频理解)评测上,Qwen3.5-Omni-Plus得分84.6,超过Gemini 3.1 Pro的82.7。
在Qualcomm IVD(真实场景音视频交互)评测上,Qwen3.5-Omni-Plus得分68.5,Gemini 3.1 Pro为66.2。
在OmniCloze(音视频字幕生成)上,Qwen3.5-Omni-Plus得分64.8,超过Gemini 3.1 Pro的57.2。
工具调用(OmniGAIA)上,Qwen3.5-Omni-Plus得分57.2,Gemini 3.1 Pro为68.9,这是目前相对较弱的方向,有提升空间。
十二、语音生成评测:与商业顶级系统的正面对比
零样本TTS:历史最佳
在SEED-TTS(一个标准的零样本语音合成评测集)上,Qwen3.5-Omni-Plus在英文测试集上的词错率达到1.26%,是所有对比系统中最低的,包括CosyVoice 3(1.45%)、MiniMax-Speech(1.65%)等商业系统。
多语言语音生成:29种语言,22种最优
在29种语言的评测中,Qwen3.5-Omni-Plus在22种语言上的词错率最低,同时在说话人相似度(声音克隆保真度)上也全面领先MiniMax-Speech和ElevenLabs。
几个极端案例:
泰语:Qwen3.5-Omni-Plus词错率2.170,ElevenLabs高达73.936(基本不可用)
越南语:Qwen3.5-Omni-Plus词错率1.143,ElevenLabs高达73.415
日语:Qwen3.5-Omni-Plus词错率3.479,ElevenLabs为10.046
跨语言声音克隆
跨语言声音克隆的意思是:用A语言的声音样本,生成B语言的语音,同时保持声音特征不变。
在12个语言对中,Qwen3.5-Omni-Plus在10个上取得最低错误率。
最显著的案例是中文到韩语:Qwen3.5-Omni-Plus的混合错误率是4.03,CosyVoice 3高达14.4,相对降低了72%。
自定义声音生成
这里有个重要细节:Qwen3.5-Omni的说话人微调只在单语言数据上训练,但在29种语言的跨语言迁移上仍然表现优秀,在10种语言上取得最低词错率。
这说明模型学到的声音特征表征具有很强的语言无关性,声音的"身份"和"语言"在模型内部是解耦的。
十三、三个新能力:这才是真正的产品机会
1. 可控音视频字幕生成
Qwen3.5-Omni可以生成剧本级别的结构化字幕,包括:
自动场景分割(判断场景切换点)
精确时间戳标注
人物描述及其与音频的关系
可控的详细程度(从简短摘要到逐帧描述)
这个能力的产品价值是:视频内容的自动化结构化处理。
一段1小时的会议视频,可以自动生成带时间戳的议题摘要、发言人识别、关键决策提取,不需要任何人工干预。
2. 全面实时交互
三个具体能力:
语义打断:模型能识别用户的打断意图,不是检测到声音就停止,而是理解用户是真的想打断还是只是发出了背景声音。
这是通过原生的轮次切换意图识别实现的,不依赖外部的VAD(Voice Activity Detection,语音活动检测)模块。
端到端语音控制:用户可以直接用语音控制AI的音量、语速、情绪,不需要通过文字指令。
比如说"说慢一点",AI会立即调整语速,而不是先把这句话转成文字再处理。
声音克隆:用户提供几秒钟的声音样本,模型就能用这个声音风格进行后续对话。
3. 原生全模态智能体行为
这是最值得关注的能力方向。
Qwen3.5-Omni不只是一个"理解"模型,还是一个"行动"模型,支持:
自主WebSearch:模型能自己判断什么时候需要搜索,发起搜索,整合结果,不需要外部编排。
复杂FunctionCall:调用外部工具和API,处理复杂的多步骤任务。
Audio-Visual Vibe Coding(音视频氛围编程):这是一个涌现出来的能力,没有被专门训练。
给模型看一段视频或图像,它能直接生成实现相同视觉效果的代码。
这个能力的出现说明了一件事:当模型真正理解了视觉内容的逻辑结构,它自然获得了把这个结构转化为代码的能力。
这不是识别,而是推理。
十四、翻译能力:一个被忽视的强项
Qwen3.5-Omni-Plus在语音翻译上表现出色。
在英文到其他语言(en2xx)方向,平均BLEU分数33.8,优于Gemini 3.1 Pro的31.8。在中文到其他语言(zh2xx)方向,平均21.4,优于Gemini 3.1 Pro的19.6。
粤语方向的优势尤其突出:
英文到粤语:Qwen3.5-Omni-Plus 40.1 vs Gemini 3.1 Pro 25.5
粤语到中文:Qwen3.5-Omni-Plus 36.8 vs Gemini 3.1 Pro 21.2
这种优势在Flash版本上同样显著,说明不只是靠参数规模堆出来的。
十五、留给产品经理和创业者的判断框架
什么时候用Qwen3.5-Omni
场景一:音视频内容的深度理解 会议录音分析、播客摘要、视频内容审核、多语言字幕生成。
这类场景的核心价值是消除"切片-转写-处理"的工程复杂度,直接端到端处理。
场景二:实时语音交互产品 235ms的首包延迟,加上语义打断和情绪感知,已经达到构建自然语音助手的基本门槛。
特别适合需要多语言支持的场景。
场景三:跨模态内容创作 声音克隆、多语言配音、视频内容的音频替换。
Qwen3.5-Omni在声音保真度和跨语言迁移上的表现,已经接近商业顶级系统。
场景四:多模态智能体 需要同时处理视觉、听觉输入并执行工具调用的复杂任务。
Audio-Visual Vibe Coding这类涌现能力,可以探索用于UI自动化、视觉编程辅助等方向。
什么时候不需要用
如果你的场景只是"把语音转成文字再处理",传统ASR加语言模型的流水线可能更经济。
端到端多模态模型的价值,在于跨模态的关联理解,而不是单纯的转写。
关于涌现能力的风险提示
Audio-Visual Vibe Coding这类涌现能力,边界不清晰,在某些情况下可能失效。
不要把涌现能力作为核心功能交付,而要作为探索方向。
用它发现新需求,但关键服务要依赖有明确评测基准的稳定能力。
十六、一个更深的问题
Qwen3.5-Omni的技术报告里,有一句话值得反复思考:
"真实世界的现象中,视觉和听觉是内在耦合的,而不是独立处理的。"
我们过去构建AI系统的方式,是把世界切割成文字、图像、声音,分别建模,再拼接起来。
这个方式有效,但它处理的不是真实世界,而是真实世界的投影。
Qwen3.5-Omni的实践证明,当你让模型直接面对耦合的多模态信号时,它不只是在各个模态上分别变强,而是获得了一种新的理解维度。
文字能力没有下降,视觉能力没有下降,但多模态联合理解出现了单模态训练无法获得的能力。
这个发现的意义可能远超一个模型的发布:未来可能不存在"文字模型"和"多模态模型"的区分,因为多模态才是学习世界知识最自然、最高效的方式。
就像人类从来没有把"看"和"听"分开学习一样。
论文一些有趣的发现
- 多模态训练不会削弱文字能力,反而会增强它
所有人都以为,把参数分给视觉和音频,文字能力必然下降。Qwen3.5-Omni的实测结果是:指令遵循能力比同规模纯文字模型还高。原因可能是,多模态训练让模型从更多角度理解同一个概念,反而加深了语言理解。
- AI说话"磕巴"的根本原因,不是算力不够,是文字和语音的编码效率天生不匹配
"hello"在文字里是1个token,在语音里可能是10个音频token。
按固定比例生成就会跳字、发音错误、数字读法混乱。
Qwen3.5-Omni的ARIA机制用动态约束解决了这个问题,而不是靠堆算力。
- 给AI插入文字时间戳,比专门设计时间编码效果更好
工程师的直觉是:时间感知需要专门的位置编码算法。
Qwen团队发现,直接在音视频片段前插入"[00:01:23]"这样的文字时间戳,模型反而学得更好、泛化性更强,还不需要大量均匀分布的训练数据。越简单的方案,有时候越有效。
- 语音识别支持113种语言,但语音合成只支持36种,这不是技术限制,是刻意的
覆盖面广的识别能让更多用户接入,但合成质量差会直接伤害体验。
Qwen选择在36种语言上做到极致,而不是在100种语言上做到"能用"。产品决策有时候比技术突破更重要。
- 粤语识别,Qwen3.5-Omni的错误率比Gemini 3.1 Pro低将近3倍
Qwen3.5-Omni-Plus粤语词错率2.2%,Gemini 3.1 Pro是6.3%。
这个差距不是微小优化,是数量级差异。在亚洲语言和方言上,中国团队的模型有系统性优势,这个规律在越南语、泰语上同样成立。
- 声音克隆只用单语言数据训练,却能迁移到29种语言
说话人微调阶段只用了单语言数据,但模型在跨语言声音迁移上依然表现优秀。
这说明模型内部把"声音身份"和"语言"完全解耦了。声音的特征是语言无关的,这个发现对配音、数字人等应用有直接价值。
- "音视频氛围编程"这个能力,没有被专门训练,是自己涌现出来的
给模型看一段视频,它能直接生成实现相同视觉效果的代码。
这个能力没有对应的训练任务,是在大规模多模态预训练中自发出现的。当模型真正理解了视觉逻辑,它自然获得了把逻辑转化为代码的能力。
- 理解和生成用同一套参数处理,反而是错的
直觉上,一个统一的大模型应该什么都能做。但Qwen3.5-Omni把"思考"和"说话"分成两个模块,效果反而更好。
多模态理解和语音生成的训练目标天生冲突,分开才能各自做到极致。人脑的语言理解区和语言生成区也是分开的。
- 模型生成语音的速度,是实际播放速度的3到4倍
很多人以为流式语音是"刚好够用"的速度。实际上Qwen3.5-Omni的生成实时因子(RTF)在0.18到0.33之间,意味着模型生成速度远超播放速度,有大量缓冲余量。
这才是流畅体验的真正来源,不是靠压缩延迟,而是靠足够快的生成速度。
- 音频数据占了整个预训练数据的将近一半
4万亿token的训练数据里,音频占了1.99万亿,比文字(0.92万亿)和图像(0.95万亿)加起来还多。这不是偶然,而是阿里对"音频是被严重低估的模态"这个判断的押注。下一个AI应用爆发点,可能不在视觉,在声音。
© 2026
·
向阳乔木
📌 文中提及的人物和组织
产品/模型: Qwen3.5-Omni, Gemini 3.1 Pro