Qwen3.5-Omni:一篇读懂阿里最新全感官AI的深度解析 · 乔木博客 向阳乔木 2026-04-23

乔木博客

全部

AI工具

AI教程

AI生成

AI资讯

健脑房

播客解读

论文学习

Qwen3.5-Omni:一篇读懂阿里最新全感官AI的深度解析

论文学习

·

2026年4月23日

·

1076 次阅读

·

约 31 分钟

2026年4月21日,阿里巴巴Qwen团队发布了Qwen3.5-Omni的技术报告。

这是目前公开的最强全模态大模型之一,在215个音视频评测任务上拿到了最高分,在多个关键指标上超越了谷歌的Gemini 3.1 Pro。

但数字本身不是最有意思的部分。

这篇文章会带你把技术报告里真正重要的内容都过一遍,包括那些藏在细节里、没有被大多数人注意到的东西。

https://www.alphaxiv.org/abs/2604.15804

一、先搞清楚"全模态"到底意味着什么

现有模型的工作方式

市面上大多数"多模态"模型,本质上是一条流水线:

语音输入 → 语音识别(ASR)转成文字 → 大语言模型处理文字 → 生成文字回复 → 语音合成(TTS)输出语音

这流水线有个根本性的问题:每一次转换都会丢失信息。

语气、情绪、停顿、背景声音、说话人的特征,在转成文字的那一刻全部消失了。

模型看到的是"我今天很好",但它不知道这句话是用颤抖的声音说的,还是用轻松愉快的语气说的。

视频也一样。

把视频帧转成图片描述,再喂给语言模型,模型失去了时间维度,失去了声音和画面的同步关系,失去了动作的连贯性。

Qwen3.5-Omni的做法

它直接处理原始信号。

音频就是音频,视频就是视频,不经过中间的文字转换步骤,它能同时理解视觉和听觉在时间轴上的对应关系。

二、为什么要把"思考"和"说话"分开

Qwen3.5-Omni的整体架构叫做Thinker-Talker(思考者-说话者)架构。

Thinker(思考者):负责理解世界

Thinker是模型的"大脑",负责接收所有输入并生成文字回复。

它接收三种信号:

文字:使用Qwen3.5的分词器(tokenizer,把文字切成模型能处理的小单元的工具),词表大小从上一代的15万扩展到25万,覆盖更多语言,编解码效率提升10%到60%。

音频:先把音频重采样到16kHz(每秒1.6万个采样点),转成梅尔频谱图(一种把声音转成视觉化频率分布图的方法),再通过专门训练的音频编码器AuT处理,每160毫秒输出一个音频token。

图像和视频:使用Qwen3.5的视觉编码器,对图像和视频帧统一处理,支持动态帧率采样。

Talker(说话者):负责开口说话

Talker不是独立的语音合成系统,而是一个专门负责生成语音的模块,直接从Thinker获取高层语义表征(也就是Thinker对内容的深度理解),而不是只拿到最终的文字。

这个设计的好处是:Talker知道的不只是"说什么",还知道"为什么这么说",因此能根据对话上下文动态调整语速、音量、情绪。

一个具体的例子:在多轮对话中,如果上文是一段紧张的讨论,Talker会自动调整语调,而不是每次都用同样的播报腔。

为什么要分开?

理解和生成是两种完全不同的认知模式,用同一套参数处理会相互干扰。

多模态理解需要海量异构数据(各种语言、各种场景的文字、图像、音频、视频),语音生成需要高质量的文字-语音配对数据。

把这两个目标塞进一个模型里,训练时会产生目标冲突。

分开之后,两个模块可以针对性优化,互不干扰,最终效果反而更好。

这和人脑的设计是一致的:神经科学发现,大脑的语言理解区域(韦尼克区)和语言生成区域(布洛卡区)是分开的,通过神经束连接协同工作。

三、AuT:专门为音频设计的"耳朵"

AuT(Audio Transformer,音频变换器)是Qwen3.5-Omni的音频编码器,从零开始训练。

训练规模

AuT消耗了4000万小时的音频-文字配对数据,由Qwen3-ASR自动生成标注。

这个数字什么概念?如果一个人不睡觉连续听,需要听4566年。

数据分布:中文、英文、多语言各占35%、35%、30%,覆盖超过20种语言。

技术细节

音频信号经过4个二维卷积模块(Conv2D,一种提取局部特征的神经网络层)进行16倍下采样,然后进入自注意力层,最终以6.25Hz的频率输出token,也就是每秒输出6.25个token,对应每个token覆盖约160毫秒的音频。

这个设计有个重要的工程考量:同时支持实时流式处理和离线完整音频理解。

通过动态注意力窗口大小训练机制,模型在两种场景下都能保持稳定性能,不需要为不同场景部署不同版本。

四、时间戳设计:让AI真正理解"什么时候发生了什么"

这是报告里一个被严重低估的技术细节。

旧方案的问题

上一代Qwen3-Omni使用TMRoPE(时间感知旋转位置编码,一种让模型理解时间顺序的技术),直接把绝对时间编码成位置ID。

这个方案有两个致命问题:

  1. 稀疏性问题:长视频中,视频帧的位置ID会变得极其稀疏。比如一段10分钟的视频,帧与帧之间的位置ID差距很大,模型很难从这些稀疏的数字里学到有意义的时间关系。

  2. 数据成本问题:要让模型学好这种编码方式,需要大量不同帧率的训练样本,而且分布要均匀,数据构建成本极高。

新方案:直接插入文字时间戳

Qwen3.5-Omni的解决方案出人意料地简单:在每个视频帧或音频片段前面,直接插入一个格式化的文字时间戳,比如"[00:01:23]"。

对于音频,还会在随机位置插入额外的时间戳,进一步强化时间对齐。

这个方案虽然会略微增加上下文长度,但带来了三个好处:

模型可以用处理自然语言的方式学习时间关系,更自然

不需要特殊的位置编码设计,泛化性更好

支持任意时长的流式输入,没有长度上限

技术细节:音频每160毫秒一个时间ID,视频帧的时间ID根据实际时间戳动态调整,确保每个时间ID对应160毫秒的一致时间分辨率。

多模态输入时,位置编号连续不重叠,每种模态从上一种模态的最大位置ID加1开始编号。

五、ARIA:解决"AI说话磕巴"的根本方案

这是Qwen3.5-Omni最重要的技术创新之一,也是最难解释清楚的一个。

问题的根源

流式语音合成(边生成边播放,而不是等全部生成完再播放)有一个长期存在的稳定性问题:文字和语音的编码效率不匹配。

什么意思?一个英文单词"hello",文字tokenizer(分词器)可能把它切成1个token,但语音tokenizer可能需要10个音频token来表示它的发音。

一个中文词"人工智能",文字可能是2个token,语音可能是20个音频token。

如果按固定比例交错生成文字token和语音token,遇到长词、复杂词、或者不同语言时,比例就会失衡,导致:

跳字(某些词被跳过没有发音)

发音错误(音节被截断或重复)

数字读法混乱("1314"该读"一三一四"还是"一千三百一十四")

ARIA的解法

ARIA(Adaptive Rate Interleave Alignment,自适应速率交错对齐)的核心思想是:不用固定比例,改用动态约束。

具体规则是:在已生成的序列中,语音token的累计数量与文字token的累计数量之比,不能超过全局的平均比例。

这个约束看起来简单,但效果很强:

遇到短词,语音token少,比例低于上限,没问题

遇到长词,语音token多,但只要累计比例不超标,就继续生成

系统自动在短词和长词之间平衡,整体比例始终稳定

更重要的是,ARIA把原来Qwen3-Omni的"双轨生成"(文字和语音分两条轨道并行生成)改成了"单轨交错生成"(文字和语音在同一条序列里交替出现)。

这减少了两条轨道之间的同步开销,让调度更高效,也更适合流式交互的场景。

实际效果

延迟数据:

版本

音频输入首包延迟

视频输入首包延迟

Qwen3.5-Omni-Flash

235ms

426ms

Qwen3.5-Omni-Plus

435ms

651ms

235毫秒是什么概念?人类感知对话延迟的阈值大约是300毫秒,低于这个值基本感觉不到卡顿。

Flash版本已经低于这个阈值。

六、Hybrid MoE:让千亿参数模型跑得起来的关键

Qwen3.5-Omni的Thinker和Talker都采用了Hybrid MoE(混合专家混合注意力)架构。

这是理解模型为什么能在保持超大规模的同时,还能做到低延迟的关键。

什么是MoE

MoE(Mixture of Experts,混合专家)是一种让模型"按需激活"的架构。

传统模型处理每个token时,所有参数都会参与计算。

MoE模型则把参数分成很多组"专家",每次只激活其中几组,其他的保持休眠。

结果是:模型总参数量很大("百亿级别"),但实际每次推理时激活的参数量只有一小部分,计算量大幅降低。

Hybrid(混合)的含义

"Hybrid"指的是把标准注意力层和GDN(Gated Delta Net,门控增量网络)混合使用。

GDN是一种专门针对长序列的优化模块。

标准注意力机制(Transformer的核心)在处理长序列时,KV缓存(Key-Value Cache,存储历史信息的缓存)会随序列长度线性增长,I/O开销极大。

GDN通过增量更新的方式,显著减少了长音视频序列的缓存读写开销。

实际影响:在高并发场景下,生成吞吐量更高,能同时服务更多用户。

并发性能数据

几个关键数字:

Generation RTF(实时因子,生成速度与播放速度的比值):Flash版本在8并发下是0.257,Plus版本是0.334。这意味着模型生成语音的速度是播放速度的3-4倍,有足够的缓冲余量保证流畅播放。

Thinker TPS(每秒生成token数):Flash版本单并发177个/秒,8并发时达到942个/秒,规模效应明显。

七、预训练:4万亿token,三个阶段

Qwen3.5-Omni的预训练数据规模和策略,是理解它为什么强的基础。

数据规模

总训练数据约4万亿token,分布如下:

模态

数据量

纯文本

0.92万亿token

音频

1.99万亿token

图像

0.95万亿token

视频(无音频)

0.14万亿token

视频+音频

0.29万亿token

一个值得注意的细节:音频数据占了将近一半。

这说明阿里在这一代模型上对音频理解的重视程度远超视觉。

另外,Qwen3.5-Omni还使用了超过1亿小时的音视频内容进行训练,这是多模态联合理解能力的基础。

三个训练阶段

第一阶段:编码器对齐(S1)

冻结语言模型参数,只训练视觉编码器和音频编码器,让它们学会把视觉、音频信号转换成语言模型能理解的表征。

这一步先训练适配器(adapter,连接编码器和语言模型的桥接层),再训练编码器本身。

第二阶段:通用训练(S2)

解冻所有参数,用全部4万亿token数据进行大规模联合训练,序列长度32768个token。

这一阶段引入了更多样的多模态数据和任务类型,提升跨模态理解和交互能力。

第三阶段:长上下文训练(S3)

把最大序列长度从32768扩展到262144(约256k),同时提高长音频和长视频在训练数据中的比例。

这一阶段专门针对长内容理解能力进行优化。

八、后训练:Thinker的三阶段精调

预训练完成后,模型还需要经过后训练才能真正"好用"。

Thinker的后训练分三个阶段,每个阶段解决不同的问题。

第一阶段:专家蒸馏

先训练一批"专科老师"模型:文字推理专家、视觉理解专家、音频理解专家,分别在各自领域做到最强。

然后用这些专家生成的高质量数据,蒸馏(distillation,让学生模型学习老师模型的输出)到Qwen3.5-Omni这一个统一模型里。

这个方法的好处是:不需要在一个模型里同时优化所有能力,而是先让专家做到极致,再把知识合并。

第二阶段:在线策略蒸馏(OPD)

这一阶段解决一个具体问题:模型在文字输入下的回复质量,明显好于音频输入下的回复质量。

原因很直觉:文字是模型最熟悉的输入形式,训练数据也最多。

音频输入经过编码后,表征质量相对较低,导致回复质量下降。

OPD(On-Policy Distillation,在线策略蒸馏)的做法:对于同一个问题,先用文字版本获得高质量回复,再把这个回复作为音频版本的训练目标。

让模型学会:不管输入是文字还是音频,输出的质量应该一样高。

这个方法有个技术细节值得注意:是"在线"蒸馏,意味着蒸馏目标是模型当前状态下生成的回复,而不是固定的历史数据。

这让训练目标始终与模型当前能力匹配,避免了目标过高或过低的问题。

第三阶段:交互对齐强化学习

前两个阶段解决了"能力"问题,第三阶段解决"体验"问题。

在多轮对话中,模型会出现三类问题:

语言代码切换:中文对话里突然冒出英文

人设不一致:同一个对话里,模型的"性格"前后矛盾

长上下文指令遵循退化:对话轮数越多,越容易忘记前面的指令

通过构建多轮对话轨迹,设计针对这些问题的奖励信号,用强化学习让模型学会在长对话中保持稳定、一致、符合用户期望的行为。

九、Talker的四阶段训练

语音生成模块Talker有独立的四阶段训练流程,每个阶段针对不同的质量维度。

第一阶段:通用预训练

使用超过2000万小时的多语言语音数据,配合多模态上下文进行训练。

这一阶段不只是学习"文字到语音的映射",还要学习根据上下文调整副语言特征(paralinguistic features,包括语速、音调、情绪等超出文字内容本身的语音特征)。

第二阶段:长上下文精调

通过专门的数据质量筛选流程,对高质量子集进行持续预训练(CPT),同时用Qwen3-Omni-Captioner(一个专门生成音视频描述的模型)增强数据质量,减少噪声数据引入的幻觉。

最大上下文长度扩展到64k token。

第三阶段:强化学习对齐

使用DPO(Direct Preference Optimization,直接偏好优化,一种让模型学习人类偏好的训练方法)进行多语言偏好对齐,结合规则奖励和GSPO(Group Sequence Policy Optimization,组序列策略优化,一种提升训练稳定性的方法)进一步提升整体能力和训练稳定性。

第四阶段:说话人微调

在基础模型上进行轻量级说话人微调,让模型能够精准捕捉目标说话人的音色特征,同时提升自然度、表现力和可控性。

这一阶段是零样本声音克隆能力的基础。

十、多语言能力:数字背后的真实含义

三个数字的非对称性

语音识别(输入):113种语言

语音合成(输出):36种语言

文字理解:201种语言

这个非对称性不是技术限制,而是刻意的产品决策。

语音识别的价值在于覆盖面,能识别就有价值。

语音合成的价值在于质量,合成质量差的语音会直接伤害用户体验。

Qwen选择在36种语言上做到极致,而不是在100种语言上做到"能用"。

中文方言的覆盖

报告里列出了39种中文方言的语音识别支持,包括粤语(广东和香港两个版本)、闽南语、客家话、四川话、上海话、天津话等。

这个覆盖范围在目前所有公开模型中是最广的。

语音合成支持7种中文方言:四川话、北京话、天津话、南京话、陕西话、粤语、闽南语。

评测数据的亮点

在FLEURS测试集(一个覆盖60种语言的标准语音评测集)上,Qwen3.5-Omni-Plus的平均词错率(WER,越低越好)是6.6%,优于Gemini 3.1 Pro的7.3%和GPT-4o-Transcribe的10.4%。

特别值得注意的是粤语:Qwen3.5-Omni-Plus的词错率是2.2%,Gemini 3.1 Pro是6.3%,差距接近3倍。

这反映了中文系语言上的明显优势。

十一、评测结果全景:215个任务说明了什么

文字能力:全模态不牺牲单模态

这是最反常识的发现。

Qwen3.5-Omni-Plus在纯文字任务上的表现,与同规模的纯文字模型Qwen3.5-Plus-Instruct几乎持平:

几个关键数字:

MMLU-Pro(综合知识评测):Qwen3.5-Plus-Instruct 86.8,Qwen3.5-Omni-Plus 85.9

IFEval(指令遵循):两者都是89.7,完全持平

GPQA(研究生级科学问答):Qwen3.5-Plus-Instruct 85.9,Qwen3.5-Omni-Plus 83.9

在指令遵循任务(IFBench)上,Qwen3.5-Omni-Plus得分51.1,甚至超过了纯文字模型的51.1分(原文显示Omni-Plus为52.6,略高于基线51.1)。

这打破了"多模态模型必然牺牲文字能力"的假设。

音频能力:全面超越Gemini 3.1 Pro

几个亮点:

音乐理解:RUL-MuchoMusic评测中,Qwen3.5-Omni-Plus得分72.4,Gemini 3.1 Pro只有59.6,差距超过12个百分点。

语音对话:VoiceBench评测中,Qwen3.5-Omni-Plus得分93.1,Gemini 3.1 Pro为88.9。

ASR(语音识别):在LibriSpeech(英语标准测试集)上,词错率1.11%(干净音频)和2.23%(嘈杂音频),均优于Gemini 3.1 Pro的3.36%和4.41%。

中文方言ASR:在Common Voice测试集上,粤语词错率1.95%,Gemini 3.1 Pro为13.40%,差距接近7倍。

歌声识别:在MIR-1K(人声分离)测试集上,词错率4.56%,优于Gemini 3.1 Pro的8.76%。这说明模型不只是识别正常说话,还能理解歌唱中的歌词。

视觉能力:与专门视觉模型持平

Qwen3.5-Omni-Plus在大多数视觉任务上与Qwen3.5-Plus-Instruct(专门的视觉语言模型)持平,在视频理解任务上甚至更强:

VideoMME(无字幕):Omni-Plus 81.9 vs Plus-Instruct 81.0

MLVU(长视频理解):Omni-Plus 86.8 vs Plus-Instruct 85.1

MVBench(多任务视频理解):Omni-Plus 79.0 vs Plus-Instruct 76.7

视频任务上的优势,来自于音视频联合训练带来的时序理解能力提升。

音视频联合理解

在DailyOmni(日常音视频理解)评测上,Qwen3.5-Omni-Plus得分84.6,超过Gemini 3.1 Pro的82.7。

在Qualcomm IVD(真实场景音视频交互)评测上,Qwen3.5-Omni-Plus得分68.5,Gemini 3.1 Pro为66.2。

在OmniCloze(音视频字幕生成)上,Qwen3.5-Omni-Plus得分64.8,超过Gemini 3.1 Pro的57.2。

工具调用(OmniGAIA)上,Qwen3.5-Omni-Plus得分57.2,Gemini 3.1 Pro为68.9,这是目前相对较弱的方向,有提升空间。

十二、语音生成评测:与商业顶级系统的正面对比

零样本TTS:历史最佳

在SEED-TTS(一个标准的零样本语音合成评测集)上,Qwen3.5-Omni-Plus在英文测试集上的词错率达到1.26%,是所有对比系统中最低的,包括CosyVoice 3(1.45%)、MiniMax-Speech(1.65%)等商业系统。

多语言语音生成:29种语言,22种最优

在29种语言的评测中,Qwen3.5-Omni-Plus在22种语言上的词错率最低,同时在说话人相似度(声音克隆保真度)上也全面领先MiniMax-Speech和ElevenLabs。

几个极端案例:

泰语:Qwen3.5-Omni-Plus词错率2.170,ElevenLabs高达73.936(基本不可用)

越南语:Qwen3.5-Omni-Plus词错率1.143,ElevenLabs高达73.415

日语:Qwen3.5-Omni-Plus词错率3.479,ElevenLabs为10.046

跨语言声音克隆

跨语言声音克隆的意思是:用A语言的声音样本,生成B语言的语音,同时保持声音特征不变。

在12个语言对中,Qwen3.5-Omni-Plus在10个上取得最低错误率。

最显著的案例是中文到韩语:Qwen3.5-Omni-Plus的混合错误率是4.03,CosyVoice 3高达14.4,相对降低了72%。

自定义声音生成

这里有个重要细节:Qwen3.5-Omni的说话人微调只在单语言数据上训练,但在29种语言的跨语言迁移上仍然表现优秀,在10种语言上取得最低词错率。

这说明模型学到的声音特征表征具有很强的语言无关性,声音的"身份"和"语言"在模型内部是解耦的。

十三、三个新能力:这才是真正的产品机会

1. 可控音视频字幕生成

Qwen3.5-Omni可以生成剧本级别的结构化字幕,包括:

自动场景分割(判断场景切换点)

精确时间戳标注

人物描述及其与音频的关系

可控的详细程度(从简短摘要到逐帧描述)

这个能力的产品价值是:视频内容的自动化结构化处理。

一段1小时的会议视频,可以自动生成带时间戳的议题摘要、发言人识别、关键决策提取,不需要任何人工干预。

2. 全面实时交互

三个具体能力:

语义打断:模型能识别用户的打断意图,不是检测到声音就停止,而是理解用户是真的想打断还是只是发出了背景声音。

这是通过原生的轮次切换意图识别实现的,不依赖外部的VAD(Voice Activity Detection,语音活动检测)模块。

端到端语音控制:用户可以直接用语音控制AI的音量、语速、情绪,不需要通过文字指令。

比如说"说慢一点",AI会立即调整语速,而不是先把这句话转成文字再处理。

声音克隆:用户提供几秒钟的声音样本,模型就能用这个声音风格进行后续对话。

3. 原生全模态智能体行为

这是最值得关注的能力方向。

Qwen3.5-Omni不只是一个"理解"模型,还是一个"行动"模型,支持:

自主WebSearch:模型能自己判断什么时候需要搜索,发起搜索,整合结果,不需要外部编排。

复杂FunctionCall:调用外部工具和API,处理复杂的多步骤任务。

Audio-Visual Vibe Coding(音视频氛围编程):这是一个涌现出来的能力,没有被专门训练。

给模型看一段视频或图像,它能直接生成实现相同视觉效果的代码。

这个能力的出现说明了一件事:当模型真正理解了视觉内容的逻辑结构,它自然获得了把这个结构转化为代码的能力。

这不是识别,而是推理。

十四、翻译能力:一个被忽视的强项

Qwen3.5-Omni-Plus在语音翻译上表现出色。

在英文到其他语言(en2xx)方向,平均BLEU分数33.8,优于Gemini 3.1 Pro的31.8。在中文到其他语言(zh2xx)方向,平均21.4,优于Gemini 3.1 Pro的19.6。

粤语方向的优势尤其突出:

英文到粤语:Qwen3.5-Omni-Plus 40.1 vs Gemini 3.1 Pro 25.5

粤语到中文:Qwen3.5-Omni-Plus 36.8 vs Gemini 3.1 Pro 21.2

这种优势在Flash版本上同样显著,说明不只是靠参数规模堆出来的。

十五、留给产品经理和创业者的判断框架

什么时候用Qwen3.5-Omni

场景一:音视频内容的深度理解 会议录音分析、播客摘要、视频内容审核、多语言字幕生成。

这类场景的核心价值是消除"切片-转写-处理"的工程复杂度,直接端到端处理。

场景二:实时语音交互产品 235ms的首包延迟,加上语义打断和情绪感知,已经达到构建自然语音助手的基本门槛。

特别适合需要多语言支持的场景。

场景三:跨模态内容创作 声音克隆、多语言配音、视频内容的音频替换。

Qwen3.5-Omni在声音保真度和跨语言迁移上的表现,已经接近商业顶级系统。

场景四:多模态智能体 需要同时处理视觉、听觉输入并执行工具调用的复杂任务。

Audio-Visual Vibe Coding这类涌现能力,可以探索用于UI自动化、视觉编程辅助等方向。

什么时候不需要用

如果你的场景只是"把语音转成文字再处理",传统ASR加语言模型的流水线可能更经济。

端到端多模态模型的价值,在于跨模态的关联理解,而不是单纯的转写。

关于涌现能力的风险提示

Audio-Visual Vibe Coding这类涌现能力,边界不清晰,在某些情况下可能失效。

不要把涌现能力作为核心功能交付,而要作为探索方向。

用它发现新需求,但关键服务要依赖有明确评测基准的稳定能力。

十六、一个更深的问题

Qwen3.5-Omni的技术报告里,有一句话值得反复思考:

"真实世界的现象中,视觉和听觉是内在耦合的,而不是独立处理的。"

我们过去构建AI系统的方式,是把世界切割成文字、图像、声音,分别建模,再拼接起来。

这个方式有效,但它处理的不是真实世界,而是真实世界的投影。

Qwen3.5-Omni的实践证明,当你让模型直接面对耦合的多模态信号时,它不只是在各个模态上分别变强,而是获得了一种新的理解维度。

文字能力没有下降,视觉能力没有下降,但多模态联合理解出现了单模态训练无法获得的能力。

这个发现的意义可能远超一个模型的发布:未来可能不存在"文字模型"和"多模态模型"的区分,因为多模态才是学习世界知识最自然、最高效的方式。

就像人类从来没有把"看"和"听"分开学习一样。

论文一些有趣的发现

  1. 多模态训练不会削弱文字能力,反而会增强它

所有人都以为,把参数分给视觉和音频,文字能力必然下降。Qwen3.5-Omni的实测结果是:指令遵循能力比同规模纯文字模型还高。原因可能是,多模态训练让模型从更多角度理解同一个概念,反而加深了语言理解。

  1. AI说话"磕巴"的根本原因,不是算力不够,是文字和语音的编码效率天生不匹配

"hello"在文字里是1个token,在语音里可能是10个音频token。

按固定比例生成就会跳字、发音错误、数字读法混乱。

Qwen3.5-Omni的ARIA机制用动态约束解决了这个问题,而不是靠堆算力。

  1. 给AI插入文字时间戳,比专门设计时间编码效果更好

工程师的直觉是:时间感知需要专门的位置编码算法。

Qwen团队发现,直接在音视频片段前插入"[00:01:23]"这样的文字时间戳,模型反而学得更好、泛化性更强,还不需要大量均匀分布的训练数据。越简单的方案,有时候越有效。

  1. 语音识别支持113种语言,但语音合成只支持36种,这不是技术限制,是刻意的

覆盖面广的识别能让更多用户接入,但合成质量差会直接伤害体验。

Qwen选择在36种语言上做到极致,而不是在100种语言上做到"能用"。产品决策有时候比技术突破更重要。

  1. 粤语识别,Qwen3.5-Omni的错误率比Gemini 3.1 Pro低将近3倍

Qwen3.5-Omni-Plus粤语词错率2.2%,Gemini 3.1 Pro是6.3%。

这个差距不是微小优化,是数量级差异。在亚洲语言和方言上,中国团队的模型有系统性优势,这个规律在越南语、泰语上同样成立。

  1. 声音克隆只用单语言数据训练,却能迁移到29种语言

说话人微调阶段只用了单语言数据,但模型在跨语言声音迁移上依然表现优秀。

这说明模型内部把"声音身份"和"语言"完全解耦了。声音的特征是语言无关的,这个发现对配音、数字人等应用有直接价值。

  1. "音视频氛围编程"这个能力,没有被专门训练,是自己涌现出来的

给模型看一段视频,它能直接生成实现相同视觉效果的代码。

这个能力没有对应的训练任务,是在大规模多模态预训练中自发出现的。当模型真正理解了视觉逻辑,它自然获得了把逻辑转化为代码的能力。

  1. 理解和生成用同一套参数处理,反而是错的

直觉上,一个统一的大模型应该什么都能做。但Qwen3.5-Omni把"思考"和"说话"分成两个模块,效果反而更好。

多模态理解和语音生成的训练目标天生冲突,分开才能各自做到极致。人脑的语言理解区和语言生成区也是分开的。

  1. 模型生成语音的速度,是实际播放速度的3到4倍

很多人以为流式语音是"刚好够用"的速度。实际上Qwen3.5-Omni的生成实时因子(RTF)在0.18到0.33之间,意味着模型生成速度远超播放速度,有大量缓冲余量。

这才是流畅体验的真正来源,不是靠压缩延迟,而是靠足够快的生成速度。

  1. 音频数据占了整个预训练数据的将近一半

4万亿token的训练数据里,音频占了1.99万亿,比文字(0.92万亿)和图像(0.95万亿)加起来还多。这不是偶然,而是阿里对"音频是被严重低估的模态"这个判断的押注。下一个AI应用爆发点,可能不在视觉,在声音。

© 2026

·

向阳乔木

📌 文中提及的人物和组织

公司/组织: Alibaba, Qwen team

产品/模型: Qwen3.5-Omni, Gemini 3.1 Pro

关键字: multimodal-ai qwen-omni audio-visual-processing real-time-ai voice-synthesis