2026年AI生图领域最全技术解读,没有任何一家到L5水平 · 乔木博客 向阳乔木 2026-05-01

乔木博客

全部

AI工具

AI教程

AI生成

AI资讯

健脑房

播客解读

论文学习

2026年AI生图领域最全技术解读,没有任何一家到L5水平

论文学习

·

2026年5月1日

·

2055 次阅读

·

约 27 分钟

2026年4月底,一篇署名来自清华、南洋理工、港大、新加坡国立大学等十几所顶级机构的综述论文悄悄挂上了arxiv。

https://arxiv.org/pdf/2604.28185

论文分析了411篇参考文献,其中45.7%发表于2025年一年之内。

数字说明一件事:这个领域正在以惊人的速度自我迭代。

论文的核心问题只有一个:当我们说一个图像生成模型"更好了",到底好在哪里?

问题听起来简单,但当前整个行业其实没有一个清晰的答案。

先说清楚背景:我们现在在哪里

过去几年,图像生成经历了几次范式跳跃。

最早是 GAN(生成对抗网络)的时代,2014年到2019年,模型靠"生成器"和"判别器"互相博弈来学习画图。

StyleGAN、BigGAN 是这个时代的代表。

优点是生成速度快,缺点是训练极不稳定,容易"崩掉",而且很难跟随复杂的文字描述。

然后是 扩散模型(Diffusion Model)的时代,2020年开始爆发。

核心思路是:先把图片一步步加噪声变成随机噪声,然后训练模型学会把噪声一步步还原成图片。

Stable Diffusion、DALL-E 2 都是这个路线。

优点是训练稳定、质量高、可以跟随文字描述,缺点是生成一张图需要几十甚至上百步计算,速度慢。

接着是 流匹配(Flow Matching)的改进,代表是 SD3、FLUX。

核心改进是让噪声到图片的路径变得更"直",这样用更少的步骤就能生成高质量图片,同时训练也更稳定。

目前大多数前沿系统都在用这个方向。

还有一条并行发展的路线是 自回归模型(Autoregressive Model,简称 AR),就是把图片切成一个个小块,像语言模型预测下一个词一样,逐块预测图片内容。

LlamaGen、VAR 是代表。这条路线的优势是可以和语言模型共享架构,天然支持图文混合处理。

最新的趋势是 混合架构(Hybrid):用自回归模型负责"想清楚画什么",用扩散/流匹配模型负责"把细节画好"。

Transfusion、BLIP3o-NEXT、Wan-Image 都是这个方向的探索。

五级分类框架:能力的阶梯

论文最核心的贡献是提出了一个五级分类框架,把视觉生成能力从低到高排了个序。

每一级都在前一级基础上多了一种本质性的新能力,而不只是"画得更好看"。

L1:原子生成——会画画

给一段文字描述,出一张图。

模型的目标是"看起来像那么回事",优化的是视觉上的合理性,而不是结构上的正确性。

代表模型:DDPM、DiT、Stable Diffusion、LlamaGen、VAR。

核心局限:没有控制,只有随机性。

你说"一个红色方块在蓝色球的左边",模型可能画出一张很好看的图,但空间关系完全是错的。

它优化的是"看起来像训练数据里的图",而不是"满足你说的约束"。

L2:条件生成——会听指令

加入了明确的控制信号。

不只是文字,还可以给边缘图、深度图、人脸参考图、布局框等,模型要在生成时遵守这些约束。

代表模型:ControlNet(接受边缘/深度/姿态控制)、IP-Adapter(接受参考图像控制身份)、InstantID(零样本人脸保持)、DreamBooth(用几张参考图学习新概念)、GLIGEN(接受边界框控制布局)、SD3/MM-DiT(把条件控制内置到骨干网络里)。

核心局限:属性绑定和空间精度。

就算给了明确的布局约束,模型还是经常把颜色搞混(左边的红帽子颜色跑到右边的围巾上),或者左右颠倒。

每次生成都是独立的,没有跨次的记忆。

L3:上下文生成——会记住

这一级仍然是单次前向传播(就是模型从头到尾跑一遍),但输入里塞进了大量上下文。

比如多张参考图、多个控制条件、或者多轮编辑的历史记录。

多轮图像编辑属于这个层级,不是 L4。

每一轮编辑都是一次前向传播,只是输入里包含了之前所有的图片和指令历史。

代表模型:SEED-Data-Edit、ImgEdit(支持多轮编辑链)、StoryMaker、Visual Persona(跨图保持角色身份)、ReasonGen-R1(在生成前先产生文字推理链)。

核心局限:累积漂移。

随着上下文越来越长,每一轮编辑都会引入微小误差。

VAE(变分自编码器,一种把图片压缩成紧凑表示再还原的模块)的每次编解码都有损耗,叠加几轮之后,人物身份、细节质量都会悄悄跑偏,而且这种漂移是静默的,每一轮单独看都还好,但整体轨迹已经偏离了。

L4:智能体生成——会自我纠错

这一级发生了质的变化:生成不再是终点,而是一个动作。

系统有规划器、验证器、工具调用能力,可以自主决定"这张图不对,重新生成",可以调用外部搜索、调用专业软件,可以在多次生成之间保持目标不变。

论文用了 Anthropic 的区分:工作流(预先设计好的固定流程)vs 智能体(模型自主决定下一步做什么)。

目前大多数 L4 系统还偏向工作流一侧。

代表模型:

GEMS:规划器→分解器→验证器→精修器的完整循环,带持久记忆

Gen-Searcher:先联网搜索再生成,解决知识密集型任务

JarvisArt:把用户意图转化成可执行的 Lightroom 操作,200多个工具

CoT-VLA:机器人领域,先预测视觉未来状态再决定动作

核心局限:闭环中的可靠验证。

系统不仅要会画,还要会判断画得对不对,然后决定下一步。

验证器本身也是学出来的模型,如果验证器和生成器有共同的偏见,闭环就变成了一个更慢的开环。

L5:世界建模生成——懂世界(未来)

这是目前还没完全实现的层级。

模型需要真正内化物理规律和因果关系,能预测"如果我做了这个操作,世界会变成什么样"。

不只是"看起来可能会这样",而是"因果上应该是这样"。

代表探索:

Genie 2:从被动视频学习可交互的 3D 环境

GameNGen:用扩散模型实时跑 DOOM 游戏引擎

Oasis:用自回归模型跑 Minecraft

UniSim:机器人操作和导航的通用视觉模拟器

GAIA-1:自动驾驶场景生成

核心挑战:因果忠实性。

一个视觉上很逼真的预测,如果忽略了转向指令或者误判了物体碰撞,这对下游机器人学习很糟糕,比没有预测还糟糕,因为它会污染训练信号。

模型架构:一年内发生了什么

论文同时分析了 2025-2026 年发布的十份前沿技术报告,发现架构层面已经出现了明显的收敛。

四个接近共识的选择:

一是 Qwen-VL 系列成为事实上的标准文本编码器,十份报告中有六份在用,取代了早期的 T5 和 CLIP,主要原因是中文渲染能力和长提示词理解能力更强。

二是 MM-DiT(模态感知扩散变换器)成为主流骨干,U-Net 在前沿系统中基本退出历史舞台。MM-DiT 的特点是文本和图像各有独立的权重流,但通过联合注意力机制双向交互,大幅提升了文字理解和排版质量。

三是 流匹配取代了传统扩散目标,训练更稳定,而且生成的路径更"直",更容易被蒸馏压缩成少步版本。

四是 T2I(文字生成图)+ I2I(图到图)+ 编辑,统一在同一个架构里,纯 T2I 系统已经很少见了。

但也有几个轴还在激烈分歧:

扩散 vs 自回归 vs 混合,各家押注不同。

Wan-Image 是明确的混合路线(AR 规划 + 流匹配渲染)

HunyuanImage 3.0 是 AR 原生加流匹配头

LongCat-Next 是纯离散 AR

Z-Image、Qwen-Image、Seedream 坚持扩散原生。

稠密模型 vs 稀疏专家模型(MoE,即混合专家,每次只激活部分参数)也还没有定论。

HunyuanImage 3.0 用了 800 亿总参数但每次只激活 130 亿的 MoE 架构

LongCat-Next 用了 685 亿总参数的稀疏 AR 架构

Z-Image(61.5 亿参数)和 LongCat-Image(60 亿参数)则证明,用更好的数据和训练流程,小模型可以追平大模型。

VAE(图片压缩编码器)的选择更是五花八门,完全没有收敛:FLUX-VAE、Wan-VAE、自训练 VAE、甚至完全不用 VAE 的设计都在共存。

训练流程:数据比参数更重要

论文梳理了当前前沿模型的训练流程,发现一个清晰的四段式结构已经成为行业标准。

第一段:预训练,在网络规模的海量数据上学习基础视觉概念。

这一阶段的关键不再是"数据越多越好",而是过滤质量。

HunyuanImage 3.0 从超过 100 亿张图片的原始池里,最终只保留了不到 45%;FireRed-Image-Edit 从 16 亿张原始图片压缩到约 1 亿张,保留率约 6%。

前沿团队把原始数据池的大小当作"支撑过滤流程的预算",而不是要越多越好。

第二段:持续训练(也叫中间训练),是预训练和微调之间的桥梁。

用更小但更高质量的数据集(通常是百万量级而非十亿量级),把模型从预训练的粗糙状态过渡到生产级分辨率,同时引入图像编辑、多视角等新任务。

十份技术报告里有八份明确提到了这个阶段。

第三段:监督微调(SFT),用精心策划的高质量样本让模型学会遵循指令。

这一阶段的核心洞察是:最后阶段的少量专家质量数据,对用户最能感知到的能力有不成比例的巨大影响。

比如专业排版、身份保持、几何推理,用几十万条专家数据就能显著提升,而不需要再堆亿级数据。

第四段:强化学习(RL),让模型超越"模仿训练数据"的天花板,优化那些监督标注无法捕捉的主观质量——美感、情感共鸣、细微的风格偏好。

目前主流方法是 DPO(直接偏好优化,从"哪张更好"的成对比较中学习)和 GRPO(组内相对偏好优化,让模型生成一批图片,看组内排名)的组合。

一个重要发现:RL 算法正在快速分化。

仅 2025-2026 年就出现了至少七种 GRPO 变体,各自解决不同的瓶颈:

MixGRPO 和 SRPO(HunyuanImage 3.0)追求稀疏激活下的稳定性

MPO(LongCat)解决大规模训练时的组同步瓶颈

DenseGRPO(Wan-Image)把信用分配密集化到去噪轨迹的每一步

DiffusionNFT(FireRed、JoyAI)去掉了对成对偏好数据的依赖

Flow-GRPO(Qwen-Image、JoyAI)把 GRPO 适配到流匹配的确定性 ODE 结构上。

这个领域还没有收敛到一个标准算法。

标注质量是最大的杠杆。

论文最直白的结论之一:Z-Image(61.5 亿参数)和 LongCat-Image(60 亿参数)能在多个基准上追平 200 亿以上参数的模型,靠的不是更多参数,而是多粒度标注流程和更严格的数据过滤。

架构已经收敛,下一阶段的进步主要来自数据和标注。

数据工程:从被动爬取到主动制造

论文专门用一章梳理了数据构建方法论,这部分对理解当前模型能力的来源非常重要。

最大的范式转变是:从被动收集网络上已有的数据,转向主动用基础模型制造所需要的训练信号。

早期的 LAION-5B、COYO-700M 这类数据集,靠的是爬取网页上的图文对。

这条路遇到了三堵墙:

网页 alt 文本标注质量太差

过滤只能做粗粒度的启发式筛选

网络上根本不存在天然的"(原图,编辑指令,结果图)"三元组,没有"编辑网络"可以爬。

现在的主流做法是用强大的 VLM(视觉语言模型,能同时理解图片和文字的大模型)来重新标注数据,用 GPT-4o、Gemini 这类前沿模型的输出作为训练数据。

用视频帧提取天然的前后对比对,用 3D 渲染和代码执行生成有精确标注的结构化数据。

一个有意思的分歧:

大多数前沿报告都在用 GPT-4o、Gemini 等专有模型的输出来训练自己的模型(即"蒸馏")。

但 Z-Image 明确拒绝了这种做法,理由是:用专有模型的输出训练,会形成闭合反馈环,学生模型的质量上限被老师模型锁死,而且随着开源模型能力提升,这种蒸馏的边际价值会越来越低。

这个争论目前还没有定论。

AIGC 污染过滤已经成为关键基础设施。

LongCat-Image 明确指出,训练数据里混入哪怕少量 AI 生成的图片,都会导致生成结果出现"塑料感"或"油腻感",并且会让模型过早收敛到一个局部最优,严重限制后续微调的潜力。

HunyuanImage 3.0 更进一步,对任何 AI 生成比例超过内部阈值的数据来源,直接整体丢弃,而不是逐张过滤。

推理加速:蒸馏已经是必选项

论文把推理加速单独列为一个重要方向,因为它已经从"可选的工程优化"变成了"模型设计的核心约束"。

扩散模型生成一张图需要几十步计算,每步都要跑一遍完整的神经网络。这在实时应用(交互式编辑、智能体循环)里完全不可接受。

主要的加速方向有三类:

更好的采样器:不改变模型,只改变"怎么从噪声走到图片"的路径。DDIM、DPM-Solver 等方法把所需步数从几百步压缩到几十步,而且不需要重新训练。

特征缓存:扩散过程的相邻步骤之间,中间特征变化很小。DeepCache、ToCa 等方法把上一步的特征缓存起来,下一步直接复用,节省大量重复计算。

蒸馏:训练一个"学生模型",学会用 4-8 步就复现"老师模型"几十步的效果。这是目前最主流的生产级加速方案。

论文分析的十份技术报告里,有六份明确记录了蒸馏阶段的详细方案(Table 7 采样加速与效率技术总览):Seedream 3.0 用轨迹蒸馏实现 4-8 倍加速;Seedream 4.0 叠加对抗蒸馏和量化,实现超过 10 倍的计算量减少;Z-Image 的 Turbo 版本用分布匹配蒸馏实现 8 步生成;HunyuanImage 3.0 用 MeanFlow 蒸馏把 800 亿参数的 MoE 模型压缩到 4-8 步。

流匹配比传统扩散更容易蒸馏,因为它的生成路径更"直",学生模型更容易学到这条路径的捷径。这也是为什么前沿系统纷纷从扩散切换到流匹配——不只是质量更好,还更容易部署。

压力测试:模型在哪里失败

论文最有价值的部分之一是第七章,用一系列精心设计的"压力测试"来找模型的边界。

这些测试不是标准基准,而是专门针对更高层级能力的探针。

空间结构与布局精度(测试 L2)

拼图重组任务:给模型一堆打散的拼图碎片,让它拼回去。

结果模型没有真正去匹配边缘,而是"脑补"了一张看起来像完整图的图。

语义上对了(气球在天空中),几何上全错了(碎片边缘没有对齐,新内容被凭空生成)。

这说明模型优化的是"看起来像",而不是"结构上正确"。

地铁线路图任务:要求生成一张有四条线路、18个站点、特定换乘关系的地铁图。

GPT-Image-2 想了 13 分钟,生成的图视觉上很专业,但拓扑关系错了好几处——中央站没有连接绿线,红蓝线的交叉次数不对,黄线的分支位置也错了。

更有意思的是,把这张图和原始要求一起给 GPT-5.5 看,它 9 秒就找出了所有问题。

生成一个满足约束的视觉产物,比检查一个已有产物是否满足约束,难得多。

等距瓦片地图任务:

要求生成一张 8×8 的等距游戏地图,指定每个地物的坐标。

模型生成的地图视觉上很专业,整体布局也大致正确,但坐标精度不够——F5 和 G6 的房子偏移到了 F6 和 G7,D7 的集市也偏低了。

这些错误视觉上很难察觉,但违反了任务的规则性约束。

物理推理与因果忠实性(测试 L5)

流体力学反事实:

给一张柑橘片漂浮在水面的图,问"如果橙子沉下去会怎样"。

Nano Banana 的输出令人惊讶——它不只是把橙子位置往下移,还生成了气泡轨迹和水下折射效果,说明模型对流体物理有某种隐式理解。

这是目前最接近 L5 的表现之一。

视频重渲染中的因果失败:

把一段人类在厨房操作的视频,替换成机器人。

模型成功保持了机器人的视觉一致性,但原视频第二帧里人类在倒水的动作,在机器人版本里消失了——机器人站在同一位置,但没有倒水,也没有水流的效果。

视觉一致性达到了 L2/L3,但功能因果性还远未到 L5。

不可逆状态转变:

给一根完整的西葫芦,让模型生成"切开后的目标状态"。

模型正确生成了内部的种子和纹理,说明它把蔬菜当作有内部结构的 3D 物体来处理,而不只是 2D 贴图。

这是一个令人印象深刻的世界知识表现。

视觉文字整合与逻辑(测试 L4)

在图片上解物理题:

输入一道中国高考风格的电磁感应题(有图有文字),要求模型不只是给出答案,而是把完整的解题过程写回到图片上。

Nano Banana 的输出相当令人惊讶:它保留了原题和图表,把推导过程写进了空白区域,用红色标注区分解题内容和原题内容,最终数值结果也是自洽的。

但论文同时揭示了内部推理过程的真相:模型在思考轨迹里反复重访同一个子问题,多次重建力平衡方程,反复确认速度关系。

这不像一个有稳定符号工作空间的系统,更像是在大量假设里做宽泛搜索,直到找到一个数值自洽的解。

最终图片展示了有效的推理,但推理过程本身是脆弱的、昂贵的、只是部分结构化的。

这个任务的核心能力不是图像生成,而是 OCR(识别图片里的文字)→ 图表理解 → 符号推理 → 结构化视觉输出的完整闭环。

论文把这个能力称为"推理条件下的文档编辑"。

多轮编辑中的马尔可夫漂移(测试 L3/L4)

累积质量退化:

让模型逐步填充一个四格漫画页,每轮只填一格。

结果:每次填新格时,模型都要对整张图重新编解码一次,之前的格子虽然没有被要求修改,但每次都会经历一次有损的 VAE 往返,细节悄悄退化。

到第三轮时,第一格里女孩的表情已经和第0轮不一样了,尽管没有任何指令要求改变她。

长程召回失败:

对一张猫的照片做四轮编辑——放大猫、加一只老鼠、恢复原始大小。

第四轮的"恢复原始大小"是关键测试:它需要模型记住第零轮的状态。

结果:模型不仅没有恢复原始大小,反而把猫放得更大了;而且第二轮加进来的老鼠,在第四轮里悄悄消失了,尽管没有任何指令要求移除它。

这两个案例揭示的是同一个问题:多轮编辑在实现上往往是"只看上一帧"的马尔可夫链,每一轮都以上一轮的输出为输入,没有对完整历史的访问。

这导致漂移不可避免地累积,而且是静默的,每一轮单独看都还好,但整体轨迹已经偏离了。

跨学科真实应用(测试 L4/L5)

编程题解答界面生成:

给一道 LeetCode 题目的截图,要求模型读题、解题、然后生成一张新的 LeetCode 风格界面图,左边是题目,右边是解题代码。

GPT-Image-2 在简单题(斐波那契数列)和难题(接雨水)上都成功了,生成了正确的 Python 代码,并且保持了 LeetCode 的界面风格、语法高亮和缩进。

数学证明图生成:

要求生成一张正五边形中黄金比例的欧几里得证明图,需要包含正确的几何关系、角度标注、黄金比例公式。

GPT-Image-2 生成了一张有组织的证明风格图,几何关系、代数恒等式、标注箭头都在,整体可读性很强。

但论文提醒:视觉上合理不等于几何上严格正确,精确的比例和证明有效性还需要外部验证。

评测体系:跟不上能力进步

论文对当前评测方法的批评相当直接。

FID(Fréchet Inception Distance,衡量生成图片分布和真实图片分布的距离)和 CLIP 分数(衡量图片和文字描述的对齐程度)这类指标,基本上只能衡量 L1 和 L2 的能力。

一个模型可以在 FID 上得高分,同时在拼图重组上完全失败;可以在 CLIP 对齐上表现优秀,同时在多轮编辑中悄悄丢失人物身份。

当前评测的主要转变是从"启发式指标"到"VLM 作为评判者"。

用 GPT-4o、Gemini 这类强大的视觉语言模型来判断生成质量。

这个方向是对的,但也有新的问题:VLM 评判者会产生幻觉,对 AI 生成内容有系统性偏好,而且在长尾内容上和人类评判者的一致性只有中等水平(Spearman 相关系数通常在 0.57-0.75 之间)。

论文提出,下一代评测需要更像编译器和定理证明器:

对流程图类输出,要验证节点和边的拓扑关系是否正确

对化学结构图,要解析回 SMILES 字符串(一种用文字表示化学结构的标准格式)并与提示词对照

对排版输出,要做 OCR 后的精确字符匹配,对非拉丁文字还需要笔画级分析

一个实用的发现:文字渲染质量是训练进度的最佳代理指标。

Nano Banana 团队在公开访谈中明确表示,他们把文字渲染能力作为训练进度的监控指标。

JoyAI-Image 的长文本基准英文/中文得分达到 0.963,LongCat-Image 在中文字符测试上得 90.7,而 Seedream 4.0 只有 58.5——30 分以上的差距。

在一年内出现,这种变化用 FID 根本看不出来,但用文字渲染测试能立刻发现。

闭源模型的优势在哪里

论文有一节专门分析 GPT-Image-2 和 Nano Banana 为什么比开源模型强,作者明确标注这是"推测性解读"。

推测一:上游有强大的 VLM 做提示词理解和改写。

闭源系统处理长指令、多轮引用和随意表达的能力,很难用一个冻结的 T5 或小型 VLM 来解释。

最可能的解释是,用户的输入先经过一个 Gemini 或 GPT-4o 级别的模型做理解和改写,再送到渲染器。

开源系统里也有类似的"提示词工程模块"(Wan-Image 用 Qwen3-VL-2B,Seedream 用 Seed1.5-VL),但上游模型的能力差距可能是关键。

推测二:双路径编码器。

闭源系统在多轮编辑中能保持像素级细节(纹理、发丝、微小文字),同时还能执行语义层面的修改。

纯语义编码器(CLIP 风格)会丢失细节;纯 VAE 编码器缺乏语义先验。

最符合观察到的行为的是双路径设计:一路 VAE 风格保留像素可寻址的细节,一路语义编码器(SigLIP 风格)定位编辑意图。

推测三:理解能力是生成时的实时约束,而不只是预处理。

GPT-Image-2 在代码渲染和数学图表上的表现,暗示渲染器在生成过程中持续受到语义约束,而不只是在输入端做一次理解。

推测四:用户看到的 API 背后藏着一个智能体循环。

静默自我纠错、局部重新生成、工具调用(字体对齐、知识检索)这些行为。

最简单的解释是:规划器 → 渲染器 → 验证器 → 精修器的多次前向传播循环,而不是单次前向传播的单体模型。

论文的核心结论:

用分类框架来看,闭源系统的行为更像是 L4 智能体生成在生产环境中的实现。

而暴露给用户单次前向传播的开源系统,本质上是 L3 有界的。

这个差距,靠单纯改进渲染器是跨不过去的。

开源社区最重要的下一步,不是再提升半个点的 FID,而是在渲染器外面复现那个智能体循环。

接下来会发生什么

论文对未来方向的判断,集中在几个关键议题上。

视觉思维链:

在生成最终像素之前,先产生可检验的中间表示。

类似语言模型里的"先想后说",但视觉版本面临独特挑战:文字推理链容易检验,视觉草图怎么检验?中间表示如何既能约束最终输出,又足够轻量可以修改?

生成即行动:

把图像生成从"输出"降格为"动作",嵌入到更大的智能体循环中。

系统可以生成、观察、评估、回滚,而不是一次性给出答案。

VTG 这样的工作开始把"两个视觉状态之间的过渡"本身当作可控的生成单元,而不只是关注终态。

工具增强渲染:

对于需要实时信息、精确数据或领域专业知识的任务,让模型学会调用外部工具,而不是靠训练数据里的静态记忆。

Gen-Searcher 是这个方向的早期探索——先联网搜索,再生成。

合成数据与视觉自我博弈:

用模型自己的输出来训练自己,形成数据飞轮。

这条路的核心风险是分布坍缩——模型和它的自我评判者有相同的偏见,闭环会强化这些偏见而不是纠正它们。

如何在没有外部锚点的情况下保持多样性,是这个方向最大的开放问题。

视觉生成作为世界模拟:

最终目标是让生成模型真正理解物理规律和因果关系,能预测干预的后果。

GameNGen、Genie 2、Oasis 是目前最接近这个目标的系统,但它们面临的挑战很清晰:

长程一致性会随着生成步数累积误差

物理合理性在训练分布之外会快速崩溃

实时性要求和扩散模型的多步计算之间存在冲突

最后

这篇论文最有价值的地方,不是它列举了多少方法,而是它提供了一个以能力为中心的视角来看这个领域。

当我们说一个模型"更好了",到底好在哪里?

是在 L1 层面的视觉质量,还是在 L3 层面的上下文一致性,还是在 L4 层面的自主决策能力?

这个问题,在以前很少有人认真问。

现在开始有人问了,而且有了一个可以操作的框架来回答它。

从"会画画"到"懂世界",这条路还很长。

但至少现在,我们知道这条路上有哪些里程碑,以及我们现在大概站在哪里。

© 2026

·

向阳乔木

关键字: ai-image-generation model-capabilities generative-ai future-of-ai