摩尔线程科创板上市:国产GPU第一股的挑战与机遇 Best Partners TV 2025-12-07

国产GPU第一股摩尔线程登陆科创板

周五,A股市场迎来了一场资本狂欢,备受瞩目的国产 GPU(Graphics Processing Unit: 图形处理器,一种专门在个人电脑、工作站、游戏机和一些移动设备上图像渲染的微处理器)第一股摩尔线程,终于成功登陆 科创板(STAR Market: 上海证券交易所科创板,中国大陆的一个股票市场板块,旨在支持科技创新企业上市融资)。作为科创板“1+6”政策发布后首家过会并上市的企业,摩尔线程也创下了2022年以来审核最快的科创板 IPO(Initial Public Offering: 首次公开募股,指一家企业或公司第一次将它的股份向公众出售)记录,从受理到过会仅用了88天,上市总共用时不到半年。

与此前已上市的海光、华为昇腾、寒武纪等公司相比,摩尔线程是目前国内唯一、也是最接近 全功能GPU(Full-function GPU: 既能进行图形渲染又能进行通用计算的图形处理器)定义的厂商。这意味着,如果要在国产芯片中寻找一款既能支持游戏,又能兼顾 AI训练推理(AI Training and Inference: 人工智能训练是指通过大量数据让模型学习和优化,推理是指模型利用所学知识对新数据进行预测或决策)的芯片,摩尔线程几乎是目前唯一的英伟达替代选择。

上市首日,摩尔线程股价一度高开468.78%,开盘价每股650元,市值一度突破3000亿元,最终回落至2800亿元。全天成交额高达153.07亿元,换手率达到85.49%。在这波资本狂欢中,创始人张建中直接持股市值便达到287.56亿元。早期投资人也因此获利丰厚,例如最早的投资人沛县乾曜,其累计浮盈高达5825倍。资本之所以如此疯狂,无非是看中了摩尔线程“中国版英伟达”这一极具吸引力的标签。

摩尔线程的技术成色与市场定位

摩尔线程的创始团队堪称英伟达嫡系,张建中曾长期担任英伟达的全球副总裁兼中国区总经理。那么,这家被市场捧上神坛的公司,其技术实力究竟如何?

谈及 GPU,如果不结合应用场景而单纯讨论参数,那便是脱离实际。在AI计算领域,核心指标主要关注三个方面:算力、显存和带宽。显存(Video Memory/VRAM: 显卡上的专用内存,用于存储图像数据和计算结果)决定了能够处理的模型大小;算力(Compute Power: 计算机系统或处理器执行计算任务的能力)代表着能同时处理多少数据;而 带宽(Bandwidth: 在单位时间内可以传输的数据量)则代表固定时间里能够传输多少数据。如果显存不足,大型模型将无法运行;如果算力和带宽不够,则会严重拖慢计算速度。

自2020年成立以来,摩尔线程已陆续推出苏堤、春晓、曲院、平湖四代 GPU 架构。从第三代曲院开始,公司重心转向AI计算。最新一代平湖 GPU 于2024年发布,其最新产品是基于该 GPU 的S5000。数据显示,S5000在 FP32(Single-precision floating-point format: 单精度浮点数,一种计算机数据格式,用于表示浮点数,占用32位内存)精度下的算力达到32 TFLOPS(Tera Floating-point Operations Per Second: 每秒万亿次浮点运算,衡量计算机系统或处理器执行浮点运算速度的单位)。同时,平湖架构 GPU 最大显存容量为80GB,推测S5000的显存容量也应为80GB,但带宽数据尚未公布。

与英伟达的 GPU 进行对比,A100的 FP32 算力为19.5 TFLOPS,H20为44 TFLOPS,H100为67 TFLOPS。仅从 FP32 这一项来看,S5000似乎超越了A100,甚至接近H20的水平,尽管与H100仍有较大差距。然而,这个参数并不能完全代表S5000的实际AI算力水平,原因在于 FP32

在AI计算中,需要用到不同精度的数据, FP32 只是其中一种,还有 FP64(Double-precision floating-point format: 双精度浮点数,占用64位内存,精度高于FP32)、 FP16/BF16(Half-precision floating-point format/Bfloat16: 半精度浮点数,占用16位内存,常用于AI计算以提高效率)、 FP8/FP4(8-bit/4-bit floating-point format: 8位/4位浮点数,更低精度,用于进一步优化AI计算速度和内存占用)以及 INT8(8-bit integer: 8位整数,用于表示整数,范围通常为-128到127)等多种常见数据类型。数字越大,数据精度越高,占用的内存也越大,计算速度也越慢。因此,不同的AI任务需要选择最合适的数据类型。例如,医学、军事、科学等对误差敏感的领域需要 FP64 数据,而当前的AI大模型为了追求速度和节省内存,普遍采用 混合精度(Mixed Precision: 在AI训练和推理中同时使用不同精度的数据类型,以平衡计算速度、内存占用和模型精度)。这意味着, FP16BF16 甚至 FP8 才是当前AI训练和推理的主战场。因此,S5000漂亮的 FP32 数据在AI领域里的参考价值需要打折扣,关键仍需关注其在 FP16FP8 下的实际表现,但目前S5000的相关信息较少,其实际表现仍未可知。

相比之下,其他友商也在激烈竞争。华为昇腾910C NPU(Neural Processing Unit: 神经网络处理器,一种专门用于加速人工智能和机器学习任务的处理器)目前公布的 BF16/FP16 总算力达到752 TFLOPS,超过了英伟达H20和A100,但不到H100的一半,片上内存和带宽与H100基本在同一水平。寒武纪目前在售的思元590芯片, FP16 算力为256 TFLOPS,接近A100水平。沐曦集成虽未公布具体数据,但表示曦云C500和C550两款 GPUFP16/BF16 指标上处于英伟达A100的算力区间。有行业内部人士指出,在实际训练推理环境中,摩尔线程等国产AI计算卡的纸面参数算力往往需要打折扣。

商业模式与AI智算集群

尽管摩尔线程被誉为“国产英伟达”,但两者的盈利模式存在显著差异。英伟达不直接销售AI智算集群,而摩尔线程的主要营收却来自于集群产品。今年上半年,摩尔线程共售出5个 AI智算集群(AI Intelligent Compute Cluster: 由大量GPU或其他AI芯片互联组成的计算系统,用于大规模AI模型训练和推理),其中4个集成了512个S4000 GPU,另一个是集成了2048个S5000 GPU 的集群,这也是摩尔线程售出的第一个S5000集群。资料显示,仅这一个S5000集群就为摩尔线程贡献了3.97亿元 营收(Revenue: 公司在一定时期内通过销售商品或提供服务所获得的收入),占上半年总营收的一半以上。根据招股资料,该S5000集群的客户为重大科技创新平台,很可能是某个国家实验室。

值得一提的是,目前在国产AI计算卡企业中,华为是绝对龙头,客户广泛;寒武纪主要客户为字节跳动;而沐曦集成则主要面向信创 GPU 市场。英伟达之所以不销售AI智算集群,是因为其 毛利率(Gross Profit Margin: 销售收入减去销售成本后的利润占销售收入的百分比)远低于直接销售 GPU。如今英伟达销售 GPU毛利率 高达70%,而AI集群的建设和维护成本高昂,导致其 毛利率 较低。

然而,对于摩尔线程而言,销售AI集群并非一个糟糕的选择。相比于直接销售 GPU,销售集群更容易做大 营收 规模。集群本质上是将大量 GPU 连接在一起,共同执行某个AI任务,因此销售一个集群相当于一次性售出数百甚至数千个 GPU。此外,建设集群并非易事。随着AI模型规模的不断扩大,单卡或多卡组合已无法满足训练需求,同时消费端的推理需求持续暴增,AI大厂和云服务厂商都必须建设更大的算力集群。例如,马斯克的xAI孟菲斯超级集群一期就集成了10万张H100 GPU,亚马逊的Project Rainier更是集成了近50万颗自研芯片。

GPU互联技术与集群规模挑战

GPU 数量越来越多时,如何更好地连接这些 GPU 成为了建设AI算力集群的关键技术,即 GPU互联技术(GPU Interconnect Technology: 连接多个GPU以实现数据高速传输和协同计算的技术)。英伟达之所以强大,是因为它很早就通过收购获得了 NVLink(Nvidia NVLink: 英伟达开发的高速GPU互联技术)技术,能让相邻的几张 GPU 两两互通,提升计算速度。目前主流应用的 NVLink 5.0技术,卡间互联带宽高达1.8TB/s,而 NVLink 6.0则将带宽升级到3.6TB/s。

在卡间互联方面,摩尔线程也推出了自研的 MT-Link(Moore Threads MT-Link: 摩尔线程自主研发的GPU互联技术)技术。目前最新的 MT-Link 3.0互联带宽可以达到1.3TB/s,介于 NVLink 4.0和5.0之间。在招股资料中,摩尔线程表示 MT-Link 3.0已达到行业领先水平。不过,公司也指出,目前摩尔线程最新的平湖 GPU 架构和S5000 GPU 上使用的仍是 MT-Link 2.0技术,片间互联带宽为800GB/s,这意味着新研发的3.0技术尚未应用于产品。

除了 GPU 互联,AI集群还面临着规模的现实挑战。一般来说,两两互联的卡数量存在难以突破的物理极限。由于每家厂商采用的互联结构不同,这个极限也并不相同。例如,英伟达最新的Blackwell架构支持72个 GPU 互联;谷歌 TPU 在卡间互联上最多可以形成4x4x4,即64个 TPU 的小立方体。这样的互联极限通常被称为 节点(Node: 在分布式计算集群中,一个独立的计算单元,通常包含多个处理器和内存)。摩尔线程现有的KUAE(夸娥)2集群技术,每个 节点 可以集成8颗模块化的 GPU节点 之间采用行业主流的 InfiniBand(InfiniBand: 一种高速、低延迟的计算机网络通信标准,常用于高性能计算)或者 RoCE(RDMA over Converged Ethernet: 基于融合以太网的远程直接内存访问,一种允许通过以太网进行RDMA的技术)的网络方案进行互联。KUAE2集群最多可包含1280个 节点,最大可支持10240个 GPU。然而,摩尔线程售出的最大集群只包含了2048张卡。通常,在AI集群中,5000卡是一个关键的瓶颈,因为集群规模扩大后,对电源、电力、散热以及系统调控等诸多方面都是一个巨大的考验。显然,相比于动辄10万卡、20万卡互联的英伟达,摩尔线程的KUAE集群技术仍需进一步完善和考验。

摩尔线程的核心护城河:MUSA架构与生态

实际上,摩尔线程的核心护城河在于其自研的 MUSA(Moore Threads Unified System Architecture: 摩尔线程统一系统架构,其自主研发的软件和硬件协同平台)统一系统架构。此前许多国产厂商选择 GPGPU(General-purpose computing on Graphics Processing Units: 利用GPU进行通用计算,而非仅限于图形渲染)路线,去掉了图形渲染单元,这种设计结构简单,面积小,能效高。但摩尔线程保留了 3D渲染管线(3D Rendering Pipeline: 计算机图形学中将三维场景转换为二维图像的过程),这一步棋走得非常冒险,因为 图形驱动(Graphics Driver: 操作系统与显卡硬件之间进行通信的软件,负责控制显卡的各项功能)的开发难度是硬件设计的10倍。这也是为什么摩尔线程早期产品硬件参数出色,但在该驱动下玩游戏帧数极低的原因。

虽然当时市面上有很多宣称完美兼容 CUDA(Compute Unified Device Architecture: 英伟达开发的并行计算平台和编程模型,用于GPU通用计算)的方案,但基本上都是夸大其词。于是摩尔线程开发了一个名为 MUSIFY(Moore Threads MUSIFY: 摩尔线程开发的将CUDA代码转换为MUSA代码的工具)的工具,用于将 CUDA 代码翻译成 MUSA 代码。实测反馈显示,这种转译会有10%-30%的性能损耗。

2023年10月,摩尔线程被美国列入 实体清单(Entity List: 美国商务部工业与安全局发布的一份名单,列出了被认为对美国国家安全或外交政策利益构成风险的实体)。其高端卡S4000原本依赖台积电的 7nm/5nm高级制程(7nm/5nm Advanced Process Node: 指芯片制造工艺的纳米级别,数字越小代表工艺越先进,晶体管密度越高),被列入清单后,迅速转向中芯国际(SMIC)的 N+1/N+2工艺(N+1/N+2 Process: 中芯国际的先进芯片制造工艺,通常被认为接近或达到某些国际先进水平)。尽管良率和功耗不如台积电,但至少能够实现生产。

摩尔线程的造富效应与财务状况

除了依靠国产 GPU 追赶英伟达的故事,摩尔线程上市的另一个话题便是其造富效应。最直接的体现是创始团队。摩尔线程的创始人、董事长兼总经理张建中拥有硕士研究生学历和高级工程师职称,曾于1990年至1992年在冶金自动化研究设计院国家计算机实验室部门任高级研究员,1992年至2001年在中国惠普任产品总经理,2001年至2006年在戴尔中国任全球客户部总经理,2006年至2020年在英伟达任全球副总裁兼大中华区总经理。2020年,张建中与周苑、张钰勃、王东联合创立摩尔线程,并以实控人身份参与公司经营管理。

摩尔线程的创业故事更像是一场有预谋的复刻。张建中在Jensen Huang手下工作了15年,深谙生态和渠道的玩法。公司成立100天就宣布研制成功首颗 GPU,18个月发布 全栈产品(Full-stack Product: 涵盖从硬件到软件、从底层到应用层的完整产品解决方案),这种速度在芯片界是不符合物理规律的。圈内普遍认为,摩尔线程在成立之初就获得了极为成熟的 IP授权(Intellectual Property Licensing: 知识产权授权,允许第三方使用专利、技术等知识产权),或者拥有极其完整的成建制团队。摩尔线程讲述的故事,也是以游戏显卡的现金流来养AI研发,这与英伟达当年的发家史如出一辙。

公告显示, IPO 发行后,张建中直接持股9.4127%,按照上市首日的价格,即使不算间接持股,其持股市值就高达287.56亿元。最早下场的机构股东同样赚得盆满钵满。摩尔线程成立仅三个月,深圳明皓、沛县乾曜就迅速入局。根据摩尔线程公布的信息,沛县乾曜以1元的价格入股,当时摩尔线程投前估值仅为1000万元。沛县乾曜以190.4762万元入股,拿到了13.4%股份。同期入股的深圳明皓以35.28元的价格入股,投入8000万元,拿到了16%股份。之后,沛县乾曜以253.60元的价格转让了近20万元的注册资本,套现大约5000万元。此次上市发行后,沛县乾曜仍持有1699.87万股,占总股本的3.6165%,开盘市值为110.48亿元,以此计算,沛县乾曜累计浮盈超过5825倍。而深圳明皓先后在2021年10月和今年初分别套现了2000万元和1.57亿元,发行后仍持有1992.27万股,持股比例为4.2386%,开盘市值为129.49亿元,累计浮盈达163倍。

在之后的天使轮融资中,摩尔线程引入了红杉资本、闻名泉丰、和而泰、深圳一创、五源启兴五家机构。资料显示,这轮融资投后估值为16.46亿元,和而泰投入3000万元,上市后和而泰的持股比例为0.8734%,以开盘价计算持股市值26.68亿元,增值了近88倍。红杉资本也曾多次追投,在 天使轮(Angel Round: 创业公司早期融资阶段,通常由个人天使投资人提供资金)、 Pre-A轮(Pre-A Round: 创业公司A轮融资前的阶段性融资)和B轮合计投入大约2.12亿元,发行后持股1915.44万股,持股比例为4.0752%,持股市值124.50亿元,增值了近58倍。不过,也有在 IPO 前提前离场的机构,字节跳动旗下量子跃动在 Pre-A轮 向摩尔线程投入约5000万元,今年初将全部股份转让,获利2.27亿元,赚了3.54倍。即便是在 Pre-IPO轮(Pre-IPO Round: 指公司在首次公开募股(IPO)前进行的最后一轮融资),新进入的股东也获得了不错的收益。摩尔线程 Pre-IPO轮 的投后估值为298.45亿元,开盘市值约为3055亿元,新股东浮盈9倍以上。值得注意的是,DeepSeek创始人梁文锋旗下的私募基金幻方量化也认购了700.59万元,按摩尔线程发行价计算,幻方量化持有6.13万股,上市首日这笔股份价值已达到3681万元,收益率达425%。

然而,由于持续的高强度研发投入,摩尔线程到目前尚未盈利。最近三年,公司 归母净亏损(Net Loss Attributable to Parent Company: 归属于母公司所有者的净亏损)分别为18.40亿元、16.73亿元、14.92亿元。加上今年前三季度7.24亿元的亏损,累计亏损已达57亿元。公司预计2025全年 营收 为12.18亿到14.98亿元,同比增长177.79%到241.65%,预计扣除非经常性损益后 归母净利润 为-12.38亿元至-8.78亿元。公司预计最早到2027年 营收 达到59.83亿元,同时整体 毛利率 达到61%的前提下,方可实现合并报表 盈利。扣除大约3亿元的政府补助后,2027年将处于微利状态。

国产芯片上市潮与未来展望

顺便一提的是,继摩尔线程之后,另一家国产明星 GPU 企业沐曦集成也即将迎来上市,于12月5日开启火爆申购。按照发行价格104.66元/股计算,沐曦集成发行的初始市值将达到418亿元。沐曦集成同样成立于2020年,创始人陈维良曾任AMD全球 GPU SOC设计总负责人,并与AMD的同事彭莉和杨建联合创业。沐曦集成增长比摩尔线程更为迅猛,2022年-2024年 营收 从不到43万元暴增到7.43亿元,今年前三季度达到12.36亿元,累计亏损近34亿元。公司预计最早2026年实现 盈亏平衡(Break-even Point: 收入与成本相等,既不盈利也不亏损的状态)。

此外,壁仞科技、燧原科技、天数智芯、瀚博半导体等多家 GPU 公司也已开启上市进程,但基本都还处于上市辅导等前期阶段,有望在明年上半年集中上市。百度旗下的昆仑芯也被爆出计划赴港上市。显然,在国产 GPU 飞速前进的大背景下,这台造富机器尚未停歇。随着国产 GPU 迎来关键的上市窗口期,下一段故事大概才刚刚开始。不过,对于市值2800亿的摩尔线程,我们仍需提醒投资者:信仰很贵,请理性充值。

📌 文中提及的人物和组织

关键字: ai-chip domestic-semiconductor geopolitical gpu-market valuation