TurboQuant乌龙:谷歌算法引发内存股暴跌,市场FOMO情绪下的迷局 Best Partners TV 2026-03-27

大家好,这里是最佳拍档,我是大飞。

相信关注科技和资本市场的朋友,在2026年3月25日都看到了一幕让人大跌眼镜的场景:全球内存芯片巨头的股价集体重挫。首尔证券交易所开盘不到两小时,SK海力士跌近6%,三星跌4.8%,直接带动韩国KOSPI指数单日大跌3%。另一边的美股市场同样一片惨淡:美光科技跌7%,闪迪跌6.8%,半导体设备商拉姆研究跌5%。一夜之间,全球内存行业迎来了名副其实的“黑色星期五”。

而这一切的导火索,竟然是谷歌研究院发布的一篇关于全新压缩算法的博客。市场哗然,纷纷称这是谷歌带来的“DeepSeek时刻”,认为其推出的TurboQuant算法将彻底颠覆AI行业的内存需求逻辑,甚至戳破人工智能的泡沫。

但是,当我们沉下心来,剥开市场情绪的层层外衣,去深究这项技术的本质和市场的推理逻辑,会发现这不过是一场被无限放大的技术乌龙,是资本市场在AI领域极度FOMO(Fear Of Missing Out,害怕错过)情绪下的又一次集体非理性狂欢。今天,我们就来聊一聊这场乌龙事件的前因后果,拆解一下TurboQuant算法的真实价值,也帮助大家梳理一下,AI与内存产业之间真正的底层逻辑是什么。

暴跌传导链条与市场共识的破灭

首先,我们先还原一下这场暴跌的完整传导链条。2026年3月24日,谷歌研究院的研究科学家阿米尔·赞迪耶(Amir Zandieh)和谷歌副总裁兼谷歌院士瓦哈布·米罗克尼(Vahab Mirrokni)联合发布了一篇博客,正式介绍了名为TurboQuant的压缩算法。核心表述是,这个算法能将AI大模型运行时的KV Cache存储需求降低6倍。

随后,这篇博客迅速在科技圈和资本市场发酵。许多科技博主在社交平台截图转发,用“革命性算法”、“内存需求降低6倍”等极具冲击力的词汇进行传播。随后主流媒体跟进报道,将其解读为“AI内存需求见顶”的信号。韩国的财经媒体更是直接将SK海力士、三星与TurboQuant绑定在新闻标题中,最终引发了开盘后的恐慌性抛售。

市场之所以会有如此激烈的反应,背后可以说是过去两年形成的一个牢固共识:AI技术的持续发展,尤其是大模型的迭代和应用落地,对内存芯片的需求是无限的,没有天花板。在这个共识下,全球内存芯片厂商的股价在两年内涨幅达到300%,内存价格也在过去几个月里上涨了500%以上。美光、三星、SK海力士等企业成为AI浪潮中最直接的受益者。

而谷歌TurboQuant算法的出现,在市场看来,就是直接打破这个共识的“利器”。既然存储问题被解决了,那么AI对内存的需求自然会大幅下降,内存企业的高增长逻辑也就不成立了。再加上市场本身对内存板块的高估值已有一定的抵触情绪,在“苦内存久已”的多重因素叠加下,华尔街和全球资本市场迅速达成一致,用脚投票,让内存股血流成河。

TurboQuant算法的本质:一次被低估的论文

但让所有人没想到的是,这场引发全球资本市场震动的“突破性算法”,第一个核心乌龙点就摆在台面上:这根本就不是一项全新的研究成果。TurboQuant的相关论文最早在2025年4月28日就上传到了arXiv平台上。截至谷歌发布博客时,这篇论文已经在互联网上存在了整整11个月。在这11个月里,无论是科技圈、学术界还是资本市场,都没有人关注到这项研究,直到谷歌研究院时隔近一年后发布了这篇博客,才让这篇尘封的论文突然“爆红”,也为这场乌龙事件埋下了伏笔。

要弄清楚这场乌龙的本质,我们必须先搞懂TurboQuant算法到底是什么,它解决的到底是AI领域的什么问题。这就需要我们先从AI大模型的运行机制说起,尤其是理解KV Cache的核心作用。

对于接触过AI大模型的朋友来说,KV Cache是一个高频出现的词汇,但是很多人并不清楚它的具体意义。我们知道,大模型在处理用户的对话请求,也就是推理过程中,需要“记住”所有的历史token信息。这些信息会以Key和Value的键值对形式,被实时写入GPU的显存中,这就是KV Cache。它的核心作用是让大模型不用每次处理新的对话内容时都重新计算所有历史信息,从而大幅提升推理效率。

但是问题在于,KV Cache的内存消耗是巨大的,它甚至成为了大模型推理时的内存消耗大头,而非模型本身的权重。举个例子,一个128K上下文窗口的会话,单次推理产生的KV Cache就可以轻松超过几十GB。这也是为什么各大大模型服务商都会对长上下文对话收取额外费用,甚至将“提示词缓存”作为独立的计费项。因为KV Cache的消耗,本质上不是算力问题,而是内存的带宽和容量问题。这是当前AI大模型推理阶段的核心瓶颈之一。

而TurboQuant算法,正是针对KV Cache的这个瓶颈所设计的向量量化压缩算法。传统的向量量化方法在压缩数据时,存在一个隐藏的成本,那就是每压缩一块数据,都需要额外存储用来还原数据的“量化常数”,也就是元数据。每个数字都要额外付出1到2bit的代价,压缩的比例越高,这个额外的开销就越不可忽视。

TurboQuant算法的核心创新,就在于通过两步走的策略,彻底解决了传统压缩方法的额外开销问题,同时实现了近乎无损的压缩效果。

第一步是随机旋转量化(Random Rotation Quantization),也就是论文中提到的TURBOQUANTmse。这个步骤会对高维的输入向量施加一个随机旋转矩阵。这个操作的核心目的是改变向量坐标的分布,让每个坐标无论原始分布如何,最终都服从集中的Beta分布。这里需要注意的是,AI大模型的Transformer注意力机制依赖的是向量之间的内积计算,而非每个数字的绝对值,所以随机旋转并不会影响注意力机制的核心计算逻辑。而经过旋转后,向量的坐标分布会变得高度集中且可预测,这样就可以直接使用一套预计算好的最优标量量化表,也就是Lloyd-Max算法,对每个坐标进行单独压缩。整个过程完全不需要存储按块计算的量化常数,让传统压缩方法的额外开销直接归零。这是TurboQuant最核心的技术突破之一。

第二步是QJL,也就是量化约翰逊-林登斯特劳斯变换(Quantized Johnson-Lindenstrauss)。经过第一步的随机旋转量化后,数据会残留一点微小的残差误差。如果直接将这部分误差扔掉,会导致向量内积的估计产生系统性偏差,进而影响注意力计算的准确性。这也是很多压缩算法会出现精度损失的核心原因。而QJL变换则用仅1bit的资源来处理这部分残差误差,利用约翰逊-林登斯特劳斯变换的数学特性,保证了内积估计的无偏性,从根本上避免了精度损失的问题。

这两步策略的结合,让TurboQuant实现了极其出色的压缩效果。在将KV Cache压缩到3.5bit每通道时,模型的推理质量完全无损;即使压缩到2.5bit每通道,也只有轻微的质量下降。在性能测试中,在NVIDIA A100 GPU上,4-bit精度的TurboQuant在注意力计算上的速度,比传统的PyTorch基线快了大约8倍。

为了验证算法的实际效果,研究团队还做了经典的“大海捞针”测试。测试结果显示,TurboQuant在将数据压缩4倍的情况下,检索性能和未做任何压缩的全精度基线完全一致,在Llama-3.1-8B-Instruct模型上的得分达到了0.997,和全精度的0.997持平,远超其他量化算法。

除了出色的实验效果以外,研究团队以香农的信源编码理论为基础,用严格的数学推导,证明了任何向量量化算法能达到的理论最优压缩效果存在一个确定的信息论下界,而TurboQuant的压缩效果距离这个理论下界仅仅只差约2.7倍的常数因子。此外,在最近邻搜索任务中,TurboQuant不仅在召回率上超越了现有的乘积量化技术,还将索引时间降低到了几乎为零。这让它在向量搜索、语义检索等AI下游领域也具备了广阔的应用前景。

核心乌龙:混淆软件优化与产业级内存需求

到这里,我们可以明确一点:TurboQuant本身是一项优秀的技术研究,无论是实验效果还是理论深度,都值得肯定。但是问题在于,这项技术研究和资本市场所解读的“AI内存需求降低6倍”、“内存行业迎来天花板”完全没有关系。这也是这场乌龙事件的第二个,也是最核心的乌龙点:市场对TurboQuant的技术应用范围和AI内存需求的底层逻辑,存在根本性的误读。

首先,TurboQuant优化的对象仅仅是AI大模型在推理阶段GPU显存中的KV Cache。这只是一个软件层的算法优化。而AI行业对内存芯片的需求,来自三个完全不同的部分:

  1. 模型权重的存储:这是大模型运行的基础,任何算法都无法替代。
  2. 大模型训练阶段产生的激活值和梯度:这部分的内存消耗同样巨大,而且是训练阶段的核心需求。
  3. 推理阶段的KV Cache:TurboQuant仅仅只优化了第三个部分,对前两个核心的内存需求部分完全没有触及。而这前两个部分,才是支撑AI内存需求的核心支柱。

简单来说,就算KV Cache的存储需求降低6倍,AI行业对内存芯片的核心需求依然没有变化。市场用一个软件层的局部优化,来推导整个内存产业的需求崩塌,本身就是逻辑上的致命错误。

其次,市场还忽略了一个关键事实:当前AI行业对内存芯片的核心矛盾,从来都不是“存不够”,而是“传不快”,也就是内存的带宽问题,而非容量问题。这也是为什么HBM(High Bandwidth Memory)会成为AI基础设施的核心硬件,被各大科技巨头争抢。因为GPU的计算核心运算速度极快,往往会出现“算力等数据”的情况。数据从内存传输到计算核心的速度,直接决定了大模型的训练和推理效率。HBM的核心价值,就在于它拥有远超传统DDR内存的带宽,每秒能传输的数据量是传统内存的几倍甚至几十倍,而不是它的存储容量更大。

TurboQuant将KV Cache压缩到六分之一,带来的直接效果是数据传输量的减少。这其实是在解放内存的带宽,让GPU的计算核心能更高效地利用数据,本质上是提升了AI硬件的整体利用效率,而不是让内存芯片变得不重要。换句话说,TurboQuant不仅不会降低对内存芯片的需求,反而能让现有内存硬件的价值得到更大发挥。这和市场的解读完全背道而驰。

市场狂欢背后的FOMO与美光财报催化

除此之外,TurboQuant目前的发展阶段,也远远达不到能影响产业格局的程度,这也是市场刻意忽视的一个重要信息。

首先,谷歌至今没有发布TurboQuant的官方代码。目前市面上所有的实现版本,都是社区开发者仅凭论文中的描述自行编写的,并非官方认证。其次,当前主流的AI大模型推理框架,都还没有集成TurboQuant算法,这意味着它目前还无法在工业级的大模型部署中得到应用。最后,TurboQuant的所有实验验证,都只在Gemma、Mistral这类小参数模型上完成。对于70B以上的大参数模型、MoE混合专家架构,以及1M token这样的超长上下文场景,论文中没有提供任何一份测试数据。而这些才是当前AI行业内存需求真正爆炸的场景。就连从事KV Cache研究的业内人士也在社交平台吐槽,称自己做的研究反而“杀穿”了自己,甚至直言KV Cache量化其实是一个“dead research”。这场市场的狂欢,在业内人士看来,更像是一场无厘头的闹剧。

那么问题来了,既然这场技术误读如此明显,为什么全球资本市场还会出现如此剧烈的反应?答案其实并不复杂:算法成为了一个导火索,点燃了市场对内存板块未来的担忧,再叠加AI领域长期存在的极度FOMO情绪,最终引发了一场非理性的抛售潮。

我们先看市场的底层担忧,这需要结合美光科技的最新财报来看。2026年3月18日,美光科技公布了2026财年第二季度的财报,营收达到239亿美元,远超市场预期。看似是一份亮眼的财报,但是美光的股价在财报发布后,却连续四天下跌。市场真正担心的,不是美光现在的业绩,而是未来的增长逻辑。财报显示,美光在第一季度的资本支出同比增长68%,达到53.9亿美元,这笔巨额支出是美光对未来AI内存需求持续增长的巨大赌注。市场原本就对这笔支出的合理性存在疑虑,担心内存行业会出现产能过剩的情况。而TurboQuant算法的出现,恰好给了市场一个“合理化”的看空理由。如果AI的内存需求真的会被算法优化,那么美光的巨额资本支出就可能成为泡影,内存企业的未来增长也就无从谈起。这种对未来的担忧,在TurboQuant的催化下被无限放大,成为了抛售的核心动力。

其次,则是当前市场对AI领域的极度FOMO情绪,以及由此带来的迷茫。FOMO,也就是害怕错过,是过去几年AI领域市场情绪的主流。在AI技术的快速迭代下,任何一个看似有突破性的研究成果,都会被市场无限放大。从ChatGPT到DeepSeek,再到如今的TurboQuant,市场已经形成了条件反射:只要出现新的AI技术,就立刻解读为“颠覆性创新”,并且迅速用资本进行定价,而忽略了技术本身的应用范围、发展阶段和实际价值。在这种情绪下,人们面对一个AI研究成果,第一时间的反应不再是去深究研究本身,而是去猜测它会带来什么样的产业变革,会造就哪些新的龙头企业,会淘汰哪些传统巨头。就像这次的TurboQuant,市场真正在定价的,根本不是算法本身,而是“AI内存需求见顶”这个叙事。而这个叙事,恰好契合了市场对内存板块的担忧,自然会引发资本的疯狂出逃。

产业底层逻辑与理性的回归

其实从产业发展的底层逻辑来看,TurboQuant算法如果真的实现大规模落地,不仅不会降低AI行业对内存的需求,反而有可能推动需求进一步增长。正如我们节目中多次提到的杰文斯悖论(Jevons Paradox)一样,如果TurboQuant算法真的能实现KV Cache的高效压缩,让大模型的推理效率大幅提升、成本大幅降低,那么大模型服务商就会利用节省下来的显存和带宽,去拓展更多的应用场景,从而带来新的内存需求。最终整个AI行业的内存总需求,不仅不会下降,反而会持平甚至上升。

这也是摩根士丹利等机构对内存板块持乐观态度的核心原因。他们认为TurboQuant的出现,本质上是降低了AI规模化部署的门槛,会推动AI产业的进一步发展,最终利好整个半导体产业链。

遗憾的是,在当下的资本市场中,市场需要的是即时的情绪价值,是“突破性算法”、“DeepSeek时刻”、“行业天花板”这样极具冲击力的叙事,而不是需要慢慢推导、层层验证的产业逻辑。这也是为什么这场乌龙事件会发生,也是为什么我们可以预见,未来这样的乌龙事件还会在AI领域频繁出现。AI技术的发展速度远超资本市场的理解速度,而资本市场的情绪波动,又会反过来影响技术的发展节奏。这种错位,在AI技术尚未成熟的阶段,会一直存在。只不过,在AI技术快速发展的今天,我们更需要的是保持理性和冷静,而不是被市场情绪牵着鼻子走。

感谢收看本期视频,我们下期再见。

📌 文中提及的人物和组织

关键字: turboquant kv-cache ai-memory-demand market-misinterpretation vector-quantization