深度泄露会议纪要揭示中国AI发展中的算力瓶颈与竞争格局 FearNation 世界苦茶 2026-07-29

DeepSeek会议纪要泄露风波

那么最近的中国AI界大势不断。首先是这个GLM5.2的发布,然后是Kimi K3,然后呢DeepSeek没有发布任何内容,但发布了他们的一个会议。这个会议其实已经是两个月以前的事情了。两个月以前为了第二轮融资,DeepSeek开了一个会议。这第二轮融资是对DeepSeek来讲非常重要的一轮融资。因为就是这轮融资,DeepSeek会补足非常重要的资金,能够进行算力的扩张,也可以稳固团队。这两点在这次投资会之上,都是梁文峰认为可能最重要的内容。因此这是一次举足轻重的融资。那么这是融资会之后的两个月之后,这个融资会的全文就被泄露了出来。

泄露内容其中有非常多很劲爆的实话。因为在中国听到梁文峰是一个很低调很低调的企业家,在中国诸多的互联网创业企业家之中,AI创业企业家之中,梁文峰都算其中可能是最低调的一个了。这本身也跟DeepSeek与政府的特殊关系是有关的。之前就有很多传闻说如果要见到梁文峰,是要通过浙江省委办公厅去约见的。所以梁文峰很明显已经是国宝级人物,是国家资产。因此听到梁文峰直接出来评价他的公司和评价同行,实在是不多。突然一下子有3.4万字能够听梁文峰在一个closed door meeting里面相对比较老实的评价——请注意这是相对比较老实,因为这是一个投资者的会议,所以梁文峰一定会美化自己的公司,这是一定的——但是相对比较老实的评价了关于中国AI自己的公司、华为的芯片等等的一切,还是很令人震惊的。而且内容对于我这个长期的中国AI的吹哨派来讲,其实是有利的,这里面做了大量的中国AI吹哨和华为芯片吹哨的内容。所以今天我们就来谈谈这个事情。

首先我想说,我非常理解很多朋友现在已经对AI的话题深感厌倦了。第一,AI的讨论实在是太多了。第二,现在因为这个AI的技能替代和职业替代,很多人也生出了一种新的卢德主义情绪,所以比较烦AI,这个我完全理解。但是请容我多讨论讨论AI,因为AI这个事不止从个体来讲,还是从国家竞争来讲,都是这个时代可能最重要的问题。梁文峰的这次会议泄露,其实对于我们理解个体AI以及理解中美AI竞争,都提供了不可多得的重要信息。所以今天我们就来好好讲一讲这次DeepSeek非常重要的3.4万字内部会议泄露的情况。

泄露内容的真实性与上市隐患

首先这次泄露是不是真实的?我认为真实的可能性非常大。第一,很多记者已经向DeepSeek去寻求澄清,询问这个是不是真的,DeepSeek一直对此保持缄默。那么这个内容里面有大量对DeepSeek本身和华为很不利的信息。所以如果是假的,我认为DeepSeek作为一个负责的公司,早就应该起诉这个信息泄露者。现在听到的消息是DeepSeek暂停了第二轮投资,并且把这个信息泄露者相关的机构排除出了第二轮融资的序列。从这个角度上来讲,我认为这个会议纪要是真实的可能性几乎是已经非常非常的大了。第二,会议纪录的内容有大量企业内部内容和对AI的了解,所以是编造的可能性其实看了之后也几乎没有。所以总的来说,这份会议纪要的真实性,我觉得已经不必再质疑了,这一定是一个真实的。

那真实的内容泄露的东西实话程度非常高,高到为什么梁文峰这两天如此生气,高到可能会影响DeepSeek的上市。因为这里面直接提到DeepSeek在使用非法渠道购买英伟达的芯片。因为DeepSeek和中国的AI企业是美国商务部的禁运名单,所以如果你采用非法方式购买芯片,代表在上市的时候你真的很难通过上市尽职调查披露。如果通不过上市的尽职调查披露,很可能IPO之路都会受到影响。在这个情况之下你可能会吃官司等等方面,所以对于DeepSeek的上市可能会有比较严重的影响。所以梁文峰这两天才这么的生气,就从梁文峰亲口在上面承认通过比较非法的渠道、灰色的渠道购买英伟达芯片,就知道这里面内容是很劲爆的了。

我来给大家一个一个梳理一下。今天应该是我觉得全网梳理的最完整的了,因为这里面内容很多,我不光梳理,我还会帮助大家拓展一下来了解这个事情的本身。我把今天的内容分为以下几个部分:第一就是他泄露了什么;第二是他美化了什么;第三是整个会议记录之中自我前后矛盾的部分;第四是梁文峰非常强烈的关于AGI愿景的部分。我们就分这几个方面来讲。

核心研究员的时间被用于数据标注

第一个我们来看看泄露了什么。泄露是什么意思呢?就是这里面说漏嘴的部分。也就是说这个内容细节其实不应该被这么直白的展示出来,即便对投资人说实话,这事也不应该出来讲。所以从这3.4万字的会议纪要来看,我认为梁文峰的IR(Investor Relations,投资者关系)管理能力是有问题的。这里面说了很多对于自己公司非常不利的信息,这些信息绝对不是梁文峰主动想传达的,但是因为长达四个小时的脱稿,尤其都是投资人问答,在这个漫长脱稿之中,梁文峰就这么说出来了。

有什么东西是可以被称作泄露?比如刚才提到的通过灰色渠道购买英伟达芯片,这个东西是无论如何不应该讲的。我们不说这部分,他泄露了什么?第一,他泄露了一个非常不利的信息。他说(原话):我们公司有一半的人在标数据,有一半的核心研究员、最重要的人有一半在标数据。

DeepSeek是以研究员实验室作为品牌和形象的公司,不是一个主力的公司,而是一个AGI实验室。那么在这个AGI实验室,最稀缺的人、最重要的核心研究人员一半在做劳动密集型的工作。这其实是一个不正常的,说明这个公司的人才其实是在做他们不应该做的事情。在美国,数据标注和数据质量优化已经是一个完善的产业,比如专门做AI训练数据标注的Scale AI。但在DeepSeek内部,要由核心研究员一半在标数据,这跟他的其他一些话中间是有很大的矛盾的。包括他说我们公司非常轻松不加班、氛围特别好,因为必须在一个很轻松的氛围之下才可以有科学进展。但我很难想象一个核心研究员,他的时间在标数据,他的工作能好到哪去。第二说我们公司没有KPI完全自由探索,如果核心研究员做标数据的工作,我认为这应该是带KPI的。包括提到要靠算法的效率去赢,但如果这个公司还卡在数据标注这个环节之上,其实对于真正这个公司能不能把最好的时间放在算法优化之上和AI优化之上,是要打一个大大的问号的。

这其实打破了中国AI公司的成本优化神话。梁文峰提到,解决AI问题在这个阶段靠的就是标数据。其实这个话是没有错的,高质量的训练数据尤其在Agentic阶段是特别特别重要的。但实际上这个点上中国是没有优势的。最早期的AI训练所需要的数据,就是那些人工标注数据确实可以找劳动密集型的人来做(什么是自行车、给图片打点、给文本打点),但现在阶段的数据,比如编程内容、论文内容、书籍内容的标注其实是很难的。大家说发达国家包给数据标注源,这是不对的,在发达国家很多时候也是找博士生或研究者来标数据。现在的数据是要靠专业人士来标的,比如法律数据不可能找法律专业以外的人来标,商业咨询等具有GDP价值的任务只能找专业人士来标。这个在西方是一个完整的产业。

DeepSeek标数据和中国其他公司有什么不同?中国只有两间公司在好好做base model,一个是DeepSeek,一个是通义千问。像Kimi(月之暗面)和GLM(智谱)做的是偏科模型,做agentic coding和可程序性验证的任务。程序性验证任务的数据标注其实比较容易,可以直接用蒸馏性的数据让其他AI输出来做。但要做泛用性比较强的AI Model,数据的范畴就要超出可程序性验证内容的范畴,标数据的难度就要大大增加。像DeepSeek和阿里要获得高质量数据的宽度和数量,比起月之暗面和智谱是要多的。那两家可能真的不需要这么大的高精尖人才来做数据标注,但DeepSeek需要。有人说这是后训练阶段的高质量长程构造数据,但我认为在模型训练阶段也是需要的。现在的MOE模型要快速收敛阶段没有高质量数据怎么做Transformer收敛?所以这不仅是后训练阶段,训练阶段也是需要的。这就对它的竞争力产生比较大的问题。

人才差距本质上是算力差距

第二个他在里面说了,人才整体上比美国有差距,人才的差距本质上就是算力的差距。他在另外部分又说了人上面没有直接的差距,中国人分散在中美公司中。这两个话不冲突,他的意思是人才本身没差距,但由于企业算力比较少,能做的实验就比较少,实验比较少人才就养不出来。这就意味着梁文峰看来,人才差距背后的变量其实是算力。算力是实验的基础,实验是人才训练的基础。我觉得这个逻辑非常非常好。

所以整个这份泄露出来的一个很关键的矛盾是:中国公司算力上的差距会导致虽然你有非常聪明的人才,但这个人才的成长是有问题的。因此会导致对DeepSeek的一大质疑:DeepSeek到底能不能拥有行业上最顶尖的人才?2025年初大家印象DeepSeek是中国AI最顶尖的公司,通过这场泄露我们要考虑两个问题:第一,DeepSeek还是中国最好的AI公司吗?第二,中国AI跟美国到底有没有可比性?一个非常重要的点就是算力。我们经常听到的叙事是“中国仅仅用美国二十分之一的算力就达到了同样的效果”,这个话在梁文峰的叙事中到底行不行?转过来算,如果算力真的这么重要,DeepSeek在融资能力和投资上比字节跳动和阿里少得多,现在DeepSeek还是最好的AI公司吗?DeepSeek V4比起其他模型在Artificial Analysis的Benchmark上差距是比较大的。

梁文峰讲算力少导致实验基础少、人才养不出来,这挺实在的,但对他自己是不利的。如果算力是AI公司的军备基础,DeepSeek很显然不是一家在算力上有优势的公司。这就衍生出团队稳定性问题。如果人才没有足够的训练会不会被挖走?梁文峰也说保持团队稳定性是面临的一个非常大的挑战或最大风险。梁文峰讲这次融资就是要用期权解决团队稳定性问题。如果有IPO上市的能力,员工手里的期权未来就有巨量财富,加上AGI的梦想,就会留下来。但现在爆发危机:当梁文峰说出了通过灰色渠道买了英伟达芯片,会对IPO上市造成很严重影响,在这个情况之下期权还有没有那么好用?在算力长期不足下,下面的人会不会有不同的想法?

我在网上搜了一下,他的人确实被挖得厉害。罗弗利(DeepSeek V2核心贡献者)2024年底被小米挖走担任大模型负责人;王炳轩(第一代大语言模型核心作者)2025年下半年被挖到腾讯混元;郭达亚(R1核心研究员,主导DeepSeek Coder和Mathematics)被字节跳动SEED挖走担任Agent负责人;阮冲(多模态模型核心贡献者)被智能驾驶挖走任首席科学家;魏浩然(DeepSeek OCR核心作者)2026年春节前后因方向分歧离开。2025年DeepSeek成为了举足轻重的公司,人才被挖得比较厉害。在这种情况下第二轮融资如果遇到颠簸、IPO上市放缓,DeepSeek能不能保持团队稳定性要打个问号。

中美模型一到两年的差距与Scaling Law

另外一个泄露的部分就是中国模型和美国模型的差距了。现在关于中美模型差距市面上说法很多,从12个月到追平都有。梁文峰的说法是一到两年。原话是:“所以我们跟美国的差距可能是落后12个月,可能是12到18个月或者6到12个月,反正简单说就是落后美国两年”。梁文峰对这个差距的判断比市面上绝大多数的判断都要远得多。

有没有可能是故意拉大差距?是有可能的。因为现在中国纸面Benchmark上最先进的模型是Kimi K3,第二名是GLM的5.2,DeepSeek没有那么好。他说中美模型差距依然很大,可以在某种程度上对冲掉Kimi和GLM的优势。但我也认为其实差距就有这么大,因为Kimi K3和智谱5.2是专门的偏科模型,是标准的做题家模型,是没有办法跟泛化能力比较好的模型来比较的。

关于Scaling Law(模型尺寸重不重要),对梁文峰来讲还是很重要的。他认为最大的差距就是尺寸的差距。美国模型一个token的激活参数是800个billion,中国大概做40到50个billion,差距就是二十分之一。虽然Kimi K3激活做到104个billion差距是八分之一,但也是很大的差距。现在OpenAI模型的激活量肯定比中国大很多。对DeepSeek来讲,他们今年年底可以开始训练150 billion激活的参数(前提是能把英伟达的灰色卡买回来),而西方大概2023年底激活量就到了150 billion(Llama 4大版本激活量能到300 billion)。所以如果做到激活量150 billion作为一个限度的话,中美模型差距还真是一年到两年。

梁文峰不相信“我们以二十分之一跟别人做的一模一样”的叙事,他认为一个token的激活参数跟模型最后能力是直接相关的。DeepSeek V4 Pro在各Benchmark上跟最前沿模型差距相当大。Kimi K3在某些任务上不错,但模型效率和GPT 5.6花的钱几乎是一样的,并没有更便宜。梁文峰在这里面说的很直白:“我们跟美国在这里面有一个目前看起来很难弥补的差距,这个问题基本上无解,其他方面如果说有结构性的优势,我觉得可能也没有。”从梁文峰角度看,不太有靠魔法性优化手段弯道超车的可能性。

持续学习的挑战与算力瓶颈

再往下一个,梁文峰也提到了中国公司的下一步是持续学习。他说这个持续学习我们还没有找到非常work的方法,“全世界都还没找到,我们内部管这个叫摸奖”。梁文峰认为AI发展阶段是:大语言模型 -> 推理模型 -> Agentic Model -> 持续学习 -> AGI -> 具身智能。

持续学习其实真挺重要的。现在我们跟AI聊天都不影响AI参数。如果平时的prompt token能用来训练AI,AI就会越来越快。但如果token反过来影响参数,逻辑层数动辄七八十甚至一两百,算法就会非常大。所以持续学习的一个很大障碍还是算力。如果要做持续学习,推理运算量要突然变大,大到像训练算力一样,这对算力需求会爆炸性增长。

所以梁文峰说全世界都没找到方法,其实这不是真的,其他公司已经想了一些办法。比如持续学习可以不影响所有参数,而是影响浅层参数或拿出部分参数来做持续迭代。但这也会让推理算法需要的算力大规模爆炸性增长。为什么梁文峰说没有呢?那就是因为这个算法并不是像DeepSeek这样算力缺乏的公司能够玩得起的。那DeepSeek算力有多缺乏,跟AGI能不能实现有很大关系。

DeepSeek算力不足与持续学习疑虑

就是现在DeepSeek的算力真的是有很大的差距,中国公司都有非常非常大的差距。所以梁文峰说,我们知道下一步是什么,但是下一步要靠持续学习。我要是投资人,我听到这一点,我对AI比较了解,我其实会对这公司有疑虑的,就是我会真的有疑虑。如果持续学习是你的下一步,你的下一步并没有投入算力,因为梁文峰说了,就我们内部对于持续学习这部分现在还不投入资金,就是不投入真金白银的资金去做。那我觉得我是投资人,既然你是一个AGI公司,你是不做现阶段的商业化的,你的目的就是跑得越来越快,是中国最早的跑到AGI的公司。这是你的愿景,但如果你是中国最早跑到AGI的公司,现在持续学习你的公司还没有投入成本的话,那我作为投资人我可能是对这个问题是有疑虑的。

以上梁文峰说了很多对于DeepSeek本身不是特别看好的点,当然他也同时说了很多对华为比较不利的部分。对于华为不利的部分更没有道理了,我觉得这部分应该都是真实的,因为DeepSeek从任何角度讲都没有唱衰华为的必要,就算因为我算力不足,我为了打肿脸充胖子我也得说华为特别好。所以里面提到华为可能没那么好的部分,我认为真实性比说什么中美模型差两年都还要再高。

华为算力卡的现状与差距

这边说的比较多跟华为不太有利的部分。首先一个华为的卡相当于四张华为的卡相当于一个B系列的卡,就是四个华为的950最先进的相当于一张B200。这是一个差距。一方面是差距本身,同时这个950还要再落后两年。这落后两年导致华为卡的折旧周期很短。他说华为卡的折旧最多按三年折旧,今年买今年用还行,明年就勉强,后面再用可能就真的太费电了。所以华为卡的生命周期肯定会短一点。因为华为现在还是等效7纳米制程,你等效7纳米制程跟一个等效三纳米制程的卡肯定是没有办法去比能耗的。所以华为卡它是四张950顶一个B200,同时还落后两年,因此折旧只能按三年算。而且他还说华为的这个量也不够,华为的产能不多,华为也只能给我们这么多,就1.6万张。

他说因为这个价格也不便宜,所以你们在想,华为四张顶一张,但华为便宜。但站在梁文峰的角度,因为华为这个可能是七万块钱一张,这个七万块的价格其实也不便宜。那算过来说英伟达,梁文峰说如果B200现在能买到多少我觉得都划算。所以对梁文峰来讲,华为的卡现在第一落后,第二折旧周期长,第三价钱上也不便宜。从梁文峰本人的角度,最经济实惠的想法还是B200,能买多少就买多少。他们这次融500亿,如果能把这200亿在半年都花完全变成B200他都愿意。他觉得如果采购部门能半年之内把这200亿都变成B200的芯片就算他们做的好。

所以作为梁文峰来讲,现在买华为的卡,第一产能少,他们只能买到1.6万张,等效相当于4000张的B200,就实在太少了,没有用。第二就是这个东西折旧周期短了,也不是很好用。所以华为现在在梁文峰的体系里面还是一个帮助华为做好生态的部分,还真的没有到国内开始说已经可以替代性了。还是我刚才讲的一个事情,大家都知道算力分训练芯片和推理芯片,虽然现在推算一体都在讲这个概念,像Google那个TPU就是推算一体的,这个略去不表。但是现在来讲,华为这个卡可能就是拿来做这个推理卡的,就平时拿来给来用的。拿来做训练卡,华为这个卡应该还有比较大的问题。

这是对外泄露的部分,就是不管对于DeepSeek本身和对于华为都有很多不利的部分。

投资者会议上的美化:所谓克制

转过来讲他美化了什么。大家千万不要忘了,虽然我们刚才都讲这个小梁挺实在的,但实在真的不是认真人性格多实在,实在是因为这个人的IR训练不够,我认为就是investor relation的训练不够。但是这依然是一个给投资人的会,给投资人的会当然是要去美化的。他美化了什么呢?美化的最大一点就叫做克制。克制这个词是梁文峰从头到尾都在讲的一个词,就是我们这个公司的关键就是克制。为什么克制呢?因为我们的目标是星辰大海。这话不是他说的,星辰大海是我自己加的。就是我们这个公司是要去做AGI的,因此为了做AGI我们不做什么。我先给大家透个底,这是把公司因为资源不够不能做的事情翻译为因为我目标远大不屑于做。但实际原因是因为这公司的算力真的不够你做不了,但梁文峰都把它翻译为是因为我志向特别远大我不屑于做。

他不做什么呢?第一不做视频生成。他说在商业上是个好事情,就Sora这个东西他是不做的。第二不做世界模型。第三不做原生多模态,V4通过后训练去完成,多模态只是组件。第四不抢C端,不做C端用户。第五不做垂直应用,像专门做一个Agent之类的。第六不见销售与客服体系。

这几个有一些我是特别特别认可的,比如说视频生成,我也不觉得现在任何公司有砸视频生成的可能性。比如当时Sora,OpenAI放弃了Sora2因为这边有Sora,很多人把它解释为你看Sora做得太好了直接把Sora2干死了,这个是不对的。首先OpenAI商用的video引擎在做但没有做民用。原因就是我以前讲过,大家都是奔着AGI去的,到AGI可能像今天的text to image和text to music一样,text to video应该是内建能力,是不需要通过外部harness去重新做的。所以视频生成应该是未来的base model的自然能力,就是base model的scale再上去一层可能自然就会有这个能力,是不需要用后训练去完成的。所以如果你现在这个base model的发展已经暂停了,你可以现在基于这个来做很多应用,但如果现在base model还在日新月异,你是没有理由现在停下来做应用的。所以不做视频生成我能够理解。

关于世界模型与原生多模态

但是不做世界模型、不做原生多模态,这两个我有不同的看法。原生多模态肯定是base model能力的一部分,现在大模型里面在Anthropic、在GPT尤其是GPT和Gemma里面,多模态都是大模型本身能力所生成的,并不是通过非常非常复杂的后训练去完成的。你在训练阶段就已经做了多模态了。所以多模态这个东西对于base model是非常重要的一个点。现在很多base model的使用都需要靠多模态来完成。你不做原生多模态当然你算力不够我们能理解,但你不能把算力不够说成是因为我克制所以我不做原生多模态。我觉得原生多模态这点你要用克制来掩盖的就没意思了。原生多模态是非常重要的事情,你不做当然就是因为你算力不够你做不好,所以这个可以理解。

第二就是这个世界模型。这一点我也觉得世界模型跟现在的Large Language Model到底有多大的差异,它是不是Large Language Model从多模态的下一步?当然,如果做世界模型,这个算力的量一下子上去可能还不只是一个数量级,这个对于DeepSeek这个公司依然是资源约束的,是非常强烈的资源约束的。当然我知道Anthropic不是原生多模态,Gemini和GPT是。

所以说世界模型和原生多模态对于DeepSeek来讲是因为算力投入真的不够而不做,你不能把这个翻译为是因为我们克制不做。我觉得你可以说克制的点是我不去抢C端、我不去做视频生成、我不做垂直应用、我不建大量的销售与客服体系,这个你可以说是你克制,是你去追AGI。但世界模型和原生多模态我觉得这个不算是克制,所以这是一个美化。

帮助华为生态美化

第二个的美化点是帮助华为美化。就是国产芯片生态一年之内解决,华为只剩产能的问题。就国产芯片已经很厉害了,生态完全没有问题,现在只剩产能的问题。他在里面举了一个例子,这个例子很好,但挺专业挺专门的。就是说因为现在有了AI,因此用AI来跳出CUDA生态来写算子的生态会变得比以前容易很多。这个我完全认可,我觉得他说的很好。就过去在一个生态之外要再建一个生态,如果需要靠人力来写code,这个工作量是很大的,但现在有了Agent coding,你跳出一个生态再建一个生态的成本和时间比以前要低得多的多的多。所以他说他们有一个新的模型叫Triton,这应该是他跟清华一起来做了一个比较底层的模型。那么这个模型用AI来写一些算子的编写层比以前会快很多。这个我觉得完完全全是正确的,因此国产芯片的生态绝对能比以前更快速地补充上。

但是不是生态一年就能基本解决只剩产能问题,我觉得这个不是。因为英伟达的生态不只是算子语言,这个英伟达的生态包括数学和神经网络库的建立、PyTorch这些后端的架构、性能分析调试工具上的准备,就是这个英伟达生态也是由全世界特别特别多的程序员通过很长的阶段维护的一个特别庞大的工具层。你可以说我们把CUDA的算子编写这部分国产生态一年之内来解决,这是可以的。但并不代表基于华为CUDA以外的这个开发,它的开发效率和开发的鲁棒性就能够跟CUDA一样好,我觉得这中间差距是挺大的。

虽然说我认为就梁文峰说那个事本身我很认可,他这个点抓得很好,就是有了AI编程之后,在一个生态之外再建一个生态的便利性是要高很多的。尤其比如梁文峰他们平时做的很多底层的比如多卡通信、内存架构、编译器这些东西,有了AI之后肯定会比之前好写很多。但这个我觉得是在投资者面前美化这个部分。

还有一个美化的部分就是他说的实验室文化。就我们公司是实验室文化,我们公司没有组织,不加班,很轻松,正式工作时间不超过七点半。这就从他们这个核心人员要拿去标数据,以及他也说了我们公司未来组织要做调整,要有更多的层级化,我觉得这个我都不相信。

关于AGI终局差距的掩饰

倒数第二个我觉得比较麻烦的美化就是AGI的终局。第一,梁文峰认为我们已经找到了终局,而且这个终局还不花钱。他说这个持续学习就是终局,刚刚我讲了他持续学习现在在我们公司内部不消耗资源。这就我刚才已经讲过的,就持续学习其实就是最消耗算力的,如果你现在持续学习不消耗资源说不定你还没开始做。

那梁文峰还有一个我觉得是一个很严重的美化,他说终局差距不大,只剩时间成本和体验。意思说AGI是终局,谁先到谁后到无所谓。那我会认为中美有两个不同的差异,那么DeepSeek确实不需要做全世界第一个到AGI的公司,他只能做中国第一家到AGI的公司就行了,但是不是终局到了差距不大,这个事完全不一样。梁文峰勾勒的是天下AGI是一家,就是所有AGI只要到了AGI其实都差不多,就像我们人类也差不多,我们人类智商大概就是90到130之间,普通人,聪明的人再聪明到150就很聪明了。按照梁文峰这个想法好像AGI也差不多,到AGI你130我90,而且90 130也差不太多,勤能补拙。

但是AGI是不是终局差距不大?我觉得完全不是。首先梁文峰自己也说了AI可以加速AI研究,到后面是非线性的。什么叫非线性?现在投入的时间算力最后转化为像摩尔定律一样的Scale up到模型能力的提升是一个线性的,虽然是加速的。但是到了持续学习以及AI自主学习之后是非线性的。因此到一个重要的基点就是AI自训练和持续学习的基点之后,其实速度会变得非常快。所以第一,终局差距是很大的。也就是说如果你的公司卡在人才和算力之上,比如如果假设现在OpenAI距离持续学习和AI自主研发的基点还有两个月,你还有三年。那如果别人从2024年8月份到达这个点,三年之后你跟OpenAI的差距大到难以置信的地步。就因为梁文峰自己也说了AI可以加速AI的研究到后面是非线性的,那你这个终局差距不大就是不对的。

第二点也是一个非常有关系的,什么是AGI。某种程度上我认为我们现在已经进入AGI时代,梁文峰有另外一句话我是认可的,他说这个基点可能不是一个点,是一个漫长的阶段。我特别认可,我觉得AGI不是一个基点到达的时刻,AGI是一个很长的机器泛用性的阶段。我认为我们已经到AGI了,现在我们能看到的最前沿模型的Agentic模式就是AGI,当然未来的AGI会比现在的AGI厉害很多。这就反过来证伪了梁文峰那句话叫终局差距不大。实际上AGI的终局差距很大,厉害的AGI和现在这种一般的AGI差距特别大。所以梁文峰自己美化的那一句,他也知道自己算力不够中国差距比较大,所以说感觉早到晚到无所谓,反正美国先到AGI我们晚到AGI没关系,我们晚到AGI成本低一点、体验好一点就一样,我觉得对于AGI这件事情他这个说法是完全错误的。终局差距是很大的,绝对不只是成本和体验的问题。

关于十个月回本的误导

梁文峰这里面还有一个非常重要的美化,说我们公司投入,其实你别看我们便宜,我们特别快,十个月就能回本。但是这里面很有意思,这十个月回的是什么本?比如他们这次融资了500亿,这融资500亿要快速花完,假设一年花完。什么叫十个月回本?就OpenAI这公司一年能赚500亿人民币吗?赚不到。他自己也讲了OpenAI这个公司一年收入在10亿美元左右就是70亿人民币。梁文峰希望他们公司的采购部今年下半年把200亿人民币都花了,这钱收不收得回来?这钱绝收不回来。

所以十个月回本回的是什么本呢?回的是推理芯片的部署价格,是那1.6万片华为芯片的钱。那钱还真就是差不多10个亿。那个1.6万片,就7万块一片,就十几个亿。就是那1.6万片华为芯片部署的价格一年之内能收得回来。这个是可能的。所以梁文峰在里面说我们利润率6倍,10个月回本,很多人就会误解为你第二轮融资的钱10个月就能收得回来,这个是里面的一个误导性的内容。实际上十个月回本回的就是十亿美金左右这个本,十亿美金这个钱是一笔非常非常小的钱。

梁文峰DeepSeek公司一年收入十亿美金,你知道Anthropic到什么地步吗?请注意DeepSeek一年十亿美金,Anthropic 2024年第二季度一个季度的运营收入revenue是100亿美金。Anthropic一个季度100亿美金,等效就算没有增长一年400亿美金,是DeepSeek的40倍。所以说这个盈利能力根本不是一个盈利能力。所以梁文峰说我十个月回本这事和它是一个赚钱的公司真的是一个完全不一样的东西。

会议中的自我矛盾:降价与弹性

第三个部分就是在这个会议里面,因为它可能脑子也烧了,前后有好多自我矛盾的部分。

第一个就是讲它这个降价。因为DeepSeek很便宜,大家知道DeepSeek V4 Pro刚上的时候是一个价格,上了两周之后又大打折,打了一个骨折价。那为什么要当时降价降了四分之一,为什么要突然降这么多价呢?梁文峰是用一个情怀讲的说,我们团队里的人就不喜欢这个模型贵,就喜欢这个模型惠及万家,所以当时我们这个模型降价了四分之一全员欢呼。但他说这个降价其实不影响需求弹性,他说我价格再翻一倍或者我价格再降低,token的消耗量区别是不大的。意思说比如我涨价一倍还是这么多人用,我降价一半还是这么多人用,需求是没有弹性的。

梁文峰说这个话的意思是想说我们这个公司现在不想赚钱,赚一个够用的钱就行。因为我猜肯定是会有很多投资人在敦促DeepSeek涨价,说你这太便宜了,你涨点价你利润高点。所以梁文峰想说的是需求无弹性,我涨价没影响。但关键就是,如果需求没弹性涨价没影响你为什么不涨价呢?对一个企业来讲就算涨价一倍token消耗量区别不大,你的收入多一倍,你从十亿美金到二十亿美金这一档,你为什么不呢?

反过来讲我作为一个搞经济的人,我听到这个我都觉得不可能,也就是说价格没有弹性,涨一倍价格需求不变,跌一倍价格需求也不变。这种商品非常少,一般要么是高成瘾性物品香烟,救命的药品,完全没有替代品的东西才会没有需求弹性。那你说API token是成瘾性物品、救命的无替代必需品吗?那完全不是,API可以说完全是这一段的反面,API是高度可替代性的、产生大量高度价格敏感的。所以API怎么会价格是无弹性的呢?而且更比如Agentic产品,过去的chatbot可能还没有那么多,但Agentic这个智能体一上来之后,它token消耗量噌就上来了。你们知道Kimi为什么这个API那么便宜最后跟GPT打个平手?那就是它的Agentic coding它消耗量巨大。这Agentic coding一上来这个token消耗量噌就上去了,它怎么会价格没弹性呢?而且这本身也跟经验完全不符。梁文峰降价之后,30天60天90天看这个token的调用曲线,每次降价都明显伴随token放量。所以他说降价不增需求,就和我去OpenRouter查了数据和公开数据都是相反的。

所以我觉得需求无弹性这点肯定是错的。这可能只是他面对投资人逼他涨价的一个借口。看上去他的市场需求很大,而且他也认为自己很厉害,所以投资人希望他涨价,但他不想涨价,他就编这个说法。为什么DeepSeek不想涨价呢?原因很简单,其实我觉得DeepSeek的模型能力其实不好,也就是说DeepSeek现在就是大家拿他做一些量大又便宜又简单的任务,如果他涨价,大家可能会去用GPT-4或者Claude 3.5。所以他不涨价的原因其实不仅不是因为需求无弹性,反而是需求非常有弹性。这是第一个自相矛盾的地方。

友商关系与政府资金的矛盾

第二个自相矛盾的地方就是他跟友商的关系。他在这个泄露出来的文件里面一会说,我们根本就不想垄断,我们跟大家都特别好,我们希望第三方都部署起来,我来帮你复现我来帮你优化,我一点都不担心竞争。他说AGI是一个巨大的生意,没有任何一家可以来做完,而且我们做开源的,开源跟赚钱又不冲突,所以我们开源特别希望第三方部署。但另一方面他又说,我们这个降价降到让很多第三方无利可图。他里面提到最恐怖的一个话,他说美国挺好,做base model的就三家,OpenAI、Anthropic和Google,他已经把Meta和Cohere判了死刑了。他说中国做基础模型的太多了,一定会收敛,当然就是指多数同行要出局。所以他一会说这个市场特别大绝对没有一家垄断希望大家都好,一方面又说我们这个价格已经降到让很多第三方无利可图了而且国内做基础模型太多一定会收敛。这里面也有很多前后比较矛盾的部分。

当然这里面还有一个很明显跟事实不符的是梁文峰说我们这个商业公司我们没拿政府一分钱。这怎么可能呢?任何中国人听到这一句脑子里面立马就知道这怎么可能。首先2024年国家税务总局杭州税务局发表文章就引述DeepSeek的财务负责人说好在税收政策的支持为我们增添了敢投入敢创新的底气,说明DeepSeek大量免税的。而且2024年7月第二轮结束之后工商变更,国家人工智能产业投资基金直接持有DeepSeek 0.28%的股份。规模600亿的国家人工智能产业投资基金已经成为了DeepSeek融资的领投方。所以说压根就拿了国家的钱,怎么没拿政府的钱呢?肯定还不止这些。所以这里面也是一些自我矛盾的部分。

算力差距的具体数据对比

最后来说说这个AGI的部分。梁文峰在这里面有一个非常重要的点,就是我们是一个做AGI的公司,我们公司是有追求的、有愿景的,我们是要很克制的一直到实现AGI。那实现AGI就是靠AI的持续学习。我刚才讲了这玩意高度依赖算力。那我们就说现在算力差多少。

梁文峰说了现在我们有两万张H等效算力。什么叫H等效算力?H100算力,大家都这么算的。如果他把这500亿全部买成GB200的机柜,买现在最好的。现在美国能卖给中国最好的是H200,其实这是严防死守,但实际上他要买的是GB200的机柜。肯定只能靠走私最好的。我们按中等溢价来算。什么叫中等溢价呢?就是梁文峰说这个B200有多少买多少,只要溢价不多。说白了梁文峰是不能通过正规渠道买的,他来买的渠道是要加价的。第一走私本来就有中间成本,第二在国内奇货可居。这玩意是有涨价的,涨价幅度按照外界来算1.8倍到3.8倍不等。我按中等溢价就按两倍算,其实很客气了,5000万一个机柜。

那么500亿能买多少呢?500亿能买1000个GB200 NVL72。这相当于能直接买7万2000颗的B200,相当于28万张华为卡,相当于18万等效的H算力。现在DeepSeek只有2万。我说的是DeepSeek绝对不可能实现的短期把这500亿全变成GB200 NVL72机柜,而且只按5000万的溢价来算。

就算这个实现了,它的算力突然翻了十倍,从两万H等效算力变成了二十万等效H算力。那二十万等效H算力跟西方公司比差距多大呢?Google有五百万H等效算力,Meta有两百三十万H等效算力,OpenAI有一百七十万等效H算力,Anthropic有一百万H等效算力。就算以最好他绝不可能实现的方式实现,他的算力是Anthropic的五分之一。这量根本弥补不了,那现在DeepSeek跟前沿大厂比真的差太多了。他现在只有两万张等效算力,他是Anthropic的五十分之一的算力,算力差距就有这么大。大家都知道中国的厂商算力差距很大,但可能没想到到了这个地步。

梁文峰在里面说我们一共买1.6万张的华为卡。大厂买十几万的华为卡,我们就算买15万吧。买15万张华为卡相当于等效9万张H100的算力。大厂已经把华为的产能卖完了。一年等效H算力可能就20万,就在Anthropic总算力的五分之一。现在产能就小到这个地步。

大厂算力投资与大模型的实际表现

你看评论区有人讲了,Google算力这么多,模型还这么拉。Google你不能这么算,很多公司投入算力的钱,你听这个500亿,DeepSeek最多把这500亿全投进去不可能。阿里三年投算力投3800亿,字节投算力一年要投700亿美元,5000亿美元投在算力之上。那你说阿里跟字节跟DeepSeek不是拉太大了吗?不一样。首先阿里字节Google都有云服务,他们这些算力买回来不都是自己用,要做算力出租。比如字节算力特别大,为什么也不能都算呢?因为豆包是一个C端产品,DeepSeek是一个B端产品。豆包每天的token量肯定是DeepSeek的不是一个数量级。豆包作为一个C端产品它就是要积累大量的推理芯片,这个推理芯片不能拿来做训练,就是拿来给大家用的。那更不用说它出Sora,Sora非常非常消耗token。

阿里算力还要对外出租,而且字节的核心业务是推荐算法,TikTok推荐算法本身就是算力黑洞,它其他产品也要消耗大量的算力。所以虽然字节可能最后要到700亿美金的算力购买,阿里三年要花3800亿人民币算力购买,看上去都跟DeepSeek不是个数量级,那为什么还做不过呢?

第一,这种AI这个事就是实验室性质。像OpenAI和Anthropic这种比较有科学家实验室的公司可能就是比综合型大公司做得好。那国内也一样,国内阿里的算力量肯定是DeepSeek的好几倍,但不做的一样跟屎一样吗?你说DeepSeek不好。

算力规模与模型的表现差异

阿里能通力37.3,那么大的模型,现在8.3preview,一样跟屎一样对吧,所以不一定能做好。那同样呢,就是字节跟阿里的算力多,也并不代表这个算力都要用来做训练。就这个公司一大,又有云服务业务,这个算力是要去出租给别人用的,就它是有很多很多算力的业务在去做的,包括阿里的云服务,还是个全球的服务,但不是中国的服务啊,大概是这样。

所以外国也一样,你看Google发明了Transformer,拿500H的等效H100亿算力是最多的,结果先发优势还是OpenAI的。Meta算力大疯了,Meta的模型一样跟屎一样。Anthropic其实现在反而可能估值最高的,但你会发现,Gemini跟Anthropic、OpenAI其实没有差那么多,所以说不是说算力越大越好。

但我也得说一个,虽然不是算力越大越好,但你的算力至少,你不说你算力跟上Google,跟上阿里跟上字节,你作为DeepSeek,你的算力最好不跟OpenAI和Anthropic差太多。比如说现在最好情况这样,就不可能实现的最好情况,你的算力还是Anthropic的五分之一;就是比较可行的情况,他把这200亿都卖出去,可能最后DeepSeek能够到10万H等效算力算多,你就是Anthropic的十分之一。我就说来了,你拿Anthropic十分之一的算力,和现在这个差距,你去做AGI,你拿去做什么AGI?对吧。

DeepSeek 做 AGI 的可行性探讨

那这里就只能赌一个事了,你就是是不是中国最早实现AGI的公司。就是国外可能早五年实现AGI了,中国六七年之后。当然我觉得如果国外早五年成AGI,中国要等五年才做自己的AGI,可能中间这投资认输了,应该就没有必要继续做下去了。

所以关于AGI这点,我觉得最关键就是来算一算,这个算力差距到底有多少。在这个算力差距之下,DeepSeek的优势是什么。就DeepSeek说,我是一个有情怀、有愿景、有克制、有战略性定力、做AGI的公司,那我们就问了,现在的算力,就是你现在的算力,是Anthropic的五十分之一,你做的最好可能能到Anthropic的算力的十分之一。这还是静态状态,Anthropic的算力不管是租用的还是新建的,还在不断增长,Anthropic也在不断融资,可能要上市了。你做什么AGI呢?就是你今年年底开始训练150Billion激活的这个Token的模型,你就拿这个做,就你的公司禀赋,真的是可以做AGI的禀赋吗?所以这是一个大问题。所以关于整个这里面最大的愿景,就是AGI,其实从现在这个企业的能力资源和钱上,我其实表示怀疑,就是DeepSeek是不是一个适合做AGI的公司。

总结泄露文档的核心观点

好,今天时间有点长,因为这个东西量比较大,我回来总结一下,就是整个这次泄露的文档里面,有以下几个东西比较值得关注。

第一,模型能力。我们平时都说中国已经基本追平美国了。没有,梁文峰认为中国落后大概一到两年,按两年算吧。而且算力的差距依然非常巨大。这个也没有什么其他结构性,就只给追赶。这个结构性的劣势是无法改变的。所以基本上按照梁文峰的视角,就是去魅了中国模型能力追平美国的这个点。

第二,算力效率。我们都说中国模型最厉害了,用二十分之一的算力就能做到啥啥啥啥啥。DeepSeek就证明了算力不重要,你看DeepSeek一出现,DeepSeek时刻,算力股大跌对吧。那么梁文峰自己说了,算力非常重要,DeepSeek如果融资,就要尽快把融资全部换成英伟达卡。DeepSeek并没有证明算力不重要。正是因为算力不够,就是别人800B的激活参数,你50B的激活参数,这个是结构性的差异,做不到的。所以梁文峰自己亲自证伪或者去魅了DeepSeek证明了算力不重要这一点。

第三,华为即将全面替代英伟达。那梁文峰也说了,华为现在是为了帮华为做好生态,实际意义不大,就是一个双轨保险而已。英伟达依然是主力训练平台,如果我融了资,我愿意把融的资全部变成英伟达显卡,也不愿意放在银行里。好,是国产芯片华为已经可以全面替代英伟达,这个也已经去魅了。

第四,开源战略。很多人现在市场上讲中国模型因为这个便宜,会取得巨大的商业价值和全球的标准对吧。那DeepSeek很明显,DeepSeek在主动压低价格,而且认为模型层不会取得大部分的价值等等等等的。

最后还有就是AGI路线。很多人认为DeepSeek能以低成本直接跨越美国,早一步达到AGI。那么从梁文峰来讲也不是,公司必须下注持续学习,而且弱化多模态,弱化世界模型,弱化具身智能路线等等等等。看能不能用较少智能做比较快速达到AGI的一个公司。

所以这里面很多很多过去的,就最近吧,关于AI中美竞争,包括AI本身的说法,好多也是通过这次泄露的文件去魅了一部分。所以我觉得这次这个会议文件泄露还是真的很有意思啊。就是你看到梁文峰这个大实话,其实我觉得对于很多很多问题都提供了——我也不敢说梁文峰说的都是对的,我也讲梁文峰有很多作伪化的部分,但哪些美化我给大家讲了,但这个我觉得提供了一个很重要的看法,因为这是一个投资人会议,所以里面很多内容是相对比较真实的。好,就希望这个也能够来帮大家好好了解了解AI以及现在AI的竞争等等的部分。

我们现在就来跟大家连一连线。然后我还发现呢,我好像搞忘去改那个字了,今天连线的号码不是这个。

📌 文中提及的人物和组织