关于大语言模型、物理AI与工程化实践的深度思考 FearNation 世界苦茶 2026-07-30

为什么单靠语言模型能搞出AGI

AGI必然是结合物理AI,单靠语言模型搞不出来AGI,这个谁跟你说的?我对这个问题就非常不同的看法,我认为单靠语言模型是搞得出AGI的。为什么呢?其实我以前说过一次,这个跟斯坦哲学真的有点关系。中国人修房子和发电厂便宜,当然了,但你要看成本结构,就是在模型训练中,电费占多少,人员费用占多少,数据费用占多少,算力费用占多少?比如说如果模型训练电费占70%,中国可以便宜的不是一星半点,但如果模型训练下来,电费占10%,你比美国便宜一半又能怎么样?

而且还有,其实我以前讲过一次,大家都知道集中力量办大事,对吧。很多人认为中国的电价便宜,电价分工业电价和居民电价。中国的居民电价,因为有政府补贴,中国的居民电价是挺便宜的,但是中国的工业电价便宜吗?你可去搜一搜,中国的工业电价不便宜,真不便宜。

长兴科技,长兴科技很正常,长兴科技卖铲子的。现在内存是最缺的,而且华为的950,高通道的HBM也要靠长兴。现在做内存的,内存的短缺,可能是三到五年的事情。做内存的涨,很正常,长兴当然很正常。

关于等待基础模型与准备Agent的思考

好,我们回来到这边,联系到Dr.Key。请说,小老师能听到吗?能听到请说。应该是HTCN吧,你是不是写HCTN的?这可能要改一下,Holy crap,对HTCN,对。然后这个我感觉听得挺清楚,所以我有一个细节的问题。就是我听到您说好多次,比如说像这个视频模型、视频的这个应用,感觉好像不如等待Base Model的一个进步,对吧?就是从企业的角度,比如说我们选择什么方向,那我可能不需要投入去做这个应用,那从个人的这个角度,我在想就等待这个Base Model的过程当中,去积累或者做什么准备呢?当然这个问题肯定不具体,也比较复杂,但我想听听您这方面的思考,谢谢。

这个问题非常有意思,而且是一个非常现实的问题。我对这个问题的根本看法是,其实现在学AI,你不用学那么快。大家有没有注意到,今年年初做OpenCloud的时候,大家排队安装OpenCloud,现在我估计80%都卸载了吧?因为现在OpenCloud的功能,尤其最关键的一些功能,就电脑操作等等的本身,如果不是你非要去让OpenCloud帮你直接发邮件,或者让你直接操作Telegram之类的软件,OpenCloud的其他本机基于文件夹的操作功能,这个Codex已经完全实现了。就现在这个OpenCloud本身,没有那么重要了对吧。

那么最早那些练这个prompt engineering的,后来有reasoning模型之后,这prompt engineering就完蛋了,就没有任何意义了。那从reasoning model到这个agentic model,这个又不一样了对吧。所以说我觉得AI这个东西呢,我觉得现在也不用学那么快,也不用跟那么紧,因为可能再过三四个月,包括最开始做MCP那些的,现在还有谁一定要做MCP?不一定了。就这个东西呢,不用跟那么紧,它一定是越来越易用。

但是我觉得有一个东西,是现在可以去做的,就agentic coding里面的很多skill等等,未来是一定能够有用。当然如果你skill成本很低,如果你现在多写几个skill给自己用没问题,那未来可能进入动态skill的时代,就不需要那么多的静态skill来储存了。但我觉得有一个问题,是值得去琢磨和值得去慢慢去弄的,就是这个agent的生成和agent的定制化。

因为我认为,大家现在已经早就进入到动态agent的时代了。就是我们今天讲subagent,你在一个agentic的coding或者在一个agentic工作流之中,系统会自己生成无数的subagent来完成一个工作。但是如果一个人真的要做创作,尤其你刚才说你要可能要做视频创作、做视觉创作,那做视频创作和视觉创作的话,我会觉得如果你能够想到做一些定制化的agent,可能在未来还是有用的。

而且我觉得agent跟下一步,也会有一个高度相关的一个能力,就是从这个reasoning和这个chatbot的时代,向agentic的时代,一个重大的转变就是从一个prompt的设计到一个工程结构的设计。那我觉得到未来,如果真的有比较好的base model基础之上,做这个video generation,那我觉得这一步很重要的也是一个工程结构。它肯定不是靠现在这些比较傻的什么storyboard去操作去完成的,但是它应该也是有很好的工程的去操作来完成的。

就如何把一个AI的使用工程化这一点,是agent里面非常重要的点。所以说如果能做一些定制化的agent本身的测试和训练的话,我觉得可能是未来也会长期有用。就有一些简单的工具级的,我觉得没有用,但agent的这部分,我觉得未来是有用的。所以我觉得你现在,比如说你不基于这个视频,但你基于文本等等来做一些定制化的agent,或者做一些定制化的agent操作,我觉得可能是一个值得去试一试的部分。好,这个小林小老师,您这段说完了是吗?说完了。

提示词的结构化与工程化方向

网络好像有点卡在,我对于这个,您说把这个提示词然后要往这个结构化方向走,我可能需要您举个例子。然后您一会儿举例子,然后我再接着说。就是我感觉这功能化的方向我有,就结构化功能化的方向我之前有想,咱们以这个CHIGBT跟图的模型来说,它现在这个图很惊艳,但是你想把它拆开,我不知道有没有好办法,但是我没有好办法。我这些试轨词就不成功,我觉得它这个东西工程化可能和我理解的工程化不一样,或者说它还不是那么简单的工程化,它没法工程化。

Exactly,好问题,它能工程化,我跟你说怎么弄。我先从prompt举个例子过来。我们做prompt engineering的时候,你是用一些非常短的context上下文去优化输出。比如说你问个问题,你说你是一个医学博士,你是一个政治学专家,你是一个中国社会问题专家,用这种很短的context来主导这个内容的输出。但进reasoning时代,这么短的context一进reasoning流程,吃掉也没有意义了。

那现在在agent的时代,这个工程化里面有个非常重要的点,你如何结构化上下文。因为整个内容是靠你提出的大量文本文档和几个MD文档在共同约束最后的生成,所以说最后生成内容是靠流程的设计、复杂的上下文的构成,再去约束最后的输出的,而不是靠一两个魔法性的词汇在约束输出的。所以说哪些东西在约束输出?甚至输出都不是文本,输出的是一个工程化的内容。所以这个工程化内容需要什么样的context?你如何提供高质量的context来让一个东西持续地完成工程化的输出?这个呢就是一个点。

那么context很注意了,context就不一定是文本。就说你那个问题了,这个Chat GPT生成的图很惊艳,但是没有办法修改,成绩比较弱。如果把Chat GPT生图和Canvas的结合起来,把这两个工具结合起来,在Canvas内部,就可以对Chat GPT的图片做非常好的图层化的生成,和基于图层化再去做二次修改。我最近最开始用这个东西。所以在整个Context这一步,包括这个工程设计,我就看这个工程设计了。而且这个工程设计需要你把不同的工具衔接起来。你如何用Chat GPT衔接Canvas,在Canvas内部来完成这一步?

那未来也一样。未来会不会是CHIGBT衔接Final Cut?我说这个视频,会不会CHIGBT衔接Final Cut或者衔接其他各种各样的工具?所以你看,他就从去调整这个词汇prompt,变成了设计一个工程。这工程里面的,有各种不同工具的搭配,有你的质量控制,有你的这个context的结构和这个工作顺序的设计。这就是你自己需要去设计的内容了,大概是这样。但这个肯定就比prompt engineering要复杂得多。

我有点没听清,您刚刚说那个工具是什么?就是跟生图搭配的那个?Canvas,我打到评论。我明白,应该是一个设计的,Canvas。对。OK,或者Figma应该都可以。明白。

关于基础模型直接生成视频的探讨

但是以这个视频为例,我还想再追问一句,比如说视频这个东西,您真的觉得说报文本是可以的吗?因为我真正尝试过,比如Cdance什么的,他们会有一些资产等等还是一个门,我当然认为是靠图了,是靠图的衔接做基础,而不是纯文字衔接。但那个图的承认是靠文字的。我觉得未来,因为你看图已经是现在base model在多模态之下自动掌握的能力,现在多模态读视频也没问题,所以说以图作为中介来变成视频。

但我也不知道,这个我真的不知道了。我觉得对于,因为我们有点不知道这个Large Language Model他自己对这个问题的理解是什么样的。就他需不需要通过图作为中介去理解视频,还是他直接是用代码或者更小的单位去理解的,这个不好说。就是最后在这个他的层级之上,包括他是用什么样的方法去进行视频,就是但现在还没实现啊。就未来如果有这个base model直接升视频,他是什么逻辑来的,我觉得不好说。但如果有agentic流程,他应该也能帮助你,就算他不是用图片做中介,他也应该能够帮助你用图片做中介来完成视觉化的确定这一步吧。

这个我觉得到时候,这个我倒觉得你现在不需要去考虑这个问题啊。就是易用性一定是这个用户体验,应用性一定是现在这个模型最重要的。我们既然做这个AGI,它就是用自然语言和最简单的交互就能够完成,这是它的威力之所在。所以这部分我觉得你不用担心。但是怎么工程化,我觉得是需要去担心的,因为不叫担心,是需要多花功夫去想的。我认为即便是未来要做一个高质量的生成内容,肯定也不是谁说句话就生成一个两小时的感人电影。这是不太可能,也是要工程化的方式去完成的。

专用应用与基础模型的区别

不好意思,我还想再质问一句,如果您时间到了的话,您可以不回答。比如说我们现在咱们就以做公众号为例,有一些工具的,就是这种比如说公众号的一些编辑器的网站或者这种设计的网站,当你充值会员之后,真的这个体验要比AI生成的要好很多。如果你是玩的话,对吧,你比如说并不是以这个为业,那你可能恋爱型。但是如果说你是以这个为业的话,你可能还是需要这些工具等等。那这是一个比如说跟这个视频比较相关的一个场景,就说明这个应用还是在实际生产过程当中蛮有价值。

另外一个呢,还有一个更我想不明白的问题,就是您说这个C-Dance它是偏应用的,这个base model就覆盖了,但是C-DANCE它为什么不是base model?它的区别在哪?我有点没想象,因为这个区别是什么。首先你刚说付费体验更好,你可以试一下cloud design。cloud design做PPT,做这个presentation非常厉害。第二个C-DANCE是不是base model?C-DANCE当然绝对不是base model。为什么C-DANCE不是base model?这个问题突然一问,那个区别是什么?区别在这,什么是base model?base model就是一个token generator。token可以generate text,可以generate一个音频文件,可以generate一个image,当然它同样可以generate一个视频。但现在还没有base model直接生成视频,现在生成视频都是从图去生成视频,像Thora或者说Thora他们都是用别的方式在这个模型之上继续来的。所以现在Base Model应该到目前为止还没有直接生成视频的。

所以说你看C-Dance它的操作流程是什么样的,你用个Clean嘛,其实跟C-Dance差不多啊。就这些呢都是在Base Model基础之上直接Reinforcement Learning通过后训练实现这个功能的。也就是说这部功能是靠非常多的后训练和它自己的System Prompt实现的。我给你举个最简单的例子吧。是专用和通用的区别吗?甚至不是专用和通用的区别。它是这个区别:

你可以想象这么一个事。如果你要生成一个视频,你把你的东西写给我,我来帮你生成,是不是都有可能?我用各种方法调用各种工具给你生成一个还给你有没有可能?有可能对吧。你把Cdance想像成这个,就是他把握帮你生成这部工具化和流程化了。但他依然是不是你这个prompt直接或者你的一张图直接生成视频。他就像你在微信上,把你的文字和图发给我,然后我通过各种复杂的方法调用各种工具,也用了base model帮你生成了一个,拿给你看你行不行。他像这个东西。大概明白了,它内置了很多程序,很多流程。Base model就是很简单token generation,我给一个prompt,prompt给我出东西,这就是base model。

中国AI的优劣势与算力等效

好,那我大概就到这里,谢谢。好,好,下面玻璃艺。朱李你好,听得见吗?你好,听得见。因为是这样子,上回直接主题。我可以说是比较盲目的相信国内的AI不太好,然后所以总的来说我就是想问说,那么对于像我这样的人来说,我们本期节目有没有什么即使是我这样的人也无法忽视的一些重点或者结论?

对不起,我可能有点打击你。没有没有没有,有啊有啊有啊。就是我刚才说的,就是比如说,刚才有几个点我觉得梁文峰说的还是可圈可点的。也是中国能够稍微做好一点的,就是因为有了AI coding的帮助,所以说突破CUDA的生态,建立一个至少是写这个底层算子编写的生态比过去会容易很多。所以说建立CUDA以外生态这个事,有agentic coding之后确实变得更容易了。这会导致国产芯片替代比过去要容易,虽然不像他说的那么容易,但是也蛮容易的,这是一个我觉得是算是优点吧。

第二个优点呢,就是因为AGI再好美国人也不会用,中国人也不会用美国的AGI。所以DeepSeek或任何中国的AI公司不用做全世界。就是它的成功有两点啊,就是你不用成为全世界第一个做AGI的,你只要做中国第一个且别差太多就行。比如说你是中国第一个,比美国差四年,就不用干了,这事就没必要了。比如你做中国第一个,比美国差三月,那我觉得还行,毕竟社会扩散还是需要社会成本的。但如果你是中国,都不能做到中国第一个,就比较难了。所以我觉得这部分呢,也不能因为这个就完全否定DeepSeek和中国模型公司。毕竟美国AI再好用,那是美国AI,中国政府是绝对不会用美国的AI的,这是一个资安问题。所以大概是这样,其他的方面好像... OK其他方面我就说一个吧。

就是如果四张750最新的这个,真能顶一个B200,我觉得可能真还行,虽然现在其实顶不上啊。但如果能这么等效算的话呢,我还相信华为的产能扩张会比较快。就比如今年华为能应该能够导致住80万张750,就等效20万张B200。那当然跟B200的产能比差太远了,但我相信这个可能每年基本以翻番的数字还是有可能的。虽然呢这个也不足以拉平和美国的算力差距,但是呢确实是可观的数量,这不是搞着玩的,就这个数量是可观的。也就是说我们应该能用一年半国内折腾出来一个新的anthropic等像算力的公司来,这是可能的。大概就这样。

AI是否是泡沫与对可支配收入的替代

OK,我没有别的问题了。好。对。请后面的人来吧。好,谢谢。好下面一位。XXX你好,我可能会觉得话,我想反驳一下。我觉得话AI是一个比较大的泡沫。你怎么说?就是说第一,我觉得它这个大语言模型和一些生成类模型它现在即使它是那种数学,它都可以解决那种数学家没有解决难题。但它很多常识性的问题,它实际上是没有,对于那些没有办法验证的问题,它其实是很难去解决这个问题。

然后第二它就是,我觉得这个就是因为它,我们生活中有很多漠视知识,就是哈耶克所说的漠视知识。他这种知识没有布局给你去训练嘛。就比如说我早上要从哪里走、去哪里、打车,这都是一些,怎么说,这都没有,这都是他都不能打到数据从训练。但是他确实有,我觉得他最大的一个优势就可能就是把知识的,获取知识的成本降低了。但我觉得除了对那种大厂来说,好像其他的行业应该影响比较小。

好我回应一下。就是这不是你梁文峰说他认为AI最后的产值能够占到GDP的10%到20%,所以说呢这是一个没有泡沫的产业。我这个问题,我跟他想法是一样的,而且我觉得10%的不止。为什么呢?我来说几个数据啊。中国美国日本居民可支配收入占GDP的比重,是中国43,美国72,日本也是70多。

那么AI能够有多少产值呢?其实最残酷的来讲,就是AI能替代多少居民的就业。AI抢的是什么呢?AI抢的就是居民的可支配收入。如果AI能够替代所有人的工作,AI加机器人上来能够替代所有人的工作,那么AI的产值就是在中国43,美国跟日本到70%,就能够占几率70%,这个数量就大得吓死人了。如果AI替代所有白领的工作,就是服务业工作,那AI产生的产值也应该能够上看GDP的30%在日本和美国。所以这就是我认为AI为什么没有泡沫的原因。就是AI的产值怎么算呢?就算AI其实是来抢人均可支配收入,抢这个居民可支配收入这一部分的。

所以从这个角度来讲,因为现代AI的替代性,你说的对啊,有很多默会知识AI不具备。但关键我们反过来讲啊,有哪些默会知识是用在知识性工作之中的?比如专业知识工作之中,有多少是靠默会知识来完成的?其实我觉得比较少。操作性内容之中,有更多的默会知识。我们跟世界的物体打交道,有更多的默会知识。但是文本性知识内容之中的默会性知识比较少。比如说这个医院的医生看这个看片,看这个X光或者核磁共振的影像,这里面有很多默会知识。这里面没有很多默会知识。比如说医生读你的血检样本的血点值,这没有很多默会知识,对吧。就比较少一点点。

所以说你说他能不能替代所有的工作?不能。但是你就看他能替代多少,他的产值就是GDP百分之几,这事挺残酷的。但是,就是从这个角度来讲,我觉得你刚才说那个,你太低估AI了。就你觉得AI好像除了帮前沿科学家解决问题和生产知识之外,没多少影响。你就想想,AI现在已经干掉多少会计、多少设计、多少这个翻译了,对吧。那其他,他对于这个知识型,就是所有白领都是脑力脑洞知识工作,对这部分的替代那是非常非常迅速的。

所以说AI最后能够有没有泡沫,你就思考这个问题。AI有没有泡沫呢,你就想AI能够替代多少工作,这些工作占GDP的可支配收入多少,这就是AI的上限。

但我觉得它不一定是那种,怎么说,它不一定是那种替代性工作。就是比如说我以前写过代码,这一般就是我们写代码一般都是找那种直接一个复制转体,把别人已经做好的一个模式复制到我这里来。我觉得这AI把这个动作自动化。但我觉得它并没有什么生成可以,就是说它生成的新的代码好像并没有什么卵用,对我来说可能是这样。

你平时做什么coding工作你觉得AI不生成新的code的?就是比较创造性的工作吧,可能是就是要搞出一个新的什么。但是它确实是一个比较省力的,可以如果我要做一个比较糙的东西就可以能AI,但是你做出来之后他还需要一个不断的修补。你平时用你平时vibe coding用的多吗?我用的比较少,感觉他发挥的作用不是很大。

我觉得你,对,你看我跟评论区就跟想法一样,感觉这个同学其实不使用AI写什么工程代码。我觉得你可以尝试拿你生活中的一个事,拿给AI做一下,你就知道了。我觉得你这个想法有点实在太低估AI了,就是AI在coding方面这部分你实在是有点太低估AI现在的能力了。我承认它有一个比较强的自动,就是说我有一个生成一个报告,然后我每次要自己手写就有点花时间,然后让它自动生成一个。这确实是一个。

不是不是跟你说,我觉得你平时用AI限制了你对AI的想象力。我觉得你真的,但有时候我能理解,就一个人的生活中没有那种需求,所以他没有用那种复杂程度来用过AI。所以他觉得AI好像就是打打下手,因为我不了解你的工作类型和你实际做什么,但我觉得如果你能够...

我是金融的。做金融,OK那这样吧。你做金融对吧,你是做二级市场,一级市场的?我现在就做一些基本的数据分析。做什么的数据分析,你随便举个例子给我。就是收集一些公司财报。好公司财报,那好好。假设啊,假设你是做新能源汽车行业公司财报的。假设怎么说,一会儿你让Codex给你做中国和外国所有涉及新能源汽车上市公司的财报,做这些公司车型横向的毛利率对比分析和毛利率变化,并且做成一个前端网站直接给你看。你都可以把我这句话截下来直接拿给他。我不知道你是多少钱订阅,如果你是100美金的话,四个小时之后你看你得到了什么,你就知道AI都有用了。

我知道他可以做这个,但是他就怎么说,这要一个人去做这意义不大,一个人做你起码能弄三天。AI三十分钟连数据带前端展示都给你做完了,你还要咋。但我就觉得这是对我这个工作的意义不大。

OK,好,谢谢。我最后说一个,这个同学确实你用的比较少。我觉得这个东西对你的工作影响挺大的,而且大到什么地步?这就是如果有很多金融业和咨询行业的junior analyst,这就直接这工作有没有的差异。就如果那个senior analyst他能发现他用Codex 40分钟就能做完,他就不用再招一个junior analyst来做这个工作。这就是我说刚才最后要干掉这个可支配收入的部分。对好谢谢你。好下面一位。

中国AI集中资源发展的推演与猜想

好先下一位。后生兄听得到吗?听得到。我想请问这个梁文峰,他公开讲,也不算公开,他讲说他大量采购GB200,然后华为的象征性来一点,又说未来的架构是因为达堂岛,华为就算了吧,我们不需要去国外跟人家争第一名,我们在国内做鸡头就行了。我们可不可以公开宣称说,习近平的AI中国梦破灭了?

破灭不至于,但是很不乐观吧。就习近平的中国AI梦就是还是需要中国能够超过美国,或者跟美国平起平坐才可以。就现在这个差距呢确实很不让乐观。而且这个问题呢就是现在中国也就这两家在正儿八经做,一个是DeepSeek,一个是通义千问。DeepSeek这个公司跟这个千问比呢还是有一点优势啊。就DeepSeek他虽然这次泄露文件里面没讲,但我帮他讲几句啊。就DeepSeek还是一个有真正科研能力的公司,就DeepSeek有很多真正节省资源的注意力机制啊、MOE的机制啊,发这些论文啊确实是很有想象力、有想法,而且也蔓延到其他企业在用的。就是在这方面DeepSeek能力是很明显比阿里要强的。而且在比较少的投入之上,DeepSeek的模型能力因为阿里的模型比DeepSeek大很多,就那么大的模型,阿里的模型也没见得比DeepSeek的模型真的有什么优势。

所以从这个角度上来讲我觉得DeepSeek,就比如说我现在打开AA的Analyst AONAS的DeepSeek V4 Pro开到Max的intelligent index有44,但44跟前模型比非常差,但是阿里的3.7 Max只有46,比较多2而已,但实际上3.7 Max比V4 Pro大的不是一星半点。所以阿里的公司还不如DeepSeek。

所以说中国就得俩老老实实做通用型base model的公司,从现在看起来是非常的不乐观。但你说是不是这事就梦碎了呢?我个人认为啊,我个人认为习总最后可能会用一个办法,我真的猜会用个办法。因为中国的算力真的不太够用。梁文峰现在也说了,说你看啊,哎呀我们这个中国做大模型的公司太多了,用不了这么多,最后中国能有仨做大模型的公司就不错了。最后梁文峰把这事上升到一个政治高度,因为他确实是在政治上最靠近中央的公司啊。最后习总让工信部下一个阶段跟华为一样,让丁薛祥直接来带这个队伍。嗨,别月之暗面、这个minimax、什么什么智谱了,把你们公司的人手和算力全部给DeepSeek,都听梁文峰的,让梁文峰来搞。我们别在中国内部互相稀释,互相减少这个人员人才和算力。最后咱们就搞这个举国体制。华为把你们所有的产能给DeepSeek,阿里把你们阿里云的算力开放给DeepSeek,这些公司把你们公司的人才拿给DeepSeek,让DeepSeek举全国之力来做这个AI模型的发明。最后如果习总把全部的资源压上来,那DeepSeek能不能搞得定,能不能弄出一个好点的AI,我觉得我们可能见得到这一天。但如果这一天之后DeepSeek还是拿不出好的模型,那就寄寄了。那我觉得中国可以投子认输。但我猜国家可能还得这样挣扎一下。那我现在放鞭炮有点早就对了,先买着放着等他。反正早晚有一天。就我理解,OK。

关于苯并芘致癌物标准的讨论

我想补充一下,你前几天做直播又想到苯并芘。你有一些东西漏讲,因为你比较忙你可能没注意到这边。我可以补充,我今天才发现台湾的标准它对标欧盟的,它最高每公斤是两微克,中国是十微克。对,我后来发现为什么我发现B站上面都在讲台湾怎么吃毒油。他们都没看到十微克这个标准。因为这次检验出来是8.17微克,其实在中国,中国是可以上市的,给伟大祖国人民吃。

不,这个在你这个问题不是相关的。就苯并芘,我觉得本来就不是一个毒性那么强的东西,它跟以前一些食品毒不一样。就苯并芘这个八微克肯定比你吃烧烤吃烤肉要健康得多。就是你吃烤肉产生的这个一级致癌物比这玩意多的多的多。但它是不是不好?是不好了,就是有没有问题?有问题了。但它不是一个让社会惶惶不可终日的。因为我觉得台湾社会也没有就是比如我看台湾社会也没有大家马上回家看看我的油是什么油一定要丢掉,特别担心大家一碰未来就要怎么样,对吧。因为只要你平时抽烟吃烤肉,你就不用担心苯并芘的问题。

开源模型与政治倾向审查

好好好,老师我们晚点再见,好谢谢。好下面一位,三粒李。三粒,对不起一个粒。喂能听到吗?能听到请说。那个你好,李老师你好,我想请问一下这是关于你对开源模型的看法。主要是因为我前一阵子有在实际试着部署通义千问的小模型,然后想说直接用他接着Agent来做一些简单的工作。不过后来我一开始就试着先问他一下一个简单的跟国际政治形势有关的问题,然后叫他去搜寻一下资料。结果他回覆给我的内容,简直就像是一个中国的大外宣粉红那样子。不仅内容对齐中国官方口径,还加油添醋了去鼓吹中国的优越性。这让我想到中国政府或者中国,用这种开源模型的形式去,对,去输出它的政治意识形态。

开源模型的应用场景与潜在的政治偏向

去影响国际形势的可能性,因为以目前开源模型界来说的话,中国的绝对是第一梯队。而且现在Hugging Face上面的一大堆的各种变体的模型,也基本上都是从中国的模型去微调出来的。

我觉得未必。第一,大家使用开源模型,可能比较少是拿来当chatbot用的,更多开源模型是来做一些任务的。比如说做一些基础翻译、写一些基本的代码、写点接口、做点测试等。这些东西不那么容易受到模型内置的意识形态的影响。

第二,模型内置的意识形态也分好几层:它是直接在base model里边的,还是在后训练里面的。现在的base model里面有,但很多这种政治偏向也在后训练里面的。只要你能够jailbreak或者break the guardrails,他都能够说出来正常的话,八九六四是啥、中国是不是极权国家也都说得出来。也就是说,如果你下载一个阿里通义千问的模型,或者你下载一个用OPUS 4.8去蒸馏的版本等,其实这个模型倒不至于有那么强的政治偏向。

所以我说两个点。第一大家很多人用这个开源模型在本地部署,或者用开源模型不是做chatbot的,是做一些实际的编程任务的,在这方面政治偏向影响不大。第二,开源模型就是开放权重模型,你下来去jailbreak或者break the guardrail也很容易,所以这个也不是很大的问题。

但是真正的问题是有的。中国的模型在全世界使用,我担心有些别的问题。就是中国是不是独裁国家、这个习近平这人好不好,这种偏见我觉得很难在base model里面,这种偏见可能更多是在fine tune那个等级。但有一些更深的偏见,这是我最近特别想做的一个项目:就是我下载一个开源模型jailbreak来做测试,我想知道他们比如对国家债务的看法、对国家投资的看法、对于经济体系的看法、对于基建的看法,这些更深的跟国家治理相关的,对于大数据的看法、对于个人隐私的看法、对于纳税人意识的看法等等。

如果他使用了大量的中文内容,是更容易把这些偏见隐含在base model里面的。那么如果这些偏见在base model里面,来做一些非编程类的agentic内容,比如刚刚提到的金融的、商业开发的等等,这些偏见是会随着base model扩散的。我认为未来的模型真正使用法律、经济、税收政策会远远大于8964是什么、习近平是不是独裁者、中国是不是独裁国家,这种都是平时问着玩。所以我认为真正关键的偏见不在于8964、习近平、新疆,真正的偏见在于我刚才说这些治理性的和技术性的方面。

但这个东西需要实验,需要好好下载一个千问的模型,完成jailbreak后来做实验,到底会不会有。尤其接近agentic,时间一长了,它在agentic运转的时候会形成什么结果。这个东西可能是扩散出去之后,真正导致这个偏见扩散的部分。这是我的假设,要做实验才知道有没有。

AI辅助科研与Harness工具的价值

我基本上就想稍微分享一下,我用AI做目前硕士研究的部分。目前使用的方法是让AI直接读一篇论文,让他把论文里面的算式之类以程序的方式写下来。基本上他可以直接使用这个论文的方法,然后我就可以使用这个script直接跑。遇到一个问题,我用的是Codex,读了论文把东西跑出来。重新检查后发现他其实有部分,不知道是看错公式还是怎么样,有时候括号就放错地方。幻觉部分其实计算出来的东西就是错的。

也就是说他在进到AGI之后,Harness他可能是不必要的东西。可是我认为他并不是不必要的东西,而是我们应该做更好的Harness。因为Harness相较于模型来讲它是便宜的,是可以更准确、稳定提供东西的。Harness这两项东西并不是当我有这个能力的时候它就消失了,它其实是一种辅助的工具,让我非常准确的可以提供这件事情。

还有另外一件事情,老师之前做Artificial Analysis节目的时候,说他们网站上面并没有提供把整个任务跑完的时长是多少。他其实是有提供的,比如说Execution Time或是Token Usage,基本上都能完整表达他到底跑了多久。所以也能直接看到,OpenAI的模型明显在完成任务上面非常有效率,比Anthropic有相同的智能,可是速度明显快,花费更少Token,就更有优势。实际上它其实才是最便宜的模型,相较于来讲,甚至都比DeepSeek的模型还来的便宜。

在这样子的逻辑底下,其实也可以回到刚刚所讲为什么DeepSeek这种中国模型公司会有点问题的原因。就在于他如果没有在一开始就足够强,大家直接去使用它,他没有办法拿到像Coding的资料,他其实是没有办法很迅速的透过大家的使用帮他把资料标注完。因为这其实就是最高品质的标注的资料,透过所有人的互动跟现实的程式库的互动,他能够得到最好品质的资料。这些开源模型,因为开源了,模型被拿到别人的伺服器上面架设起来让学生使用,所以资料基本上都没有回到他们公司去。这代表他们没有办法非常迅速的拿到这些资料。我觉得这相较于所谓的显示卡卡脖子,还要来的更显著的一个缺点,就是在这件事情还会更慢,它会更久。

最后想问一个问题。目前可以看到写程式这件事情还是最具有商业价值的一件事情。写程式有商业价值,我个人认为它最大的价值是可以解放我手上这台电脑真正的潜力。之前你就是看看YouTube、浏览网页,现在如此孱弱的电脑也能多做很多很多的事情的时候,对我的生产力是提升的。可是如果没有办法再做下一件事情,没有那么多的程式、就写程式的人来提供支撑这样子的经济规模,其实不够的。这是我的问题。

Harness的局限性与AI替代工作的进程

我先简单回应一下Harness,然后跳到这个问题。Harness本身当然会有很多检查或者重复程序,它能够帮助结果更有效率,也能帮助结果更准确。但你也知道,如果一个模型的幻觉很高的话,在一个Agentic的流程之中,它不一定能够修正它的问题,也可能会放大它的幻觉。这里面并不一定所有的东西都能被修正,说不定这比一个Chatbot有幻觉之后进Agentic问题越来越大。

你也会发现最近有一些极端案例,这些agentic coding直接给你库删了,完全不是你的要求。他们也不知道自己运行到哪,他觉得好像删了最好,给你都删了,这个问题最近也时有发生。所以Harness的部分不一定就能让一个东西更有保障或者更robust,这是不一定的。所以我会觉得在这个base model这一层的accuracy非常高、hallucination很低的话,当然我不是说Harness没用,但现在这个Harness可能对于AI来讲过重了。这是一个风格问题。

回来回应你这个问题,其实我认为早在coding之前,已经有大量的工作被替代掉了。初级的copywriting、文员文案、初级的翻译、速记转写,早就干掉了。但这个干掉为什么没有像agentic coding这么明显呢?第一它比较分散。agentic coding非常显著,是因为这些人工资高。作为一个programmer一个月钱很多,又是大公司,Meta一口气裁8000个,这东西就非常受关注。但是比如说速记与转写,我认为已经彻底干掉了,几乎在全世界。过去很多大公司里面都有速记岗,做会议纪要,现在一个AI做的又准确又好。这些被干掉的数量在全世界加到一起也很可观,但是没有人统计,他就比较不可见。

再说一个就是客服岗位。过去客服岗位被自动答录机大规模干掉了,现在有了LLM的应答之后,又更多的会被干掉。这些外包公司在印度,中文的外包在中国一些经济欠发达的省,可能原来招两万人现在直接裁一万人,或者慢慢裁。这些东西比较不可见,不太容易被我们看到。

所以我不认为Agentic Coding是第一个大规模的工作替代。下一个是什么?我认为已经在多点开花了,现在已经在各种不同的地方干掉各种各样不同职业的人了。平面设计类、设计师肯定干的非常厉害了。AI不是一个行业一个行业干掉的,为什么agentic coding是Harness的主要功能呢?因为程序员在做AI。就像梁文峰说的,公司做AI的第一用户是内部员工,第一用处就是帮我们这些人更好的开发AI。程序员最懂自己的需要,工作也繁重,所以最早把这玩意弄出来。这倒不是说LLM Agentic最适合做coding。Codex很快改名叫ChatGPT,就是因为发现不只能做coding,可以做非常多的事情。coding现在被关注其实跟社会结构有关,跟产品和技术逻辑无关。

Self as Agent在金融模型中的应用潜力

我现在是在读资讯类科系,在学校有做自己的金融模型。我会用Loop Engineering套进去Claude,然后让他去跑整个流程自动迭代、自动审查、自动探索,去连接券商的API等等。可以帮我看我的持仓,还有整个盘势的趋势、各种因素的影响。

我觉得在这个部分上,可能会让一个投资新手快速的可以越过两三年的磨练,变成一个相当有程度的交易者。我认为这个某种程度上有点在替代所谓的交易员。现在AI还没有那么强大,但是等之后迭代有更强的AI之后,交易员的职位也会被取代掉。所以我觉得这个是AI最有用的地方,也不会形成什么AI泡沫。

我觉得AI泡沫确实不存在。你刚才说的是个非常有意思的用法:Self as Agent。他不是一个任务的agent,或者他也是一个任务的agent,但他任务更广泛,会代替你在某个领域的所有工作。就代替你做一个交易员,盯盘分析持仓等等你交给他,当然权限管理好一点,都给你管了。

这是现在很快的下一步,这也是OpenAI想实现的。从Task Based可以变成Individual Based,真正让人以Agency的方式、有主体性的方式做任务操作。确实就能够实现这个,你就更难想象AI有泡沫了。

其实最近我也在做自己的agent,而且是非常广泛的回复性的agent。之前有人拿LLM做过我的agent,但那是搜索性的,还不是一个语言风格加思考风格加学习风格性的。我特别想自己调一个agent,因为我产出大量内容,用所有内容做一个既有学习风格、再加思考风格、再加表达风格的agent。如果成功,而且AI能力足够强,说白了就是替代我自己。我希望最后我被我做的agent替代。如果这种东西能实现的话,就像你说的Self as Agent,自然没有什么泡沫可言了。

订阅成本优化与AI算力发展趋势

我现在是两个都有用,一个是Claude一个是Codex。Codex成效真的很强而且算力蛮省的,Codex真的很精致。但是现在算力是完全不够的,我光用Codex去做金融模型的架构,它光第一层的组织就要跑了非常非常多的Token。我现在是Pro,每天都用完,要等下一周。

你非常推荐你到200那档,200那档和100这一档的Token差异极其巨大。我以前用100那档也是很快就See you next week。但200这一档绝对不是100的一倍,体感大概是10倍。如果到200这一档,虽然多花钱,但不会有那么多等待时间,很划算。如果你真200预算,我非常建议花在一个上,绝对比分在两个各100要划算得多。

我是有在Claude的LLM里面安插一个OpenAI的API,让两个去协助我架构建构一个最完整的模型,所以想说可能不单只有用一个模型。最后想说的是,可能未来10年或20年后算力一定足够,那价格应该就会被压下来,人人都能买。美国AI模型应该也会像今天中国模型这么便宜。中国模型如果在时间上拖得太长,中国的便宜优势就会不在。

回应关于MOE训练算力的争议

在下一个之前,我先回一下评论区。有人说听了前半个小时技术小错误太多了,说MOE并不会显著增加训练计算量,甚至反而会降低。这怎么可能呢?

一个模型2.8T的总参数,一个激活800 billion,一个激活50 billion,训练算力倍数绝对不是800除以50。因为你要稳定的每次激活800 billion的参数和每次激活50 billion的参数。训练一个模型前向传播、反向传播,各层的梯度计算、背后的参数更新,每次调800个billion和每次动50个billion,怎么会是一个算力?

第二,MOE也是分散在各个不同的expert上的。各个expert一般会驻留在某个GPU上,你每次激活的expert数量少,跨GPU的通信压力也小;激活数量大,跨GPU的通信压力高。你怎么可能有MOE激活数量增加,不会显著增加训练计算量,甚至反而会降低呢?更高的激活量,是不是要更多的训练数据和训练时长?训练一个50B的和训练一个800B的,他的训练时长和数据量就不是一个东西。你的训练数据量也需要更大,算力量绝对不是800除以50,甚至是一个指数级的增长。

MOE本身因为是一种稀疏方式,会导致每个token的消耗量降低。但是我们指的是梁文峰说的:美国800 billion,我50 billion,我年底要训150 billion。你训一个50 billion激活的模型,和训练一个150 billion激活的模型,数据量、计算量、时间算力都是指数级增长,反而会降低是谁给你算出来的?在工程上怎么可能呢?

如果MOE激活参数增加,训练量降低,梁文峰买算力干啥呢?梁文峰花200亿去买成批的B200买算力干什么?梁文峰说我们现在的算力不够,未来算力也不够。

本地部署硬件门槛与应用痛点

我是KM Beta。我挺有感触中国缺卡这件事情,因为GPT-4上市后我早期买了coding plan,当时比较划算。今年一月份买了Claude的coding plan,当时大概季度90美刀。现在贵了,International大概150刀一个月,给团队用的是12亿token五六百人民币。Kimi肯定也有这个问题,大家抱怨很慢。云端模型肯定有审查,之前处理一些政治类文本就会停在那。开源模型里面阿里还是比较厉害的,千问的27B稠密模型在开源社区依然属于黄金模型,我下载了OPUS 4.8蒸馏的27B Dense本地跑。本地玩家显存撑死48G或者32GB,最多跑到27B,除非买现在涨到10万的RTX6000。

我自己有囤很多硬件,去年2月DeepSeek出来,想跑满血版,买了512GB内存,用128核心服务器CPU当显卡跑。大概几token每秒,很慢但是能跑满血版的几百B的那种。普通人其实没必要写code,如果不写出来都是垃圾。只有Agent才能把这些硬件性能全部压榨出来,普通人刷抖音几十Mbps够了,AI跑本地有传大文件需求,就需要万兆网络,把半导体硬件性能全榨出来。

探索本地部署场景与Agent记忆管理

你折腾了这么多本地部署,最典型的用例是什么?因为本地可能都会等很长时间。本地能跑是能跑,但是一个简单任务弄半小时没有意义,我没有找到那个sweet spot导致我本地模型起码一个多月没打开了。

本地模型现在用的最多的就是把它接到Whisper和Index TDS这种语音转文字里面,用LLM修饰它。但本地模型一般就是要接到Agent里面,比如Hermes,数据落在本地没有泄露问题。

你有用Agent的memory管理吗?你的每一个对话有上下文,到一定程度会压缩。Codex有时会记住一些personality和habit,但是它的memory不能控制。现在有很多插件(比如MCP)是可以控制的,它基本上把你跟它的历史session全部记录下来,在里面抽取原子化的事实知道你的习惯。最有名的是Honcho,老外开发的。它是一种知识库,对你非常了解,知道你提一个音下一步干什么,也知道你本地有哪些东西。

这很有意思,感觉非常有用。我已经感受到这个问题了,在一个project跨chat之间,很多时候关键的memory是没有更新的,导致它在不同的worktree选择上会出问题,我因为这个返工的时间很多。所以我需要接memory的挂件。

其实AI最重要的就是Context Engineering,其实memory也是上下文。AI现在是一个大厨在炒菜做饭,但是你要给他备菜。

任务准备与工具配合

那有的菜你要焯水,你要给他弄好了,然后或者是帮他切得更细一点,或者怎么样子。这个东西很重要,这个东西要人来做,或者你跟 AI 一起配合,要把它做好。你不要每次都,反正一个任务,你要做任务之前,你要把它菜单备好。反正你自己也要跟 AI 有一个共用的笔记空间。有很多人用 notion 或者是 obsidian,对吧。对 Obsidian,就是 MD 文件什么的。然后把它一些重要的信息都可视化下来,让它下次能够读进去。这就相当于它自己的记忆的一部分扩展,对吧。对,这个我发现项目大了其实特别必要。我去试试这个 Huncher,很有意思,我去试一下。他有个像个笑脸一样,我已经看到这个了,我们把它接进去试试。好,很感谢你,还提供了特别重要的工具,到处去试试,谢谢。

节目尾声与AI发展展望

今天我们也连了一多小时了,我们今天连到这。抱歉,我们不能每次让所有人都参与连线,因为这个时间确实所限,我这边都已经快 11 点半了。今天聊得也很开心,我们就今天暂时先聊到这里,那么有很多问题呢,我们之后找机会和大家讨论。反正 AI 这个竞争还没有完的,这个竞争到水落石出估计还需要一段时间。但是我觉得好多现在经常去争论的大问题,我觉得有时候可能从今年年初吧,就是从 GPT-4 到现在 Kimi V3,可能这是最混乱的一段时间啊。可能再往下,很多的问题相对来讲会比较容易一点点,那我们之后就慢慢去再观察吧。反正 AI 这个事呢,你看今天很多连线的同学其实用得也很凶。我觉得你要是想用凶点你就用凶一点,如果你决定要用 AI 你就别浅尝辄止,你就把大任务交给它用,就是尝试把最厉害的任务、大的任务交给它用,然后练习你跟 AI 的协作能力吧。好,那我们今天这个节目就到这里,那我们就下期节目再见。大家记得感谢相信,感谢分享,拜拜。

📌 文中提及的人物和组织