Kimi K3与“做题家思维”
[小乐]: 在连线之前,我刚才对Kimi K3有一个评价,我没好意思说,但现在我觉得也可以说。我有一个很刻薄的评价,我其实想拿它当标题来着,但是后来想想算了。但我可以在这里说一下,我觉得Kimi K3是什么?我这话特别刻薄。我觉得Kimi K3是一个做题家开发的做题家AI。我的观点就是,这就是一个由做题家思维的人开发的做题家AI。所以这个AI的能力,真的是特别做题家;这个AI的开发思路和最后实现的能力,真的是一个特别做题家的一个方法。但做题家归做题家,做题家不一定没有用,对吧?
大家可以在这里进入Google Meet举手就可以发言。在大家举手之间,我看看评论区有什么。我觉得大家不用提它有没有什么共产党的意识形态等等,这些AI可能都没让你以chatbot的方式用它,这不重要,人家就没想让你这么用,这根本就是干活的一个AI。那个千问开不开源?我跟你说,千问的3.8 Max说是openweight。千问的3.7不是openweight,但千问的3.8 Max,因为最近中国的其他模型都是openweight,所以千问最新的模型马上就要发了,这个最新的模型是openweight开源的。但是千问以前的这些模型,像千问的3.7 Max,在AI的评测之上效果之差,让你很难相信它能做得多好。
好,那么我们第一位请突突心夜,请说。
Codex 5.6的使用体验与子智能体
[突突心夜]: 我主要来分享一下我自己的Codex使用体验。我自己并不是编程相关的岗位,我是搞音乐的,但是现在用Codex开发很多跟音乐制作工具相关的一些东西。我们公司有采购,给发额度,但是我自己也在公司以外订阅了Pro版每个月20刀的套餐。在5.6更新后,我的体验首先是,确实从几个层面上明显感觉到它省了很多Token。第一是它本身模型能力提升,就是省Token;第二是我发现它现在的工作流程,以前它可能是给它一个长任务,它会把这个任务拆分成很多段,然后每一段都会去亲自手搓,但是现在的话,其实它更偏向于去写一个比较长的脚本,然后通过这个脚本的工具去自动执行。所以它基本上所有的Token都消耗在创建脚本的吞吐上,它自己本身不会做太多“狗拖”的行为。
我经常跑的任务都是属于一直干,干到晚上睡前,我就直接睡觉,告诉它我要搞一个通宵任务,它可能直接运行到第二天早上七八点、八九点。但是我发现基本上也不会消耗我太多的额度。但是如果在5.5版本,要是通宵运行的话,消耗基本是不可估量的。现在5.6版本,我们公司主管都不让我们用Fable了,因为我们这两种都有采购,无论Fable还是5.6 Soul,主管现在建议我们用5.6的Soul,而不是用Fable,因为便宜得多。我基本上分享的就是这些。
[小乐]: 好,谢谢。对,这个我也可以呼应一下。因为我最近开发网站,那个网站只是个前端,但它后端有特别复杂的数学分析和信息抓取等。我经常也是跑一个八个小时的任务,但是发现它其实没有消耗特别多的Token。我特别认同你的一个点:它会创建很多subagent(子智能体),用这些subagent去做很多任务。我以前都不看这些subagent,昨天我仔细点开它的很多subagent,来看它到底写了什么规格、它的优势是什么、做了哪些事情、它的评估是什么。点开看觉得挺有意思的,就是看它写了一个subagent来做什么任务,以及这个subagent是怎么跟下一个subagent去交互、去完成任务的。读它那个subagent的内容,真的会觉得智能水平非常高,有一种很爽的感觉。
[突突心夜]: 我最后再补充一个小点。关于子智能体,因为有了子智能体之后,我发现它的任务并行能力和思维偏向,就是那个主智能体会分配好规划,同时干三四个任务。有一次我后台同时跑了超过十个子智能体,这非常非常好用。
[小乐]: 这个我也呼应一下,这产生了一个新的体验。之前它在做任务的时候,你是不敢打断它的,对吧?它不停你就不敢写新的prompt。但是现在动辄跑七八个小时,中间难免会产生新的想法。现在你会发现,你可以非常频繁地给它写prompt去intervene(干预),但不会干扰它主任务的执行。它的所有子智能体都会自己在背后自行运转,你在前面先跟它聊没关系,修改了内容,它就会自己去修改。所以虽然运行任务变得很长,但你现在可以很自然地随时打断它,随时提新要求,随时要求它检查。比如跑了三四个小时,你也怕它弄的东西完全是错的、白白消耗Token,我就跟它说:你现在一边弄着你的别管我,但你把你现在的内容拿给我看看。拿来一看,我再给它做修改,它立马就修改。这个感受特别像在命令一个真人工作的感觉,真的挺适合拿来干活的。好,谢谢,谢谢刘正老师。
刚才还有个人要连线,断线了。Dr.Key,请说,能听到请说。
个人用户是否适合Kimi K3
[Dr.Key]: 声音清楚吗?第一个想问一下,您用国内的这些处理实际任务怎么样?最近有在用吗?
[小乐]: 没有。我之前用了一下智谱5.2,我没啥感觉,就是体验并不好,所以这次Kimi K3我还没用过。我最近就是疯狂地用Codex。
[Dr.Key]: 那您是怎么用这个智谱5.2的?
[小乐]: 我拿了一个小任务让智谱5.2跑,写一个脚本,想开发一个我一直想开发的小APP。我那个小APP里已经有一些Excel文档和图表了,我想让它来开发。我是接API用的,不是直接在网页上用。
[Dr.Key]: 我还有第二个问题。您最后结论是说,个人单次性的任务,它可能不太合适?这个地方我有点没听太明白,不合适的点在哪里?您的结论好像是说公司用不错,自己用不太好,是不是?
[小乐]: 对。不合适的点在于,很明显Kimi K3是为了大规模的agentic(智能体)任务来做的。在评测上,它在大规模的智能体任务之上确实展现出了优势。但我不光是看到评测内容,也看到很多人吐槽说它做小任务非常贵、非常快把Token消耗光,这就是它的token efficiency(Token效率)很差。但我们也发现,它的Token效率差,但在面对大任务的时候,它的冗余和重复是有道理、有价值的。可如果是一个小任务,也以这种方式来做冗余和重复,可能就是不值的。所以基于这点,再加上它的base model(基础模型)本来也不是那么强,如果是一个单次性的任务,需要比较好的自我知识,而不是给它一个非常完善的上下文,或者需要大量的网页搜索来提供内部知识和RAG(检索增强生成)知识的话,我觉得它的效果也不会很好。因为它本身accuracy(准确性)比较差。
所以这种模型就适合什么?适合公司内部有5个GB的文档,然后必须拿这个文档去做某些任务,这很适合。但如果个人拿两个文件让它帮着做事的话,第一太贵,第二也很慢。这两天我自己没用,但我听别人说如果用官方的,速度非常非常慢。它本来算力资源就可能不像大公司那么多,又慢又贵的话,何苦呢?
[Dr.Key]: 大概听懂了。那还有一个问题,就是您刚刚说那个测评网站上,在任务完成质量和花费时间方面,有相关信息吗?比如它是不是耗时更长?因为它要做后面的那些调整和检验。
[小乐]: 有,测评网站上有price & cost,下面也有speed,有单个任务完成的时间和总任务时长,这些都有。比如time per intelligence task(每个智能任务的时间)。等一下,我选中智谱了,稍等。
[Dr.Key]: 我还蛮好奇它跟Codex 5.6比效率差多少,如果差特别大可能就不OK。
[小乐]: 是这样的,你看它这个time per intelligence task,Kimi K3的这个数据现在是缺失的,他们可能之后会再出,反正现在Codex 5.6比Fable是好很多的。至于其他的时间,它的延迟是比较少的。现在Kimi K3在AA上的时间数据还没有更新出来,可能要等AA再update才会有。现在能参考的是智谱5.2的数据,智谱5.2的时间跟GPT 5.6差不多。你会发现规模完全不一样的模型,时间居然差不多。如果钱也差不多,你就没有理由用智谱5.2了。
[Dr.Key]: 真实的问题是,您刚刚说的那些费用应该都是API费用吧?像国内这些比如coding plan,费用是不是更低?
[小乐]: coding plan肯定比API更低。但是如果说订阅制的coding plan,全世界最值得的肯定还是Codex,无人能出其右。Codex 200刀可以让你用到死,根本用不完。
[Dr.Key]: 小乐老师,我还真在考虑这事。200刀换成人民币,能买多少个国产模型的服务啊?
[小乐]: 但在这事上有一个心得:用得多不如用得顺手。因为开发环境本身各家也不太一样,不同的开发环境你要用不同的方式去管理它的设置等等。如果有一个特别厉害的,就不如可着这一个用。我也搜过,比如你用Codex开发一个程序,然后你拿Cloud Code给它debug,可能效果还不如就直接拿Codex用得好。如果你真的有200刀的预算,就不如就用一个。当然国内用可能还涉及网络等麻烦问题,如果不能用就很尴尬。但如果Kimi K3... 我今天听下来,可以试试,但最近好像比较慢。
[Dr.Key]: 我想把它接到Codex上,这是能做到的吧?
[小乐]: 能做到。但如果你这么接,就只能用API了,用API就贵了。我没试过在coding plan里这样接。所以你看,我之前试过,效果不如直接用coding plan。如果网络没问题,我还是倾向于直接用Codex。如果网络不OK,Kimi K3确实是个选择。Kimi K3肯定不是一个很差的模型,它来做你日常的coding任务和其他任务不会有很大的问题,虽然某些地方有差距,但依然是top tier的模型。要是觉得差的话,多跑几遍,它会自己看着办的。
[Dr.Key]: 那是不是说明国内会一直追,没有被落下?而且我都追出信心来了,感觉Kimi K3之后还有K4、K5、K6,给我拢出希望来了。
[小乐]: 我依然保留我的偏见。我没看出它的base model能力极高,它的能力很多是通过fine-tune(微调)、智能体微调和强化学习硬顶出来的。这取决于你相不相信scaling law(尺度定律)。我认为如果base model没有大规模的提升和质量突破,其实所有的追赶都是短期的。就像DeepSeek R1一样,你的追赶会在对方发布下一代模型时被瞬间拉开,追赶就失去了意义。
[Dr.Key]: 那我再问一个问题,所以base model是很关键的对不对?那国内被卡死的原因是什么呢?是因为芯片吗?
[小乐]: 芯片。包括成本,你能投入的最高算力芯片和资金都是有限的。美国是好几百亿美元在弄这个。
[Dr.Key]: 另外,它之所以能做好,是不是因为他们是商业公司,真想做事,而不是像公家单位那种?
[小乐]: 当然,企业家的逐利精神在这里面是非常显著的。像梁文峰他们,都是真金白银的钱,梁文峰个人都两千多亿人民币身价了。梁文峰可能受中资影响更多,Kimi和智谱都还好。
[Dr.Key]: 我最后想分享一个想法。就算有那么一天,中国AI强过了GPT,但就像现在的手机,虽然小米和vivo非常强,我们很多人还是会用iPhone。会不会有这种可能?
[小乐]: 有可能。评论区也有人说,因为政治或意识形态原因,中国AI我就不用,我自己也会有这种感觉。除非它真的有非常强的高光工具属性,如果Codex很好用,我没有动机去用中国的AI。因为普通人用AI是非常广泛的,用在生活中的各个方面,对于个人隐私、安全性都有很多的考量。如果最后投钱在消费级AI的订阅上,肯定不会订阅国内的AI,这是很有可能的。
[Dr.Key]: 但国内这个AI确实让人改观了,原来感觉很差,现在虽然不算顶尖,但很便宜了。确实像小米和vivo手机,虽然是好东西,但因为价值观大家可能不用。我还是更相信Anthropic和OpenAI,觉得他们的模型会更好。谢谢,我就分享到这了。
[小乐]: 好,谢谢。
张启正,请说。
Kimi K3的实际生产瓶颈
[张启正]: 小乐老师能听到吗?上周五K3刚发布的时候,我就测试了它能做到什么程度。我是做产品的,有一套原型需要转成代码。我告诉Kimi K3我有一套原型,计划用什么框架来转,然后我就去干别的事了,忙着忙着就把这事给忘了。过了大概半天左右,我去看K3做得怎么样了,结果发现它啥都没做。为什么会这样呢?我翻了它的运行记录,如果是Claude或者GPT,它们可能就是去读一下你要用的框架怎么用、怎么下载,然后给你做好规划。但Kimi K3不是,它把所有的文件读了一遍,不仅如此,还把文件引用的库读了一遍,把库引用的库又读了一遍。到最后,整个上下文满了,直接报错说上下文已满。这太傻了。
[小乐]: 你说的这个我在网上也看到过类似的案例。现在很多人都有自己趁手的项目,每次有新模型出来就拿去测。台湾有一个做AI的博主,每次都让新AI开发《皇室战争》那个手游。他让Codex 5.6开发,大概20多分钟就开发出来了,效果特别好;但让Kimi开发,直到他录节目都5个小时了还没开发出来。他去看Kimi在干啥,跟你说的一模一样:Kimi为了厘清它的需求,光厘清就花了个两小时。Codex 5.6花20分钟开发完了,Kimi花两个小时做各种准备、去读各种库,就卡在这一步了。所以你这个例子和我听到的例子很有意思,跑分跑得好,但在实际生产中,它这个路子成本是由用户去承担的,稳定性目前看还是比较差。
[张启正]: 之前Kimi 2.6还没有这个问题,你告诉它你要干什么,它能抓住问题的重要性并进行规划。后来它出了一个体验版的2.7,虽然提示需要消耗三倍的Token,但速度和效果能提升两倍到两点五倍,体验非常好,依然能抓住问题的重要性去规划和解决。但K3完全不是这样,K3完全是在大力出奇迹。
[小乐]: 看他们后面怎么优化吧。不过可能一优化,这些高难度任务的跑分效果就下来了,所以不知道他们会怎么权衡。好,谢谢你,这个反馈很有意思。最近我开发任务很重,没时间来测这些,都还是Codex一条道走到黑。因为Codex的易用性确实没得抱怨,而且量大管饱,我那200刀用到死。但如果Kimi K3有这些问题,大家要不要用它确实可以再琢磨琢磨,或者等它出新版本优化了,再来当小白鼠吧。
吉康,请说。
中美AI芯片与国家级算力竞争
[吉康]: 林老师你好。其实我觉得豆包可能完全不在饭桌上面。但是日常中,从学校角度来讲,豆包已经完全够用了,比如生成一些PPT,对于非专业的人来说完全够用。但我跟同学聊天,大家都觉得,一旦新模型发布,上一个模型包括之前的所有模型就都没用了。比如DeepSeek现在好像已经不在饭桌上了。这什么时候是个头啊?这种竞争到底图什么?
[小乐]: 这没头。因为对于中国来说,AI是国家安全中的国家安全,包括芯片和AI的自主掌控。因为AI最后说不好要通往AGI,一旦进入AGI,AI能力就是国家能力,自主掌握AI就是自主的国家能力。所以没个头。哪怕过两年中美的AI差距从现在的九个月拉大到两年,中国也不会缴械说从此不搞AI、未来都用Anthropic的。AI现在已经像核武器一样了,虽然这个比喻不是特别严丝合缝,但对于中国来说就像“拥核”一样,必须有自己的前沿模型,所以AI竞争是没头的。
[吉康]: 之前Fable发布的时候说它很厉害,我看微博上TK老师讲,它几秒钟就能攻占国防部什么的,中国的模型好像没有这些方向的宣传,打榜好像不在乎这些?
[小乐]: 目前应该没有。国内的舆论有三种叙事:第一种是Kimi K3已经超过Fable 5了;第二种是Kimi K3目前仅次于Fable 5和5.6,排第三;第三种是说这些都夸大了。现在国内很多人确实觉得它超过了Fable 5,但这没有任何证据,连Kimi官方都不敢这么讲,他们的官方口径是第三名。但我的看法是,说它第三名都有点夸大了,不过它确实是个不错的模型,虽然稳定性差一些,但不到稳定第三名的地步。所以国内说超过Fable 5确实是无稽之谈。
[吉康]: 您刚刚和上一位对话说,base model不如别人是因为没有芯片。但我印象中,当初ChatGPT刚火的时候,高端芯片并没有被禁用啊,为什么那时候的文心一言、科大讯飞星火现在我们用起来感觉超级烂、大家都卸载了?那时候差距为什么越来越大?
[小乐]: 因为芯片的技术发生了跃升。最开始大家用H100甚至更早的A100,到现在的Blackwell和Rubin,算力芯片的提升是巨大的,现在的Rubin架构和最开始跑的B100、B200完全不可同日而语。最早那一会儿,AI参数没那么大,也没那么厉害,大家其实半斤八两。真正的飞跃是从GPT-4o到o1这一步,这之后差距就拉大了,因为模型变得尤其大,英伟达的芯片也变得尤其快。而中国恰恰卡在了H100这一代上,别人都开始用Blackwell了,差距自然就拉大了。早期大语言模型没那么强,芯片也没那么强,后来AI大加速,中国基本就被禁用了高端芯片。
[吉康]: 如果是因为芯片原因,中国也可以通过走私等各种手段搞到芯片吧?
[小乐]: 当然,走私是个大领域。一是可以走私,二是可以在海外建服务器,这些手段都有。但这就没有在国内直接买那么方便和高效。而且国家政策上,习近平也未必希望大家把钱都拿去走私英伟达,他更希望把资金投向华为,帮华为把国产芯片弄好。走私英伟达比正常买要贵得多,如果把一倍甚至几倍的钱花在走私上,只获得和美国公司等效的算力,这在国家层面上是没有效率的,还不如直接买华为的国产替代。
[吉康]: 前段时间一直宣传智谱很厉害,我不炒股,但听说智谱的股价已经跌到只剩三分之一了。
[小乐]: 因为智谱和Kimi K3是直接竞争对手,有Kimi K3就没有它。Kimi K3比它强,它就失去了很大一部分市场。它不像DeepSeek走“极便宜”的路线,智谱没有那么便宜,也没那么厉害,一旦Kimi K3反超它,它就立刻面临困境。最近跌价主要有两个因素叠加:一是Kimi K3的强力替代,二是最近韩国等半导体/AI股的收紧,导致大范围的AI股获利回吐。两个因素叠加,导致它跌得尤其猛,跌了三分之二。
[吉康]: 好,谢谢您。
[小乐]: 客气。
摸到AGI雏形与AI将临派
[小乐]: 好,我们今天就这样吧,今天聊的内容技术性比较强,接入的人不算多,但大家聊得挺好的。我最后看一眼评论区。有人说,如果能见识到AGI,那就是见证历史了。对于AGI,我的感觉取决于它的定义。在某种程度上,我认为我们已经摸到AGI的雏形了。像我正在用的Codex,你要说它不是AGI,它在哪方面不是呢?它已经是AGI的雏形了,就看AGI能走多远。至于AGI是不是真正的人类智能,这是个哲学问题,我倾向于认为它跟人类智力不同。但从定义上说,我认为现在就是AGI时代了。所以我不是AI泡沫派,我是典型的AI将临派。作为一个AI将临派,我还是希望和敦促大家多用AI,想办法找到场景去使用它。定个20刀的订阅,把额度花完,给自己开发个APP、建个网站、写个抓取脚本、做个定制的newsletter,任何事情都行。请疯狂地用吧,这真的挺重要的。不要和AI的使用离得太远,如果离得太远,未来对个人可能会非常不利。
好,那么我们这期节目就到这里,感谢大家的时间,也谢谢刚才参与交流的同学们,下次节目周四晚上见,拜拜!