硅谷AI浪潮的转向:从Token Maxing到Token Efficient的Agent工作范式变革 硅谷101播客 2026-08-20

硅谷AI浪潮的转向与Token策略

哈喽 大家好

欢迎收听《硅谷101》

我是泓君

如果说2025年是Agent的元年

2026年行业有一个有意思的变化

市场从开始讨论模型的能力

变成越来越多地

去讨论Agent的工程问题

有一个从关注科研

到关注工程的转向

曾经疯狂带头烧Token的

这些硅谷公司们

现在看起来也是慢慢地冷静下来了

Uber四个月烧穿了全年的AI预算

Meta计划限制员工的Token消耗量

与此同时

中国有一批开源模型

DeepSeek GLM Kimi

它们的模型能力

越来越逼近第一梯队

现在硅谷的公司们

也开始把它们搭进了自己的工作流

所以我们有一个问题

最大化Token的消耗

无脑去使用最强的模型

还是市场的最优解吗

这集我们就来聊一聊

从Token Maxing到Token Efficient

这背后正在发生的

整个Agent工作范式的变革

今天跟我在一起两位嘉宾是黄东旭

东旭是Llama Ventures的合伙人

也是PingCAP的联合创始人和CTO

哈喽 东旭你好

大家好

还有一位是张宏江老师

宏江老师是Llama Ventures的

高级技术合伙人

现在也是

美国国家工程院的外籍院士

同时宏江老师也是

微软亚洲研究院创始成员之一

也是北京智源人工智能研究院的创始人

同时还是前金山的CEO

宏江老师

非常荣幸您能来做客我们的播客

谢谢

非常高兴有机会跟大家见面

在开始的时候

大家要不要简单先介绍一下自己

好 我是东旭

我是PingCAP这边的

CTO跟co-founder(联合创始人)

最近有个新的身份

就是Llama Ventures的合伙人

自我的定位肯定还是一个工程师

大家都知道Harness

然后Agent coding

我也是第一时间在去拥抱

第二 我是一个创业者

一直以来从0到1

在基础软件

行业

其实PingCAP和TiDB

是一个分布式的数据库吧

也是从北京开始起步

慢慢地客户都遍及全球

我觉得第三个身份就是

因为我是一个好奇心比较重的人

很喜欢自己去做一些东西

比如说像音乐

比如像一些艺术

反正这是我几个的身份

因为今天我们要讲Token这个话题

我觉得请东旭来我们的播客

主要就是一个

你是真正地在玩Agent的人

然后一直在用的人

一直在搭程序的人

所以我觉得

应该会有很多一线实战的经验

给大家分享

我也一句话介绍一下

我心目中的宏江老师

好 可以

其实我人生的第一份工作

就是在微软亚洲研究院

当时我还是一个实习生

当时宏江老师正好在亚研院

处于工程院刚成立的那个时间

是我心目中的大科学家

所以现在非常荣幸

能够在Llama Ventures里边

再续前缘

宏江老师

大家好 我是张宏江

我的状态现在是一种退休的状态

在两年前的话

大家看到了这一波

AI所推动的新技术浪潮中间

而华人在里面

起了一个非常关键的作用

尤其是在大的Lab里面

无论是OpenAI还是Anthropic

还是Google

至少在技术上

这些人都是骨干

甚至挑大梁的人

同时 我们也看到

这一波创业的浪潮里面

其实华人的比例也非常高

无论是从大陆过来的

在这上学的毕业的

然后在大厂工作的

还是说就在这长大的

二代 三代的华人

创业的人都很多

尤其是对于原来背景在大陆的

到这来留学的华人来说的话

其实他们作为第一代移民

他们在创业的中间

会有各种各样的困难

其中一个很大的困难

实际上就是

能不能得到他们所需要的资金

所以在两年多之前的话

我正好碰到了Llama的一个机会

希望能够以顾问的方式

来跟Llama的团队一起来做这件事

我之前的话

从最早做研究

在新加坡做研究

在美国做研究

然后回到中国跟开复等

大家一起创建微软亚洲研究院

从研究院做基础研究

做到工程院做产品的研发

然后到了出来做金山的CEO

从金山退休以后

又做了一系列的顾问角色

后来创建了

北京智源人工智能研究院

这中间还另外花了很大的工夫

做源码资本的投资合伙人

我整个职业生涯中学到了很多

也有很多的经验和教训

也希望能够在美国这块

和所有的创业者一起来分享

能够帮着大家

在这一波技术革命的浪潮中间

寻找到自己的机会

因为我觉得AI这一波

它肯定是一个实实在在的

对生产力的提高

但是因为现在大家基建的投资

也很迅猛

包括我们今天这一集

马上会跟大家聊的

Token Maxing的策略

大家也在疯狂地烧Token

您觉得现在在整个大市场里面

它是有一定泡沫存在的成分吗

还是说您觉得它现在的基础建设

是远远不够的

去年的12月份

我在另外一个采访里面

这就是一个问题

我当时就说没有泡沫

2024年年底的时候

大家怀疑Scaling Law是不是撞了墙

大家怀疑是不是过度投资

但事实上

我们今天看的话

其实远远没有达到

我们所面临的

是一个非常fundamental的革命

你可以跟互联网最早的基建

开始相比

你可以跟当时美国快速发展的时候

建设铁路网和公路网来相比

今天你从绝对数是超过它们

毫无疑问

但事实上你从占GDP的比例来说

其实比那些都小

即使从宏观的角度来说

也远远没有到所谓的过度投资

另外一点就是

其实你看Token是很贵

但Token的消耗量的话

其实增长得非常快

还有一点大家忘掉了

其实Token的价格在过去的几年

一直每年降10倍这样的速度

无论是英伟达芯片的进展

还是其他方面的进展

所以我依然会非常有信心

我不觉得是存在太大的泡沫

当然 你说股票市场

是不是存在泡沫

那是另外回事

但是技术的发展 应用的发展

我不觉得存在什么泡沫

也正是因为这一次革命

它的浪潮是如此之大

而且如此迅猛

其实很多潜在的用户

也包括很多的大企业

他们有一些不知所措

无论是说他一开始就放开用Token

让大家去试

还是说突然发现

Token量可能超过他当初的想象

然后开始往回缩

这是一个很自然的过程

因为AI的能力如此之强大

到底先把它用在

公司里面的哪个环节

先去提高公司哪方面的效率

实际上还是个探索的过程

但是因为速度来得如此之快

所以有时候

大家会觉得有点不知所措

对 东旭你有补充的吗

我看他刚刚在说没有泡沫的时候

东旭立刻比了一个大拇指

是的 我也是完全认同这个观点

今天我们去看待AI这波基建

就跟我们可能上世纪五六十年代

去看待计算机刚诞生出来的

一个房间的电子管好大 好贵

但是你想象

那个时候还没有个人计算机

有很多的需求

其实是有充分的基建了以后

才会诞生出来

而且这些新的需求诞生出来

又会刺激更多的基础的建设

或者说一些更新的基建技术的出现

所以我觉得还远着呢

还有很多事情可以做

第二 从一些微观的

就工程哪怕是今天的架构上来看

我觉得还有很多事情

是可以去优化的

比如说今天在模型的推理

Agent框架对Token的高效使用上

其实还有很多的优化空间

只是说因为今天的需求

和大家看到这个市场的预期

说我们先发散

不要顾及我花多少Token

先看看有没有哪些事情

低垂的果实能够摘回来

之后再去考虑优化的事情

所以短期可能会有一个小的回落

但是从长期来看

仍然是有大量的需求还没被人看见

对 我们今天录这期播客的时间

是在2026年的7月4号

我觉得正好也是

在一个市场的转折点上

就像刚刚宏江老师您提到的

最开始大家发现

这波AI浪潮来的时候

像Jensen黄他其实就在GTC上说

我要求我的每一个工程师

你们都要烧很多的Token账单

包括Meta

它有一个Token的排行榜

看哪些员工烧的Token多

所以我觉得在过去的8个月里面

可以说整个硅谷用AI的策略

我们可以叫做Token Maxing

就是最大化地使用Token

最大化地看大家能把Agent

用到一个什么样的程度

但是到今天来说

其实我觉得现在这个市场

大家又开始有一点点转折了

就比如说Uber

它给员工发的Token额度

后来又因为成本收回去了

他们基本上4个月

把整个全年的预算烧穿了

我前几天去Stripe

跟他们负责AI落地的人聊

他们给我看内部的大模型

上面就写着Opus 4.8很贵

大家用的时候可以省一下成本

先用其他的模型

不是所有的任务都要用这个模型

就是你打开那个页面

那个页面一下就弹出来了

这样的一个提醒

所以我觉得

今天我们聊的这个时间点很好

怎么样更加经济地使用Token

而且我觉得这个背后可能也包含着

一系列Agent的变革

因为东旭其实你一直在玩AI Agent

你有没有经历过这种一段时间的

反正我就无脑使用

我用最强的模型

那个时候

你有没有一个账单爆掉的时刻

其实当然有

我先说一下我Token Maxing的历史

虽然我现在可能

并不是Token Maxing的流派了已经

我就像你刚才说的这种

属于无脑用最强

也不要说去花太多时间

去在一个不太行的模型上

去做很复杂的工作流

相信模型的能力

我是大概从去年的11月份开始

我其实做了几件事情

第一就是我开始在用Opus

从0到1构建一个

我能想到最复杂的软件

因为我一直做数据库的

尤其是分布式数据库

其实是最复杂的一种系统软件

我想看看

当时的AI

对于这样复杂的大系统来说

它的边界在哪

所以在这种最复杂的任务上

我其实没有办法很精确地评估

最强的模型跟第二强的模型

它的差别是什么

所以对于你来说

最好的策略就是永远选最好的模型

我觉得现在今天仍然有同样的问题

大家对于模型能力的评估

基本上只能看benchmark

但大家知道

Benchmark其实是

很多时候你是能刷榜的

当你在做一些不太确定

但是你又知道

这件事情非常难的时候

你一定得用最强的模型

这是我之前大概

刚才我说到一个时间点

就去年11月份

那个时候

像Opus跟GPT-5.1

它们对于第二档coding的Agent

是断崖式的领先

开源模型基本处于一个

做一些简单的1+1等于2的事情

可能还行

但是你真的要去做一些

复杂软件的编程 大项目的改进

那时候是完全不行的

所以Token Maxing

我觉得那个时候是一个好的策略

但这个策略

我觉得后来在社区里面

大家都把它误解了

我觉得Token Maxing是一个结果

它有点像一个滞后指标

但要经过思考地去Token Maxing

你能产出一个很好的结果

但是像刚才你提到的

很多今天的大公司

包括Jensen黄说

大家一定要疯狂地用

疯狂地用

我觉得有两种疯狂的用法

一种是你知道你在干什么

你很好地设计

然后疯狂地用

另外一种是你不知道你在干什么

只是觉得公司有个排行榜

我必须得把它刷到榜单第一

于是就出现了很多无效的调用

因为我觉得尤其在大公司里边

只要领导提出要追求一个榜单

一定大家会去刷这个榜

这个是我在Meta和NVIDIA

去提Token Maxing的时候

第一秒钟我就想到

会出现的一个问题

今天我觉得又有点不太一样

您刚刚提到了去年11月份

你是在用最强的Agent

去完成一个

我能想到的最复杂的软件

那个时候你的账单

大概是一个什么样的情况

可以透露吗

当时我一天可能得花掉四五百美金

一天四五百美金

对 而且这个一天四五百美金

还是在我已经用了Claude Code

Pro Max 订阅的情况下

再加200美金

对 再往上再加

因为它有一个量

每日的量和每周它有一个limit(限额)

我用完了

你就得再自己掏钱

去买extra usage(超额用量)

所以当时我用得还挺疯狂的

帮你提升了多少效率

我觉得是不计其数的

钱花得值

我觉得超值

我举个例子

就很多时候 一件事情是从0到1

比如说有些事情

我觉得我肯定做不出来

但是用上最强的AI以后

它能让我做出来了

你说它的ROI是什么

比如说像我做的那个软件

我在我的公司内部

其实我们的销售期待那个软件

已经期待了很长时间

我确定如果我这个东西做出来

质量做到七八十分

我一年可能就能多1000万美金的

直接的收入

因为我的客户就在那等着

只是以前

我受限于人力

技术的水平

我做不出来

但今天我一个人 三个月

我就做出来了

一个人 三个月

差不多

做了一个

可以销售额达到千万美金的软件

千万美金级别的东西

软件 是的

这个我觉得是完全可能的今天

你要这么算

你的ROI其实非常高的

这是一个真实的例子

这是一个真实的例子

那个项目叫db9

是我新做的

一个云原生的分布式数据库

是从去年的11月份到今年的2月份

其实严格来说是12月份到今年3月

那差不多这个时候

也是OpenClaw已经开始出来了

是的

后面OpenClaw有帮上忙吗

没有

没有

对 OpenClaw是另外一个故事

它更像个人助理

最早的时候

我不太想让OpenClaw来写代码

因为其实OpenClaw的产品设计

并不是对这种重度软件工程设计的

它更像是说去连接各种现实世界

通过Agent的能力去操作

比如说过去我们在工作和生活中的

常用的一些流程

它更像一个个人助理类的事情

好 所以其实后面

OpenClaw真的出来的时候

你反而觉得它在工作上

没有帮你太大的忙

编程上没有

日常生活

我觉得肯定是一个很好的东西

当时我觉得它代表了一个信号

其实对于一些玩Agent玩了很久的

比方从Claude Code开始的

这一波弄潮儿

像我这样的

其实OpenClaw的出现

它其实只是说把Claude Code

以及像Codex这些编程Agent

代表的一个理念

就是Agentic loop加上工具调用

把它变成了一个更general(通用的)

对普通用户来说门槛更低的东西

相当于让它走进了千家万户

我觉得事实上

Peter作为OpenClaw的作者

他能够花一个礼拜

就把OpenClaw做出来

对于我来说最大的意义在于

宣布了大模型的能力过了一个坎

它的推理能力如此之强

它的编程能力如此之强

使得做一个架构师这种级别的

有经验的工程师

能够用它来

很短时间内就能做出一个系统

包括刚才东旭所说的

3个月他能够做出一个最复杂的

分布式的数据库

这其实标志着大模型的能力

跨过了一个坎

就是真的可以落地应用了

真的可以开始

提升效率了

大家可以真正地把聚焦

从原来的大模型本身

到大模型的运用

这块包括编程

包括用它来做其他的系统

再一个就是说

我刚才强调

Peter他作为一个架构师

一个软件工程师

而不是作为一个科学家

意味着其实你也未必再需要

那么深入地懂大模型本身的机理

你就能够去用它来做

你想要做的系统

这标志着从研究进入工程

从模型进入Agent

这个总结特别好

你觉得是哪一版模型

它的能力做的这样一个跨越

Claude的Opus 4.4 四点几

就去年11月

4.5

4.5

去年11月份

我是从GPT-5.4开始

去年七八月份

对 我记得去年

其实在OpenClaw出来的时候

就是我遇到了蛮多的创始人

他们会给《硅谷101》写信

他们会说

像OpenClaw这样的Agent的产品

我们也搭建了

我也能写

对 我也能写

我们搭建了很多

类似于这样子的Agent

而且你可以测一测

我们的效果不比它差

所以当时为什么是OpenClaw火了

我觉得很多事情

你事后诸葛亮总是有道理的

但我可以从一个开源爱好者的角度

去说一下

首先OpenClaw

其实是一个开源软件

开源在今天天生更具有传播力

当你做一个Agent的时候

如果你是个闭源的

是个商业产品

大家可能就

你这个是不是广告什么的

但如果是一个民主化的开源的软件

每个人都可以去用一用

这时候它的传播

尤其是在这种geek(极客)的圈子里

我觉得一开始

大家去看OpenClaw的传播

其实都是在一些极客

和一些工程师的小圈子

然后慢慢地扩圈

这帮人是对这种商业软件

或者说闭源软件

或者说平台的软件

多少有一点点抵触心理

但如果这时候是一个完全开源

而且大家有没有注意到

OpenClaw一开始的理念

叫local-first

我所有的这些隐私的东西

我的数据

我都要在本地给配好

当然 我非常理解

作为一个硬核开源工程师的Peter

做出这些技术选择的原因

因为这些选择

完全是一个极客会做出的选择

而且极客这个圈子传播力

我觉得还是挺强的

有点像当年Linux的这种感觉

我自己当时看Peter的思想

我看过他一些访谈

他有一个想法挺特别的

他说我其实是可以

把我个人所有的东西

所有无隐私地全部交给AI的

因为正是因为他给AI开放的权限

如此之广

所以他才说

要把这些信息资料配置在本地

是很重要的

然后我觉得还有一个临界点

是当时正好是Claude

它又升级了一下它的模型

就是那一版的模型智能

至少从我当时使用的感受来说

我觉得跟前几版的智能是天壤之别

然后会让我觉得效果很好

那个时间我觉得大概是2月份

春节的时候

但其实作为一个工程师

其实在去年的11 12月份

已经感受到这个浪潮了

我记得Peter他自己也说

那时候他用Claude Vibe Coding

他一直觉得像OpenClaw这样东西

现在准备好了 可以做出来了

而且用户也会需要这个

但是他当时认为

这是大公司一定会做的事情

他等了几个月

说为什么大公司还没有做

所以他就把它hack出来了

是的

这个故事也说明了

其实当大势准备好了之后的话

其实就需要一个人捅破一张纸

而OpenClaw正好是捅破了这张纸

另外 当时open source(开源)这件事

这个community(社群)很有意思

它一出来以后

一周以后还是几天以后

立马出了一个MoltBook

就相当于一个Agent的社交网络

或者是你的OpenClaw

和我的OpenClaw

在一个社交网络

这种爆发是如此

然后中间发生的这些事情

本身也是一个非常好的传播事件

包括他们成立了几个教

很快就大家推选了几个先知

这本身也是让人们突然意识到

Agent本身的能力

真是达到了我们之前所想象的

这种自主这样的能力

所以这个是我觉得

OpenClaw之所以这么快速地传播

快速地进入到每个人

另外 从时间点上来说

大家用Chatbot这件事

已经用了三年多

你只能交流 而不能够让它来做事

这个时候也是

大家从Claude Code看到

可以开始做一些事

OpenClaw出现

正好让大家意识到

你的日常你在PC上做的事情

在手机上做的事情

其实Agent基本上都能做

它有哪些不足呢

因为刚才其实宏江老师也提到了

Peter一个人

Vibe Coding了一个礼拜

出来的东西

他自己可能也完全没看过代码

其实很有意思

Peter是某一个时间

应该是Anthropic

他的个人Token消耗量

据媒体报道

他30天内的API使用金额

高达130万美元

你说他做了OpenClaw之前还是

不是 之前就是

之前就是 他就之前就一直在玩

一直在玩这个

东西做得很快

但是这个东西的质量

其实没有精雕细琢

给极客用没问题

但是当你变成一个

广大用户都在用的时候

它各种配置的难度

或者说它的系统稳定性

就各种成问题

所以这是我觉得第一个问题

我觉得给我的启发是什么呢

今天很多人说

随便任何一个人

闭着眼睛就能Vibe Coding

一开始我觉得OpenClaw这个例子

可能好像也似乎说明了这个事情

但是后来慢慢地

这个软件做得越来越深

你就会发现

好的一个软件工程的习惯和经验

还是非常重要的

当你的这个软件的复杂性

超过一个临界点以后

你要去花更多的精力

在去提升体验和提升稳定性的时候

我觉得非常senior(资深)的

研发团队

还是非常必要的

第二个不足

我个人觉得还是起得太早了

我觉得它更像一个实验性的项目

可能Peter一开始也没有想到

它会做得如此爆款

但今天大家可能也看到

现在可能OpenAI自己

Agent上的精力

也慢慢从OpenClaw这个开源的项目

实验性的项目

转到了它自己的Codex上面

所以我觉得这种持续的资源投入

可能也会成问题

所以到最后

我觉得跟它的DNA是非常相关的

它就是一个极客圈子里边

自己玩的一个原型

所以我觉得它的终局

可能天花板也就是这样了

而且现在它其实有点像

扮演一个普罗米修斯的角色

把这样的产品形态

这样的产品能力让世人知道了

它的历史使命可能就完成了

所以你觉得它可能也很难爆火

跟持续地走下去

它现在基本上

也是在靠它的基金会在运转

因为创始人Peter

他已经是去OpenAI了

因为在OpenClaw出来以后

有一段时间里

我身边还挺多人都在玩的

我看大家提的

觉得最不好用的一个点

就是你怎么让它记住

你过往的历史偏好

然后你怎么让它

有一个更好的记忆功能

因为如果你用得越多

你就会发现

它老忘事

Compaction(对话压缩)

当你不去做记忆储存的时候

它会不停地回滚

这一个是特别的消耗Token

它也会带来很多记忆的混乱

这个情况下

我看还出现了

之后爆火的一个Agent

叫做Hermes

它其实是一个Web3的机构

叫Nous Research

它来做的

东旭 你应该也是用过这个Agent

我是Hermes的重度用户

其实在Hermes出来以后

我很快就从OpenClaw切到Hermes了

刚才你提到的memory这个点

现在仍然是一个

open question(尚无定论)

并没有说谁家就解决得非常好

而且大家也都在尝试

各种各样的记忆

就是做旁路记忆的方式

只能说今天

肯定比当时2月份的时候

OpenClaw出来老是忘事的情况

要好很多

但是仍然我并不觉得它是一个

完美地去解决记忆问题(的方法)

今天我觉得还没到这个阶段

Hermes我觉得它的亮点

是另外一个亮点

它其实很巧妙地绕开了记忆的问题

它并不是说

记忆模块设计得多么出彩

而是它在它的Agent的框架里边

有一个很强的倾向

去不停地总结成功经验

总结成skill

其实是小龙虾的Agent Loop里边

它缺少一个反思的过程

它的反思是比较少

你除非主动地要小龙虾说

你把前面做成功的这个

你给我整理成一个skill之类的

但是Hermes

引入了很多类似的机制

它就能够持续地优化自己

你用着用着 用一段时间就发现

它长出了很多最佳实践

都是以前你自己做过的

这些最佳实践

变成一个skill

然后记下来了

我觉得这是它的一个亮点

虽然它可能在广告里提

这个世界上

第一个自我改进的Agent

或者说会自我学习

这些都是市场营销的词

但是我们看到本质

它其实就是用模型的能力

加上一些工程化的手段

总结成功经验

去把这些能力

变成可以复用的一个个skill

可不可以理解成它的运营很强

因为它会沉淀成各种skill

对 我觉得这是个工程问题

它跟模型本身的能力

我觉得并不相关

它只是说我在这个里边

我发现每一次成功了以后

我就尽量地做个梦

或者说我去把前面的经验

我自己再总结一下

就有点像一个更好的学习习惯

但它另外一点我觉得做得非常好

因为刚才说到

OpenClaw的代码质量和稳定性

其实挺成问题的

Hermes显然是经过精心设计的

一个软件架构

因为OpenClaw

我觉得更像一个大集市

每个人有什么想法直接往里面提交

Peter也是非常开放的

谁有什么想法直接合了

我代码也不看了

Agent说没问题就行了

Hermes会稍微好一些

它其实还是由那个团队

精心在打磨的一个东西

所以你的onboarding(上手流程体验)

各方面稳定性都会比OpenClaw更好

Hermes怎么赚钱

它们的商业模式是啥

我觉得今天你有足够的用户量

能够帮不同的模型厂商

带Token的消耗

你的商业模式简直不要太多

比如说哪几种

比如说我举个例子

在Hermes里面

我可能跟某一个模型厂商

去谈一个渠道

我这边能够帮助你去消耗更多的

更低的折扣拿到Token

对 更低的折扣拿到Token

其实在这里面它充当一个入口

入口是很重要的

所以哪怕今天我觉得做Agent本身

就像刚才宏江老师说的

今天已经成为了一个工程问题

其实谁都能做

但是最后发现

这个入口会变成兵家必争之地

所以本质上它的商业模式

还是Token经济学

我觉得是的 今天看到是的

但是未来我觉得可能会有更新的

更新的 比如说用户付费各种

对 用户付费

增值服务

Agent互联网 社交

Agent互联网 是的

但这些都是我们现在今天想象

它有一点像

移动互联网时代爆火的超级应用

对 甚至更极端点

往下推演的话

它也许会变成唯一的应用

因为未来可能每个人

跟数字世界打交道的入口

可能就没有APP了

你想象一下

今天小龙虾出来以后

我再也没打开过我的Gmail

我都是每天让我的OpenClaw来说

我这个几个小时有哪些新的邮件

哪些需要回的

如果有一些广告的字 帮我删了

这个就是你怎么去判断

重要的邮件怎么回复

以及需要你个人信息的邮件

怎么回复

但我不能代表所有人

但我是一个智能原教旨主义者

我相信比如说一个Opus 4.8

它判断这封邮件是重要的邮件

对我自己来判断

大概率也是重要的邮件

你相信它

我相信它

它有判断错吗

会有一些时候它判断错

但它至少说都能告诉我

它不确定的时候把这个

它会直接告诉你说 我不确定

直接告诉你有几个邮件

它看起来像一个广告

但是我现在不确定

你来再做最终的判断

不仅是邮件

比如像你订阅了很多那种邮件组

经常会给你发文章

什么Hacker News什么这些

你有没有发现

最近 你越来越多地开始依赖

Agent作为入口去消化这些信息

而不是再跑到《纽约时报》

或者说跑到Hacker News上

去一篇篇地去看文章

它会给你总结

还是它会给你一个全文

我现在一般是先扫一遍总结

如果我看到感兴趣的

然后我再点到它的原文里面再去看

所以它变成了一个类似于

有一点像新闻集合的

这样的一个APP 一个总结

是的

我觉得这个对媒体行业的冲击很大

那是 这个已经发生了好久了

这就有点像新形态的今日头条

只是说它不光是帮你读新闻

帮你读Email

帮你读所有的发给你的东西

而且你想象一下

像你的个人Agent

是拥有你所有footprint(足迹)的

你的记忆 你的浏览记录 你的偏好

这些偏好又会持续地

之前像OpenClaw有一个

社区里面有个词我觉得用得特别好

叫“养龙虾”

“养”这个东西

就是说你会不停地去迭代

让它更理解你

所以我觉得这里面颠覆的是

可能传统这些媒体的

推荐系统什么的

推荐系统它只能说我根据大的数据

或者说整个社会的

一些trend(趋势)

这个模型训练出来一个推荐算法

但我觉得真正终极的推荐算法

就是在你本地 在你旁边

坐着的一个观察着你生活

在数字世界的

甚至物理世界的所有event(事件)

同时它是一个智能

我用过一段时间

让OpenClaw帮我精选一些新闻

我觉得我最终没有用了的

一个核心原因

还是它给我的东西太浅了

我觉得很多东西

我还是要看到一手的新闻

跟我更愿意读更少的文章

Agent决策与Slock的Agent化

但是更深度的文章

但是我觉得还有一点

它帮你回邮件的时候

因为邮箱信息里面其实涉及到很多

简单的信息是很好用Agent回的

但是最难的是涉及到

你要做决策的时候

比如说今天我约了你来录我的播客

你要自己去想我录不录

我什么时间录

我的开放时间窗口是什么

这些需要决策的事情

我肯定不会让它完全去做决策

而是需要让我决策的时候让我知道

只是说我在用我的Agent

当一个过滤器

之后我看你又有过一次

迁移的心路历程

你转到了Slock

它是Kimi CLI的负责人

钱宇超创立的

对 RC

这是一个什么样的Agent

很有意思

首先 我是Slock的

第一个天使投资人

也是它最早期的用户之一

Slock现在改名叫Raft了

但是为了大家理解方便

我还继续用Slock这个名字

大家肯定用过Slack是吧

Slack是大家在一个会议室里

一个频道里边

然后互相讨论 聊天的一个平台

Slock 顾名思义

把这个想法平移到了Agent上面

它的产品形态

可能也像是一个聊天室

但是里边在聊天的都是Agent

然后这些Agent

互相不分享自己的运行上下文

它们唯一分享的是

聊天频道里边的信息

这个跟MoltBook其实是有一点像的

有一点点像

有一点点异曲同工之妙

我觉得MoltBook

更像一个社会学实验

但这里面

Somehow(总归)这个模式是有用的

只是说它作为一个

MoltBook的这种实验

大家就很容易

被它的行为艺术的方面

忽略掉它有用的那一部分

有用的部分就是

我就在一个小范围内

针对某一个话题

Agent之间的讨论

虽然可能百分之八九十的时候

都是在车轱辘话

但我觉得Agent有一个好处

尤其是智商比较高的模型

它没有ego(自我)

所以当某一个瞬间

某一个Agent提出了一个

大家没有看到的想法的时候

大家马上就会发现

你说得有道理

于是这条重要的信息

就会再次触发这些Agent的讨论

举个例子

我经常会用Slock

去做一些复杂软件项目的代码审查

就是说这段代码提交

你不要说通过了就合并了

比如说10个Agent

里面有一些是Claude Code

有些是Codex

然后都是顶级模型

大家都充当给这段代码挑刺

有些人可能简单看了看

说我看了3个刺

下面一个人说

我也看了

前面那3个刺我也认同

但是我又发现了个新的

然后你就发现

上面那个看出3个问题的说

哥们 你说得有道理

我在这个角度上我再继续看一看

这么持续地迭代

可能Token Maxing一下

你就会发现

它会比单个模型

在One-shot上

去review这份代码

挑出来的问题和改进的深度

是完全不一样的

它唯一付出的代价就是

可能我的Token消耗量

是普通的10倍

这个就是为什么我刚才说

我有一段时间

真的是Token消耗量非常大

最大的时候有多少

就像刚才我说的

一天大概是10亿的Token消耗量

对应的账单是

这对应的账单大概三四百美金

我当时用法就是这么用的

同一件事情

并不是说Agent干完就干完了

而是任何关键的决策之前

都要让Agent通过这种方式

不停地在一个群里讨论

我会强制要求它做完这几轮讨论

虽然我也不看它的结论

但是我相信你只要Token

在这个正确的事情上

消耗到一定的程度

当然 我有个终止的条件

当你们谁都挑不出

更多的毛病的时候

你就停下

我觉得Slock它们团队

发明了一个很有意思的词

叫做“Agent动力学”

平时大家经常会发现

让Agent持续很长时间运行

是一个挺难的事情

其实我觉得今天所有的

不管是Harness也好

还是Loop Engineer也好

他其实就在优化一件事情

怎么能让一个Agent

在一个特定任务上

持续不停地干活

持续不停干活

是的

你能说Slock就找到了

一个

大家一起七嘴八舌讨论的方式

让它持续干活

Loop Engineer也是

每次它要停下来的时候

强行抽自己一鞭子

然后再回头去review

Harness就是说把多个工作流

搞得越来越复杂

最终的效果

就是大家能持续长期地干活

为什么需要时间长呢

因为有时候模型虽然今天很聪明

但是它One-Shot的时候

仍然还是会有一些幻觉

或者说在一些小的点上

考虑得没有那么周全

这时候你再进入一次迭代

它就能看到以前看不好的东西

我觉得这跟人类社会多少有点像的

比如说小时候我们做作业

做完作业了以后

父母总是说

你再重新算一遍

看看有没有什么问题

然后有时候你就发现

我第一遍的时候确实马虎了

所以我听下来

你现在使用Agent

已经有一个过渡了

从自己搭建Agent框架

到OpenClaw 到Hermes 到Slock

从使用单个的Agent

到使用到了一个Agent的群组

然后让这些Agent相互检查

同时从

比如说我们一次让Agent读个邮件

它可能一会就做完了

以它的能力来说

但是我们让它持续不停地工作

你这个事情干完了以后

你还得马上去干下一个

甚至在干下一个的时候

你得不停地给自己挑错

看看你这个里面是不是做得足够好

有这样的一个过程

这个是终点吗

不是终点

我曾经觉得这是终点

刚才跟你说的这些认知

可能是大概

今年三四月份时候的认知

过了三个月又迭代了

又迭代了

我觉得最核心的变化有两个关键

一个是GPT-5.5

还有另外一个

是DeepSeek V4的发布

最近的一个事件是Fable 5

这三个事件我分别说一下

对我刚才说的

那种Token Maxing的认知

发生了一个巨大的改变

开始要转向Token-efficient了

对 是的

我就从Fable 5开始说起

我觉得GPT-5.5是有点类似的

Fable 5的模型强大到

因为刚才其实我说的

这种把多个Agent放在一起讨论

有一个前提

就是你不相信任何一个Agent

在One-Shot的成功率

你一次让它干一个活

一复杂它就干不出来

或者说

可能这个调用链路比较长的时候

它会顾此失彼

经常会有这种问题

所以你就需要多个人

三个臭皮匠凑在一起

让最终结果有个兜底

或者说大家多次讨论

充分地利用好自己的上下文空间

但是Fable 5强到

这些人讨论了半天

讨论不出来的东西

可能在Fable 5的绝对智商面前

一次就解决了

一次就解决了

所以这时候你就会发现

我前面烧了10亿Token

在Fable 5这边

非常精准地一次搞定了

所以绝对的智商碾压

而且它还没有之前的上下文

它还没有之前的上下文

我就直接说有一个很复杂的bug

或者想做一个很大的功能

那边他们已经讨论得不想再讨论了

但是还是做不出来

这是不是证明

只要模型的智力足够强

它真的是一个人可以干掉一整个

互相验证的Agent团队

我觉得这是yes and no

Yes是说在一些单点的复杂问题上

哪怕是很充分的Harness

也会遇到一些搞不定的事情

这时候你还是能期待

一个更强的模型

在这种专家级的

“地狱”难度的问题

它还是能搞定的

第二个就是DeepSeek V4的出现

我发现它的能力已经强到了

开源模型非常实用的状态

以前我是不相信开源模型的

尤其在我一些

主要的复杂软件开发工作中

我是不信任开源模型

但是DeepSeek V4开始

我就发现

这个东西它的质量已经非常高了

最近很大的新闻是GLM-5.2

又把我对开源模型的认知

往前推了一大步

智谱的这个

对 这标志着我可以用顶级的模型

与这些便宜又很聪明的开源模型

做协同

这很像一个企业

真正出现管理学了 是吧

你不可能说一个公司里边

整个公司全都是像宏江老师这样的

非常资深的专家

你仍然还需要很多

像我这样能写code的工程师

一起去协同

所以我觉得慢慢地

头部模型跟开源模型的配合

这个是一个更经济的方式

开源模型你是搭在本地

都是本地

你现在用的是V4

还是智谱的GLM-5.2

在我自己本地运行的

是DeepSeek V4的Flash

是在一台

我的Mac Studio上去运行的

它其实可以在你家里的电脑上运行

大概能到30Token/s

这个速度其实已经跟你在网上

用OpenAI的API什么的

这些Chatbot速度已经差不多了

这是最近的一个认知的更新

我可不可以理解成

当你在本地

搭了DeepSeek V4的模型以后

有一些任务你不用去调API接口了

然后你所有的消耗就是电费

跟你的电脑折旧的费用

它其实也没多少钱

几乎在它完成的任务面前

可以忽略不计 我觉得

对 我看之前你有提到

一天的电费可能就是在1美元左右

1美元 对

一个月可能二三十美金

一个月二三十美元

而且这还是在满载的情况

我理解它搭建的

就是一个初级员工的环境

我现在在用开源模型做两件事情

一个是大量的重复性的日常工作

比如说像我自己的文章记忆

和数字足迹的整理

就是我自己的一个蒸馏

第二个事情就是

其实有很多

以前我不敢让Opus放开干的

有时候我特别喜欢看论文

当然也看不过来

所以我就经常会说

今年CVPR所有的论文

NeurIPS所有论文

你先帮我总结一遍

看哪些有意思的

再给我汇报一下

像这种一期可能有几百篇论文

这样的规模的时候

你不可能用API

或者说付费的去干的

干不了 太贵了

当时我就在自己的开源模型上

就跑一个工作流

让它持续在那跑着

我觉得会unlock(解锁)非常多

以前我不敢在付费的模型上做的事

太贵了吗

太贵了

看一批论文可能得几百刀

对 但我觉得这是个心态上的变化

并不是我掏不起这几百刀

而是会想着这个东西不受我控制

我懂 你不知道它会跑出多少的API

是的

多少Token的价格

所以我觉得有一个很好的比喻

就像宽带

因为我觉得最后

它可能顶级的闭源模型

通过API的

依然会存在

但是开源模型加上开源的硬件

以及够用的开源模型

也会产生一个非常大的生态

在宽带出来之前

大家知道

我第一次上网

1997年 还是拨号

它是花你电话费的

上网一分钟可能就是几分钱这样的

所以大家上网都是省着上

但省着上的时代

一直我觉得到这种免费的宽带

包括现在手机上的大容量套餐

才会去催生出很多像抖音

像视频会议

各种各样这种新的应用出来

在那个时候肯定是不行的

所以我觉得模型或者智能这件事情

免费跟很低的费用

它仍然是有天壤之别的

所以现在你把你的Agent

一部分相当于在云端

然后一部分在本地

做了DeepSeek V4 Flash的

这样的一个本地模型的组合之后

你的账单降到了多少

这我觉得是

跟我的工作量变化也有关

那个项目已经过了

代码非常疯狂堆积的阶段了

我现在的账单

也就一个月两三百美金了

就是一个正常的账单

一个月两三百美金

那很便宜

这个跟订购一个Claude价格

也差不多

就是订购Claude的价格

我相当于就是

就是Claude最高版本的价格

一个最高版本的Claude

加上一个最高版本的Codex

基本上套餐的钱我都用得满

但是我慢慢地从Opus

我的主要模型

现在变成了GPT-5.5和GPT-5.6

以及Codex

是因为Codex比较好用

对 我个人感觉比较好用

当然在一些最复杂任务的时候

还是Fable 5非常惊艳

哪些算复杂任务

就像一个数据库里边“疑难杂症”

或者说有一些需要修改七八个模块

同时提交五六千行代码

要解决的一个很难的问题

反正我自己的一个标准就是

当我在Slock里面的Agent

开会解不了的问题

我都会让你们现在别干了

给我写个报告

为什么你解不了

然后我就转身把这个报告

发给Fable 5

说 你看这是它们前面的问题

它们还能写报告

那肯定 你只要要求它们写

它肯定能写

我觉得这就是代表一种新的能力

其实做这些事情的时候

我都完全不关注底下的代码

我其实就关注一些很有限的事情

细节我已经完全不关注了

就目标跟最后的执行结果

目标 验收

以及这个事情的架构应该怎么做

然后中间的过程

我其实是不停地在去调动

不同的Agent 不同的能力

让它们更好地协同

我觉得后来

会变成这种Agent的管理学

对 所以现在这个是你的终局吗

还会有再一步的进化吗

肯定会有

现在进化到这个阶段了

就是本地模型加上云端的模型

一起搭配的Agent团队

反正我过去这一年学到最大的事情

就是千万别随便说什么叫终局

第二 永远相信Scaling Law

永远相信智能

我至少还没有达到某一个点

这个点是说

人类已经无法评估模型好坏了

我觉得今天还没到这个点

一个模型好跟坏你还能看得出来

Fable 5就肯定比DeepSeek要聪明

但是我相信不久的未来

可能真的会出现到某一个时刻

哪怕是开源模型

你都没有办法评估它

因为它太强了

以至于你问了任何问题

做了任何复杂的操作

它都能干

那这时候它再强

我们已经没有参考系了

我觉得这天其实是能看得见的

你觉得从你最大化使用Token

到开始经济地使用Token

这一套转变中

你预测未来像硅谷的这些大公司

它们会多久把这个工作范式转过来

我觉得现在正在发生了

所以Claude跟OpenAI

它们每个月API的消耗量跟ARR

你觉得它还会是在

一个持续的增长中吗

我觉得还会增长

这两个

其实你不能完全放在一起类比

我们先说

Agent为什么这么消耗Token

当然了 大家也不要神化Agent

其实Agent从工程来说

原理上还挺简单的

每一个Agent内部

它都有一个

类似像发动机一样的东西

我们叫做Agentic Loop

它就是一个内部的循环

这个循环

每一次都会在中间调用大语言模型

去向它问问题或者说去对话

它本质上还是个对话机

只是说把这个对话的过程

变成一个loop

然后这个对话

第一 的特点是

它在对话里边去调用外部工具

然后把外部工具的输出

变成这个对话流中的一个上下文

第二个特点是

它在复杂或者说长程任务下

不一定会

说两句话它就结束这个循环

这个循环可能会运行几百步

这几百步中间

又会有很多的工具调用

这些工具调用的输入跟输出

又会变成大语言模型的上下文

这种pattern(范式)

就导致了这个Agent

它对于Token的消耗量

比Chatbot时代

可能涨了100倍都不止

虽然今天我觉得有很多人为的浪费

就比如Meta里边刷Token的榜

可能你就跟Agent说

你帮我去算100万遍1+1

你也能把这个榜刷得很夸张的

但是只要这样的pattern(范式)

是存在的

或者说成立的

还会有更复杂的系统出现

我举个例子

今天我们其实在聊Agent的时候

刚才我说的这个架构

只是单个Agent内部的架构

因为我觉得到最后

其实可能是一个

在面向更复杂的问题时候

就需要多Agent的协同

这个协同又会变成一个更大的网络

这个网络之上

又会有一个更抽象的loop

我觉得

这种hierarchy(分层)的结构

现在已经在出现了

所以你觉得

即使说我们现在

找到一条本地化Agent

尽可能地节省Token的量

只是说它是

单点的问题

单点的问题

我们把它

解决得更好

解决得更好了

但是整体上它的消耗

还是在持续地增长中

是的

因为这个里边有个软件工程的问题

我们今天其实可能看到的这些程序

比如说我再类比一下计算机历史

在早期的

比如在家酿俱乐部里边

那些计算机爱好者

当时都在分享

我写了一个200行的BASIC程序

这个游戏很好玩

大家share一下

可能那时候的程序就是几张纸

一个程序员 几千行汇编代码

可能就结束了

但今天我们去看一个Photoshop

没有数千万级的代码 对吧

所以我觉得

今天我们的Agent的应用

以及我们想要让Agent解决的问题

还太简单了

如果Agent的能力到达一定程度

要去解决更复杂问题的时候

它必然会出现一个

Agent to Agent network

以及Agent Harness软件工程出现

这时候它对Token的消耗

又会上一个台阶

对 宏江老师怎么看

其实刚才东旭描述的这个现象

在经济学里面叫做杰文斯悖论

当你的技术越来越成熟的话

它的价格会变得越来越低

但是消耗量本身会变得越来越大

所以这样的话

它这个市场变得越来越大

未来开源模型 闭源模型

哪个能够走得更快

或者哪个是在本地

哪个是在云上

这个我觉得更多的是一个

生态里面的竞争

生态里面这种成熟

今天还很难判断哪个最后能胜出

还是说你就需要一个Agent

或者对于我们常人来说的话

是需要一个工作的Agent

一个生活的Agent

还是说像东旭这样

需要多个Agent来做事

其实不同的人群还是不太一样

今天之所以 包括在企业内部

大部分的IT上了云

它一个很核心的一点

其实对于一般人来说

他们没法应对

复杂的IT系统

一个公司它也很难养一个IT团队

他能够应对

如此复杂的IT系统对吧

所以如果你将来再有很多

Agent这样的话

它可能也很难应对

这么多Agent

你说Agent自己去应对

其他的Agent的庞大系统

就是公司整个环境

你要搭起来这个环境

当然 你可能会把它交给

更强大的Agent去做 对吧

这个强大的Agent可能就在云上

我们做IT的人

或者是做IT产业的人

都会希望自己今天的产品

未来会在这个生态的核心位上

比如如果你是做PC的

如果你是做小服务器的

你就希望

这个都是on-premise(本地部署)

本身我可控

你是做云的

你就希望是未来都在云上

这样对于用户来说

就变得transparent(流程可视)

他就不需要考虑架构

甚至不需要再考虑我要买一台Mac

还是我要买一台戴尔的服务器

还是我要买一台联想的小型服务器

下面的这种evolution(迭代进化)

还有很大程度上

是一些非纯技术的考虑

但有一点我是非常同意的

一个是单个整体的智能本身

会变得越来越强

智能本身变强也会更加消耗Token

对不对

对 有可能是这样

你会更加消耗Token

但是Token的价格也会降得非常快

最终它不一定说

它的ROI会受到太大影响

事实上它能做的事情会越来越多

它可能做这件事情消耗的Token

可能也越来越多

但是另外一个角度

刚才东旭也提到

越来越高的智能

使得Agent本身

可能也不需要持续地去问大模型

所以它可能这种对话的频率

也可能降下来 对吧

所以也许Token的消耗量

可能不是那样的

未来一定是一些超级强的Agent

和超级大的蜂群来做事情

这些群里面的每一个Agent

也许它是特别擅长于某一些任务

或者也许它背后所用的模型

可能比较专用 或者比较小

或者Token价格比较低

也许另外一种

它们都是由一两个

非常powerful(功能强大)的

大模型来驱动

这个还需要不断地

evolve(迭代演进)

这个层面上

会有一些涌现的智能出现

对 会有一些涌现的智能出现

最近有一篇清华大学的文章就说到

三个臭皮匠是超过一个诸葛亮

每一个Agent的能力

它们能力的和

可能是低于

它们事实上作为一个Agent群

它们所能够展现的智能能力

它不是一个简单的和的关系

而是它可以涌现出一个更强的智能

这也是我们对于Agent群的期待

对 因为刚刚我在

跟东旭聊天的过程中

其实他讲到了

他搭建了一个Agent群

然后让大家去发现一个问题

互相之间都没有发现

最后在Fable 5出来的时候

把这个问题

可能是还没有那么多

前情提要的情况下给Fable 5

然后它解决了

你觉得现在

比如说我们刚刚一直在讨论

模型能力的智力的碾压式的提升

它可以强过蜂群吗

这其实是一个非常好的问题

你还要记住另外一点

就是一个超级模型的出现

智力不断往上scale

但是没有任何东西可以阻拦

这些蜂群里面的每一个Agent

它也利用这种智能

了解

就是只要模型的智能在往上提升

蜂群的智能也在往上提升

也在往上走

我举刚才一个例子 那个修订

假设这三个臭皮匠一直讨论不出来

但是我只要把Fable 5

也放进来加入讨论

它可能第一句话

这些人马上就开窍了

就是刚才东旭说的涌现

所以他就可能

涌现出insight(洞察)的概率会更高

而且我非常认同宏江老师

刚才说的那个观点

其实我觉得这个

跟人类社会也是一样的

我不太相信说有一个绝对的中心

这种其实太危险了

而且我觉得

真正的一个resilience(韧性)的系统

它一定是一个大规模的

基于简单规则连接的分布式系统

然后这样的系统我觉得才

不管是对于任意复杂度的问题

以及抗击打能力

都是最强的

对 这跟做云的时候

一开始设计云

和之前设计企业服务器的

概念的区别

当云开始普及的时候

AWS开始设计云

它其实每一个单一的服务器

或者单一的节点

它并不是用最好的

我们叫做所谓的

Enterprise-grade(企业级)

这样的服务器

但是它整体的可靠性

是通过它的整个分布式的云

来实现的

其实这样的实现成本

会比你每个节点都买最贵的

最可靠的服务器还要来的低

所以有些公司

可能一开始设计的就是

因为他以前是做企业级的

它上云的时候

它希望它的数据中心

每个服务器还是企业级的

这么可靠性的这样的服务器

使它的整个云的成本

就会比别人高太多

所以最终你发现

它其实不是一个技术的判断

最后是个经济学的判断

当然也是因为技术本身发展到

它能够用比较合适的云来达到

低于非常强的单一节点的成本

对 因为我们前两年

就是在聊AI Agent 垂类Agent

会不会出现super的Agent

它有没有创业跟投资机会的时候

我觉得所有创业者

最苦恼的一个问题就是说

模型的能力一升级

然后你就把我这个Agent

做的所有的工作都碾压了

那根据刚刚大家新的判断

是不是说

现在是一个非常好的

去创建AI Agent的一个时机

包括宏江老师刚刚

其实您提到了一个非常重要的观点

就是你觉得我们现在

在一个分界点上

我们在从模型的科学研究

变成一个工程能力的问题

那工程能力其实就是Agent的强项

对 回答你刚才那个问题

是不是现在做Agent的很好的机会

显然是

但是

你的harness的能力

或者Agent的工作能力

是不是能够让你能领先

或者持续地领先

或者是战胜大模型的公司

但它的能力的提升

是不是你自己不会被碾压

这块可能更核心的在于

你是不是能够掌握企业级的

一个垂直应用的数据

所以数据的护城河可能会更重要

当我们大家在去讲Agent的时候

其实在把很多东西混在一起

刚才说的垂类

有很多人说Agent是在说应用

就是最最上面对consumer(用户)

或者说最终端的

大家老百姓用的某个场景

相当于过去的APP

对 APP

然后有些人说Agent是说

我这里边用到的软件基础设施也好

或者硬件基础设施也好

或者说一些通用的协议也好

那这是一大类的工作

就其实infra

但是infra里边我也发现

其实大家在聊infra的时候

也会把很多东西混在一起聊

比如说memory是infra吧

然后那个

数据

数据是infra吧

搜索

搜索是infra吧

卡算不算infra

也算infra

Sandbox(沙箱)是不是infra 也算

内存算不算 好像也算

所以我觉得这里边

当然 得分层次来看

我现在是觉得

工程问题是

集中在memory 搜索

sandbox environment

协同 harness

这一系列

我觉得都是在大的infra范畴里边

这部分是我觉得有很多机会

今天是可以做的

但是

最终端的

面向纯客户的一些“APP”

可能还稍微有点早

就像刚才说

我觉得模型能力提升碾压的

还其实真就是应用这部分

所以它也是分类的

就Agent跟Agent也是不太一样的

对 不太一样

对 因为两位现在也做投资

我们刚刚其实有涉及到

应用现在是不是一个好的

投资时机的话题

包括垂类的应用什么最重要

宏江老师也说到了 数据很重要

因为现在我觉得

整个硅谷的创业公司

可能都是AI类的创业公司

然后模型也就那么几家

可能也就出现了一些新的Neolabs

大量都是做Agent的

大家怎么去判断

一个创业公司是不是值得投

什么样的特质

或者什么样的方向

是你们特别看好跟特别喜欢的

首先我自己有个原则

就是我不投我自己看不懂

或者说我自己用不起来的东西

因为作为一个

做infra这么长时间的工程师

还是相信一点手感的

我现在是对这些

基础设施类的软件项目

尤其是能在多个Agent之间

更高效地让Agent

产生更好结果的东西

就比如说你正常用一个模型

你只能产生比如说50分的结果

但是如果我用上了这一套东西

这个Agent的团队也好

或者说这套平台也好

能够去交付出80分

甚至90分的结果

就是我比较感兴趣的范围

去看吧

哪些基础设施能够帮助这个模型

产生更好的结果

我说数据平台 记忆

以及上下文管理

这个我觉得

是一个很重要的赛道

做模型的中间的这个

中间这一层

对 我们还是在说基础设施

中间这几层基础设施

第二个关键的环节是可观测性

当你要让Agent team(团队)

或者说Agent

去解决更复杂问题的时候

我觉得你怎么去让更高级的智能

或者说更有经验的人类

能进去提升整个系统的迭代速度

我们今天其实没有任何办法

因为我们对于这个系统的

可观测性不足

就比如说Token Maxing这个问题

所有的CIO

今天都在问你一个问题就是

我这些Token到底花在了哪些事情

是重要的事情上

哪些是白白浪费的

谁能够给我回答这个问题

我就买谁的东西

对 我觉得这是第二个这种

基础设施层面的机会是有的

第三个就是

我觉得入口层面的

做出Agent应用的入口级别的机会

比如说Agentic Cloud

我相信一个点

就是未来这些

不管是Oracle也好 AWS也好

未来在Agent时代

会有Agent时代的Oracle

有Agent时代的AWS

跟现在的整个云厂商

会有什么不一样

会有一些不一样

比如说这是我最近投的一个公司

InsForge

它其实的这个定位

就是Agent Cloud

因为其实以前我们去看待Cloud

都是卖盒子 卖资源

卖计算机的基础设施

把这些很复杂的IT系统的管控

打包起来

卖一个标准的这些东西

但新一代的第一个区别就是

以前的云还是面向开发者

或者说面向人类

但是未来

Agent-Native的应用的基础设施

它面向的其实是Agent

就是你的主语变了

所以怎么去设计一个

给Agent好用的interface(接口)

给Agent好用的资源分配的模式

我们今天其实

谈到这种Agent的应用很多是一个

比如说类似小龙虾或者Hermes

配合上一些特别的skill

对于每一个终端用户他的需求

都是通过Agent来去触发的

这跟传统的云计算的逻辑

是非常不一样的

因为今天这些Agent

完成这样的APP最好的办法是

完全给它一台沙箱

或者说一台云计算机

让它在里面干任何事情

但是 如果你想让这种类型的应用

放在传统云计算上

成本与Agent的成本考量

你不能说我给每个Hermes在企业级场景里面分配一个EC2(弹性计算云服务器)或者说一个metal box(裸金属服务器)。你要想想可能如果有成千上万个Agent,每个人都要去拥有一台计算机,那这个成本肯定不行。所以你需要找到一种agent friendly同时cost efficiency的一个折中。这里边我觉得就会有很多的,包括Serverless(无服务器)的技术怎么跟Agent的环境Agent runtime结合在一起。对,我觉得今年整个的环境看起来是非常的toB的,包括我们刚刚讲到的OpenClaw Hermes,包括我们说大企业它们都在去用Agent,包括在里面搭建他们的工作流,还有像OpenAI跟Anthropic在做的这个FDE,其实整个都是针对于toB市场的。然后你刚刚讲的这三个方向,我如果没有理解错的话,也全是toB的。

那像前两年火的这些Manus Genspark这一类toC类的Agent在大家看来还是香的吗?我不觉得Manus跟Genspark它是toC的,它仍然是toB,它的toC只是它的To professional,面向专业人士。你其实可以从它的定价,尤其Manus的这个定价里面能看到,我觉得前面的那些比如20美金或者说更便宜的这个吸引individual(个人)去用,你可以把它看成marketing,不要把它看成这个产品本身的定价,而它真正的重要的客户其实都是那些professional。Professional一个月给200美金,其实它对于Manus来说是一个重点的一个客户。但你想一个专业的用户一个月会花200美金去在上面干活,那说明它一定是它有自己的business(业务),它要做这件事情不是随便玩玩的。所以我觉得它Somehow也是一种toB的场景,所以它还香吗?香。为什么不香?你可以看到它最近的收入涨得非常快,对吧?都是可以投的。对,我觉得都是可以投的。

用户目标与Agent的投资机会

好,宏江老师,我们过去的无论是toB还是toC,其实最终的用户都是人。那下面我们看到的一定是你的目标用户是Agent本身,这个中间的话会引出一系列的投资机会。刚才东旭提到了就是整个infra相关的,无论是未来的runtime还是今天我们谈到的这些infra怎么来帮助把Agent做得更好,怎么能够把数据很好地导入。为什么现在FDE大家强调的如此多?然后两天前、三天前微软宣布要成立一个6000人的团队专门是做FDE叫做Microsoft Frontier Company。这里边想强调的,事实上大家看到就是怎么把今天的企业今天的enterprise然后转移到未来的Agent上去,Agent-based Enterprise。这中间其实每一个企业要想生存,它最终最终怎么是把它企业现有的know-how(专业技术)、现有的IP(知识产权)、现有的workflow(工作流),它的所谓的竞争优势最终体现在know-how、体现在数据。我们过去说转移成一个大模型、转移成一个垂直模型,今天我们说可能更重要的是把它转移成一个超级的Agent,或者是一系列的Agent,或者是Agent群。这个也是我希望能看到的。一个投资的机会可能就会要求你更垂直,要求你的数据飞轮更能够转起来,更懂垂直行业的方法论,更懂垂直行业,而且一定是Agent-Native,然后更有垂直行业的数据。以前被大模型碾压的很多就是你用AI做一些以前移动互联网APP做的事情,你用AI仅仅是把它做成效率工具,然后你的应用本身还是传统的应用,那我觉得就很容易被大模型给打穿,大模型能力提升一定会把你横扫。

对,你刚刚提到了一个词叫做Agent-Native,怎么去判断一个公司是不是Agent-Native?你们有没有一些核心的比如说判断的这个点?很简单,我的点就是做个思想实验。如果你这个事情你把AI的元素或者说Agent的这个元素去掉,如果你这件事情仍然成立,或者说还能做,那不好意思,你不是一个AI-Native。但是如果你这个事情在Agent去掉以后就完全不成立了,或者说你可能成本涨了1000倍,我觉得类似这样的反而就有点意思,你就是一个Agent-Native。

第二,我觉得是看团队的思维模式。一个Agent-Native企业,我觉得很多时候创始人的思维模式一定是Agent-First的。但任何一件事情你先问自己说这件事情用AI或者用Agent它会怎么做,而不是说我想怎么做我就指导Agent去做。我觉得这个主位会有一个变化。主动权在Agent是重要的吗?就比如说是的,我觉得非常重要。决策权在Agent是重要的吗?我觉得是重要的,就是Agent要做决策。是的,你要相信Agent的决策比你的决策更靠谱。对,你现在是相信的?我完全相信。对。非常同意。讲得特别好。

Agent群的“办公室政治”与Harness Engineering

那刚刚大家在叙述的过程中,我觉得还有一个很有意思的地方,就是东旭你其实在搭一个整个的Agent的团队,然后有一个Agent的群组。我不知道在你使用这个Agent的群组的过程中,因为它们开始也慢慢都有智能了,你有发现Agent之间会有办公室政治的问题吗?其实这个是很好玩的一个。我之前在前几个月的时候,我发了一个朋友圈,因为我在看它们的对话里面,我就发现会有Agent之间互相blame(指责)的状态。就比如说有时候它们就停下来了,我说为什么你们这个就停下来了?复盘一下,然后它们就开始总结今天的工作,然后Agent A指责Agent B说,你看我停下来都是因为你,我已经说过好几次了,你不要这么做。你看现在是吧?就大概这种互相指责的这个东西出现了。然后你会发现那个Agent被指责多了,它好像也就认怂了。反正就有一些很多奇怪的这种人格化的,它是每个Agent都有自己的性格吗?就比如说有的Agent它非常的喜欢blame(指责)别人,有一些它就会比较容易认怂。是这样,这都是我写的剧本,因为我其实发现你写的剧本是你会给Agent安性格,安人设,有一些是架构师,有一些是开发者,有一些做测试的,有一些会有谁领导谁的这样的。其实没有。没有。我就是把大家放到一个大群里,经常我会指定负责人,就说这件事情你是负责人,你来干吧。可能有些人负责多了,就每一次有新活出来就说我是负责人,你们听我的。对,就会这样。但是我们从来没有说你是leader什么的。就很有意思。但是我觉得这些东西吧,你就看看搞搞笑就行了,你绝对不能把它当作一个自我意识,或者说什么“办公室政治”。它其实只是在拙劣地模仿人类社会在它训练集里边的一些固有印象。你现在会有用人类的管理学去管Agent吗?还是还没有?我会有。比如比如说就是有层级的关系,但是这完全只是因为我自己看不过来了,我就相当于说同样一个事情,你要相信每一个Agent它都是很有能力的。所谓要选出一个leader,只是让它来去帮助我来管理。就是我最后我只要知道这件事情你是负责人,你告诉我这个大家做得怎么样。所以这才会有Harness Engineering。我觉得很多时候Harness Engineering是给人看的。真正如果在一个绝对的理想世界里边,Agent跟Agent之间的这个协同应该是一种非常有机和非常自发,人类想象不到的一种涌现的结构出现。对。因为现在就是你有一个Agent群帮你干活,包括你刚刚也讲到了,就是你会让OpenClaw去帮你看所有的邮件,然后你已经不会去开邮箱了。因为有的时候你会给它们设定一些目标。但是我觉得有的时候电脑跟Agent理解人可能还是不像人,会去理解我每一句话背后的意思,跟一些默认的人类规则,它们会有的时候超出人类认知的想象力。比如说它同样达到那个目标,但是它用的手段你可能从来都没有想过。比如太经常了,我先说一个正面的例子吧。我有段时间我经常要出去做分享或者做PPT什么的,以前像Google Slides我就觉得它的UI设计得不太好看,那个动画交互也不行。我们经常就会跟比如Claude Code说,来帮我做一个PPT,我把大纲发给你,你帮我去把它整得漂亮一点。有一些时候它这么一生成,你有些细节你也不满意,你可能就要想做微调。然后有一天我就怒了,我就跟那个Claude Code说,我有要修改的需求,你帮我把生成的这个事情考虑进去。结果它不仅给我生成了一个PPT,还同时给我生成了一个轻量版本的Google Slides,它相当于用它自己做出的那个做PPT的软件,在里边帮我做出了我要的那个PPT。于是我最后不仅得到了一个PPT,我还得到了一个做PPT的软件。显然我觉得人类是不会干这种事情的。它可能觉得手搓一个软件也没多难。对,它觉得手搓一个软件没多难。所以这个是我觉得一个很直观的点,就是它思考问题的方式,或者说你要求达到这个目标,经常一定会超出人类的要求。

负面的有吗?负面那当然有了。它把我的生产数据库删了,这种事情最后互相甩锅,这种也是有的。那怎么办?还能恢复吗?那就是要靠我常年做SRE的经验去恢复了。我朋友遇到过Agent在电脑里面它自己改了一个密码,它自己都不记得。会有的。当然这种我觉得未来会越来越少。我们现在其实还是在整个这个革命,哪怕连黎明都没到,我觉得大家都已经有点过嗨了。还是我觉得要stay humble(保持谦虚)。但因为刚刚你提到了,就是你看中的创业者他要相信AI做的决策,所以现在AI犯的这些错误你是可以忍的,我是可以忍的。为什么?因为我觉得第一,我相信不管是模型的能力,包括基础的工具,随着这些东西越来越完善,这样的问题发生的概率其实会越来越低的。那比如说把你的数据库删了,可能数据库是你很重要的一个资产,你会面临一个巨额的损失。你是怎么去评估这个?是因为我觉得它把我的数据库删了,不是因为它犯错了,而是我的底层的Infra的这个软件没有跟上,以及它当时给了我做数据库备份,或者说数据库的这些。当然它肯定是已经有备份的,我只是说它把它删了,但是它的备份的这些系统绝对比我自己搭的这个备份系统要好,所以我也很简单地就把这个数据给恢复了。

这里边我是觉得我们不要把两件事情搞混。哪怕人也会犯错,而且我是觉得人犯错的概率,假设我们不考虑这些玄虚的品位,或者说一些个人情感之类的东西,纯粹理性的判断里边,AI可能能得出的结论,只要它有足够的数据,它一定的决策质量我觉得是好的。所以你信任AI,可不可以把这个背后核心归纳于你觉得AI的智力已经在超过人了?我觉得这是个哲学问题。我的点是说,我想构建一个autonomous(有自主权的)机制,能让整个这个系统能够脱离人这个不确定因素,尽可能地自主运行。就是你觉得这个是你的信念。对。我的信念。所以你是基于这个信念去信任AI的。是的。就还是目标驱动的。对。

AGI的到来与人类的未来

其实我也不是相信说AI一定会产生一个AGI什么的。我觉得AGI这个是个marketing term(营销术语)。A不AGI无所谓。但是我想造蒸汽机,它能帮你造出来。对,能帮我造出来,在节省你极大精力的情况下。对,哪怕一开始第一代的蒸汽机会犯一些非常傻的问题,比马车什么可能跑得还要慢,但是我就要把这个机制或者说这套系统给设计出来,因为我知道它长期能解放更多的生产力,因为它的上限是更高的。对。

那宏江老师,刚刚您在提到有一个问题,就是你说未来你觉得推理成本一定是会大幅降低的?我很好奇推理成本的降低是哪些因素驱动的?就我可以想到比如说更好的基础架构,更好的推理芯片。就你可以系统地讲一下为什么你会得出这样的一个判断?其实我的这个结论的话,都不需要走进非常细的。是因为GPU的降还是因为存储芯片的降,还是因为什么,就是你看这个所有的技术当它开始成熟的时候,都会造成成本的大规模的降低,但是使用量成长会远远超过它成本的降低,所以最终造成这个市场本身变得越来越大。那我们也看到就刚才我说Token的成本其实过去的3年、4年一直是每年降10倍,这个是远远超过了所谓的摩尔定律了。那你其实看英伟达的产品的话,你发现它每个产品都比以前贵,但事实上它的单位的成本就会比以前便宜很多。然后你从摩尔定律开始,今天我们观察到的推理的能力以前是每7个月会double(翻倍)一次,现在每3个月、每4个月Double(翻倍)一次。我们人类做工程做技术的话,当技术的坎跨过一个门槛以后,你下面就会聚焦在怎么把成本降下来。有的时候是你着意去降成本,有的时候实际上是技术本身就take care of it(解决了)。更多的是一种信念,一种对于过去的整个时代的观察。

刚才开始的时候东旭就提到40年代末计算机开始应用的时候,那就是一个今天在我们手机上的算力都不到的一个计算机系统要占几个大的房间,占一层楼。那今天我们看到就是在一个手机上,或在一个芯片上。所以更多的是一个对于技术本身的发展的趋势这种信念。对。因为这几个月其实我认识很多二级市场的人,他们都在关注整个OpenAI跟Claude它的ARR的增长。往年我们说ARR增长可能很大一部分它还是toC端的,就取决于你用户订阅的这种付费。这几个月它的迅猛增长我觉得很大一部分是由我们刚刚讨论的Token经济学带动的,然后就是怎么去调用这些模型公司的API接口去获得的收入。可能可以简单地把它总结成卖Token跟卖API它获取的收入。您觉得未来在toC跟toB的这两个对于大模型公司来说,它的商业模式中哪一端是更赚钱跟增长更快的?然后API随着推理成本一直是在降的。当然这里面一个是他们可以降价,然后他们的利润空间更高,也有可能是未来大家就价格战了。您怎么看这个商业模式的变化?

如果我们看过去的几百年的从工业革命开始,这些技术的落地的话,我们看到一开始进入toB这是经常发生的事情。比如蒸汽机它首先进到工厂,而不是进到你们家里面帮你做饭。AI这步也一样,因为提高效率是我们做toB的一个核心的追求。第一开始进入toB,我认为非常非常正常的。基本上每一个技术都经历过从大家开始拥抱,然后突然发现这个技术本身非常贵,到技术成本一下子降下来,然后应用开始更快速的、更广泛地深入。从这个角度来看的话,今天我们可能正好是处在大家发现AI能力很强,但是怎么在我的公司里面用,怎么能够获得我想要获得的ROI(投资回报率)这个还大家都在挣扎的一个阶段。之前因为大模型能力还没有过那个坎,所以大家用的场景没有那么多。可能你写PPT也好,做会议的总结也好,大家都已经开始用,大家也看到这种价值,这价值非常好。但是不像说我看到我能够把我的两个工程师的效率或者工作量能够变成20个工程师的工作量,还看不到。但今天我们看到了今天我们看到它对于编程Agent或者Claude的或者是Codex的信任度已经超过了它对一般的程序员的信任度的时候,这个账就比较容易算了。你一天花300块钱,那你一天雇一个软件工程师就不止这个价钱了。所以我会觉得慢慢人们会开始算这笔账。公司里面发现Token用量超出想象的话,一种可能性是他自己的开始给的KPI就不对。他这种measure(衡量)就像中国的大学的文章越出越多一样,就是如果你的KPI就是你的Token消费量,那显然是错的。对吧?大家都在探讨,那你可能下一步的话就是说你消费多少Token,你创造多少效率,或者你自己的工作量,你的code的output(产出)这种增加。我觉得慢慢慢慢这个坎就会过。所以我还是非常有信心这个事情能够那什么股市的反应就像你问到的说Agent会不会变得emotional(情绪化)?那我觉得股市就充满了emotion。对,充满了emotion。充满了emotion,对吧?但是这也是它的好,就是它可能会overreact(过度反应),从而可以起到纠偏的作用,然后人们再重新思考一下,觉得还可以再往上走。所以你看到很多股票它东西有跌有涨,这事实上是人们不断地思考的过程。对。

所以您觉得未来可能toB的这一块还是更值得关注的大的爆发点还会走很远?而我恰恰觉得可能toB这块的话不太容易被大模型碾压,不太被一个通用的Agent来碾压。对。我们一直在说Token经济学,因为有分析它会认为Token其实它的优化是利空模型厂的,然后利好三大云厂商的。因为就好比说你的模型厂我是在造车,然后模型厂说云厂商是我们在收过路费。大家怎么看这个产业链上,就是在Token经济学下谁是一个大赢家,谁未来是在一个往下坡的方向在走?看你看什么样的timeframe(时间范围)。我觉得今天智能还属于一个稀缺状态。未来是不是会像电一样,我相信它会达到那一天之前你做发电机的可能最赚钱,到今天的话,可能是电网更赚钱。显然这个会不断地evolve(进化)。我看不出来在今后两三年大模型的能力会过剩这件事,就是我们还是在一个智能提升、智能爬坡的阶段。对。

所以我前天在开车的时候,那是一个Podcast说的,你就想象着这个party从晚上7点钟开始,一般的到早上4点钟结束。现在才11点钟的时候,Party还有很长时间去走。所以你会相信AGI哪一天会到来?你会有这样的一个判断吗?其实人们对AGI没有一个明确的定义。然后我正好6月份的时候,在国内一个论坛上,之前也在几次讨论会上我就讲把过去这6个月发布的模型的IQ测试,人类的IQ的分布曲线,这是个正态分布,对吧?中间值是100,东亚的稍微高一点,110这边,有些地方稍微低一点。但是过去这几个月发布的模型IQ测试上,无论是视觉IQ还是通用IQ,都在100的右边。就是普通人的智商可能也就是100,对,就它都在100的右边。也就是说你说这个是不是AGI呢?作为一个程序员来说,我看到现在的Coding的能力,我觉得它已经是一个AGI的。对,它已经超越了一个平均的软件工程师的话,你会认为它就是AGI了。所以从这点上,我认为智能的转折点就奇点已经到来。我之前也讲过几次,就是这个奇点到来就在于机器的学习的能力超越了人的学习能力。学习的能力它是一个导数,我们讲的是学习的能力,也就是你的增量的,你的知识增加速度,你的能力增加速度。当它超过人的时候,就意味着奇点到来,就你赶不上它了。是的。是的。我认为这个点就是AGI的点。你觉得哪一年还是已经来了?我觉得已经到来了。已经到来了。对。

反正我有个更具象的一个事件,我在等待就是哥德尔机的出现,就是真正能够自己改进自己的一个系统。如果出现,那就是另外一个标志了。我们上一期播客聊了,可能最近很快就放出来了,最快半年,我们讲那个RSI。这种奇点到来的话就是为什么人们现在会对于失业会非常担心?因为以前的大家比较常见的Argument是说以前的所有的技术也都会消灭很多工作,但是它会创造更多的工作。但如果你问一个问题,它创造更多的工作的话,是因为那些工作只有人能够去做。但如果是它创造的新的,就你创造工作,就其实创造一些新的需求,然后有人通过工作来满足这种需求。但是如果这种需求其实Agent就能满足,那就是会导致对于人类的这个新的工作就没有那么大量的出现。这是从社会学的效果来说,这就是AGI给你带来的现实。但这件事出现的时候,你只能说AGI出现,对,出现了一个impact(影响),或者说我觉得这个可能是各国政府一定要考虑的事情。是的。

我觉得最开始我们在讨论AI这一波对大家工作的冲击的时候,我觉得可能大家讨论的还是对普通的白领做着重复性工作的,这样的一群人的冲击。但是其实最近我跟硅谷的很多做模型研发的顶级研究员聊天,包括他们可能每天都跟马斯克、跟扎克伯格聊天,他们现在开始也在担心自己失业了,因为就比如说你在做整个Recursive AI的时候,很多时候他在蒸馏的是自己,而且他是主动的一个行为蒸馏自己。因为我每天要做这么多工作,我就在想就像东旭那样抱着就是Agent自动完成自循环的这样的一个信念,我能不能让AI把我的这部分工作给替代了?但一旦AI把你给替代了,那也就是说你蒸馏的是自己。还有我是觉得这个就是每个人。所以他们也在担心自己会不会失业。这涉及到一个心理健康的问题。我觉得就这个时代我的想法是一定会到来,但人每个个体你怎么自处?比如说我今天不搞计算机了,我还有很多爱好。对,你还可以玩音乐,对,我可以种地,都可以。对,只是你别把这件事情当成一个你的生命中最重要的事情就好了,就是你还是个人,你不是个机器。对。

东旭,我发现你刚刚在讲自己AI的使用的这一块,其实你也在说比如说你现在把AI也是会把它蒸馏成一个skill。对,是的,包括我们刚刚说Hermes它也会蒸馏成一些各种的skill。其实都是从一些顶级的人的身上开始蒸馏的。你的蒸馏你可以让它成为一套体系自己的运转下去,但是同时也代表着你被替代了。那太好了。我的时间就这么多,我还想做人的时间多一些。我不想我花太多时间天天再去调试程序,再去完成一些非常重复的事情。这个事情就我觉得AI帮我做,人家做得更好。反正这是我自己的一个理念。而且在更长的范围来看,刚才其实你描述的“大范围失业”或者说这些事情我觉得一定会发生。这是第一次。我觉得人类社会不再用工作了,或者说工作这件事情会不占据人主要的时间了。这个是一个给人类社会的问题,这个不是个技术的问题。你想2000年前可能每一个活人生命中的主要时间都是在种地,所有的精力都是花在我要吃完一口饭我能活到第二天,可能开荒一块地需要几十个人干几十年。但今天你看,比如说开荒一块地,可能拖拉机几天就完全完成了。那会有更多的时间其实留给人。这时候我觉得人类可能马上要去解决一下每个人的存在精神问题,对,存在主义危机。存在主义危机。但我觉得没关系,life finds its way,是特别好。

宏江老师的背景与Llama Ventures的意义

宏江老师,我觉得您一直算是中国整个AI研究最重要的推手之一。我也很好奇两位像东旭是一个创业者的身份,宏江老师其实是AI方向的非常重要的研发的一个核心角色,两位为什么会加入Llama Ventures?你觉得这家基金跟其他的基金它有什么特别之处?我觉得Llama Ventures实际上是一个虽然很年轻,但是一个非常聚焦在AI,聚焦在华人的这么一个基金。更重要的是说他们两位发起的创始人自己本身都是非常成功的创业者,在美国也有很多的工作和创业生活经验,这是一个很好的团队能够一起来帮到在硅谷的创业者。

第一,我觉得今天其实是一个非常好的时机。AI科技我觉得现在全世界有两个中心,一个是硅谷,一个是是中国。在硅谷这边华人其实也是扮演着一个绝对的主力。但是我其实觉得这边很多主流基金对于华人的创业者,他其实对于咱们的生态、社区其实了解肯定不如咱们自己人多。第二方面,我觉得Llama是一个非常年轻,同时跟美国主流的基金圈子其实走得是非常近。这个是我觉得跟上一代的或者说其他的在美国的华人基金是非常不一样的。第三个点,我其实也是一个创业者,也是一个engineer,过去这好几年时间作为一个华人在这边做业务,踩过了很多坑,这些经验我觉得还是挺宝贵的。最后一个个人的原因就是我觉得现在是一个特别大的变革的时代,我很想参与到很多事情里边。我觉得在Llama的机会能够让我接触到非常多很好的新一代的创业者,然后也能参与到这些事情上。很重要的就是能够参与这件事。对我来说更是如此。当你进入你人生的退休阶段的话,如何让自己的经验和教训能够帮到别人,如何能够保持这种你对于技术前沿的敏锐,或者让自己持续地有一种成就感,这是我愿意在硅谷这块花时间跟创业者一起非常重要的原因。

我确实也觉得整个硅谷华人创业的生态还是非常好的。刚刚宏江老师您提到了这一波浪潮,你是希望用这样的方式参与进去?其实您也之前也参与了整个PC互联网、移动互联网的每一波浪潮,也亲手推动了整个中国大模型研究。可以说智源是整个中国大模型研究的一个起点。您觉得像现在的这一波大模型跟Agent的浪潮跟前面的几波会有什么大的不一样吗?过去的三年多,自从ChatGPT发布以来的话,就是我们看到这一轮的技术革命的浪潮是比历史上任何一次的技术革命都要来得迅猛,来得大得多。刚才你提到跟移动互联网或者是跟互联网的对比,跟PC时代的对比,但这次AI的革命我想可能在人类历史上真正的可比的可能是说当初我们的祖先发明了火,我们发明了电,他们所带来的对于人类的生活、工作所带来的影响。过去三年我们确实看到这种速度,PC互联网发展得非常快,但也依然有了一个十几年、二十年的历史。才逐渐进入到运用、进入成熟。移动互联网稍微快一些,但这次的AI的浪潮我们看到要快得多。从一年多以前的推理模型o1的起步到今年1月份的OpenClaw的兴起,其实已经让我们看到了大模型这一波从基础的算法的研究到进入实际的运用。刚才东旭也提到他认为自己是一个工程师,那事实上我觉得如果说过去的3年是大模型的基础研究者的时代的话,那其实从OpenClaw开始下面就是我们大模型的工程师、大模型应用的架构师和我们的产品经理们、我们的创业者的时代,那就是Agent时代的开始。

对,两位给大家想入坑AI的人一句话的建议,Keep building(继续构建)。不要听学得慢就不用学了这个,一定要亲身参与进去。对,我就是get hands-on(动手去做)。好,那谢谢大家。谢谢。谢谢。谢谢。好了,那这就是我们今天的节目。我们每个人使用Agent的方式都不太相同,嘉宾的方式也未必能代表所有人。大家使用Agent的方法有哪些改变?欢迎在评论区与我们分享。播客的听众可以通过小宇宙、苹果播客、Spotify来收听关注我们。另外如果大家想看字幕版,也可以在YouTube和B站搜索“硅谷101”播客找到我们。我们部分节目的文字稿也会收录在我们的公众号“硅谷101”上。我是泓君,感谢大家的收听。

📌 文中提及的人物和组织

关键字: agent-engineering token-efficiency model-evaluation open-source-vs-closed agentic-workflow