设备调试与直播开场
等一下,现在直播是公开状态(public)。怎么又开始自动翻译了,我来设置一下,把 live chat translation 关掉。
我现在这个蓝牙耳机没有意义了,因为我根本没在手机上操作。刚才直播里有一点噪音,我知道为什么有噪音,因为旁边有个风扇在吹着我的 Mac mini。把后面的风扇关掉之后,现在声音好点了吗?还有电音吗?
我戴个耳机试一下。这个设备上面没有耳机孔。刚才画面卡顿是因为我切出去想换蓝牙耳机,结果卡住了,所以直播时不能随便切出去,现在不卡了。
我们书接上文。因为我把我的 M5 MacBook Pro 当作“献祭”,专门跑我的 Harness 系统了,所以现在用 M1;但 M1 不太行,我就换到手机,手机又要拿来给你们展示显摆,最后只能换到了 iPad 上。不过没关系,我们设备特别多,而且这样还可以跟大家好好互动。互动一下之后,我们就正式进入今天的话题。
什么是 AI Harness 以及与普通 Chatbot 的区别
今天我们聊的不是什么新手机 S25,我们要聊的是在 AGI 时代来临之前,为什么我确信我现在折腾的这一切是非常非常有益的。
我现在折腾的是什么呢?我自己做了一个 Harness。很多人不知道什么是 Harness,知道的人少,不知道的人多,那我来给大家念叨念叨什么是 Harness。我们来开第二个互动,一边打字做 ASMR typing,一边跟你们讲。
什么是 Harness?你们平时用的类似于 Claude 和 Codex 的界面,或者平时用的网页端,那些叫 Chatbot。也就是你对它说一句话,它回答一句。而 Harness 则是你让 AI Agent 来帮你实现某些特定的复杂功能。
口说无凭,我直接给大家展示。看这里的指纹密码,这是我的 AI Harness,它没有起什么花哨的名字,就叫“AI Brain”。
这里有一个窗口,UI 做得非常漂亮,而且非常好用。打开之后可以看到很多项目,比如“数字分身”、“小红书监测”、“Debug 工具”、“开发系统维护”、“知识管理”等。比如看它在处理的各种事情,上面有“司令官”(Commander)等等。
所以这绝对不是一个普通的 Chatbot,而是一个用 AI 去整体推进的全任务系统。像 Economy——你们平时看的那个网站,就是我用这套系统做出来的。包括持续优化网页等功能,网页上的功能可能更多一些,我这里本地的功能稍微精简一点。这里有它的所有文件等等,这就是一个完整的 Harness。
多 Agent 协同与项目全局编排
我用里面的一个项目来说明 Harness 跟你们平时使用到底有什么区别。
你们平时用 Codex 或 Claude,也会在一个项目里面去用。但你们有没有想过,如果你在普通工具里面做,它是无法实现跨 Project 沟通的。比如你有一个 Project 是帮你做设计,另外一个 Project 是开发网站,你无法在一个 Project 里面让你的 Agent 直接去调用另一个 Project 的内容,这是第一个问题。
第二个问题,Codex 通常是绑定在一个文件夹里面。比如你要开发一个网站,在电脑里指定一个文件夹或者 Google Drive 上的文件夹当做工作目录。在里面你的每一条 Chat 都是平等的,都只是在对应那个文件夹本身进行交互,中间没有一个全局的 Chat 来统领和把握整个项目的整体进度。
我开发的这套东西就不一样。我为什么要开发它?原因就在于这里的每一个任务,都是由一个主的大语言模型(Large Language Model)Agent 来做总控。它自己会把任务拆解、分配给下面的 Worker Agent 去做。
比如我用自然语言跟总控沟通,由它负责整体实现;但它的实现不是自己亲手把所有事情做完,而是按照不同的技术要求分派给不同的 Worker Agent 去执行。
你可以把它理解成一家公司:每一个任务都有一个公司负责人,这个负责人是一个 Claude 3.5 Sonnet(或类似的高级别模型)。这个负责人自己决定要招多少个临时工(Worker Agent)来干活,由它自己去管理调度。你只需要跟这个负责人沟通,负责人自己去找对应的 Agent 干活。
而且不同任务之间的负责人是可以互相跨任务对话的。比如刚才看到的 Economy 任务,还有一个任务叫 Front-end(前端开发)。我可以对前端开发的负责人说:“你要开发这个功能,如果缺什么数据或设计资产,你直接去问 Economy 任务要。”它去要的方式,就是通过自然语言去向 Economy 任务发起询问;而 Economy 任务要么以自然语言回答它,要么直接打包生成文档给它。
所以这种工作方式非常不同:所有项目都有统一的管理机制,由主控去调度 Worker。你也可以提出要求,比如指定现在不要开这种 Worker、换另一种 Worker 去执行,它完全支持。
在这所有项目的最上层,还有一个全局总控编排(Orchestration),它也是一个高级别模型(如 3.5 级别)。我可以要求这个全局总控去调度里面的某个子项目,让它执行跨项目的特定事情。
这跟一般的 Orchestration 有很大区别。一般的 Orchestration 主要做的是路由(Routing)部分,比如某个项目里面比较简单的部分用 DeepSeek 去开发,另外某些部分用其他模型开发等等。而我这套系统让它们实现了完全的互相沟通。
这套系统完全是我自己定制开发的。当然我不可能完全从零(Start from zero)做起,我使用的是非常底层的 ORCA 协议。ORCA 本质上是一个不同对话窗口之间的通信协议。我之所以能用自然语言跟它说话、Agent 之间能够互相沟通、主控能派 Worker 并与其通信,底层全部是用 ORCA 协议实现的。ORCA 只是提供通信协议基础,在此基础之上构建出了整套 Harness 架构。
为什么必须构建 Harness:模型容灾与平替切换
刚才讲的这套东西非常技术化,那我来说说今天的核心:为什么在 AGI 时代来临之前,我确信自己折腾做这个玩意儿是一个完全正确的选择?
我给大家举两个实际的用例。
有一天下午,Claude 直接宕机了。如果我没记错的话,应该是这周一或者周二的下午。Claude 宕机之后,如果你的全部工作流和托管项目都强依赖 Claude,你就彻底瘫痪停摆了,什么事都做不了。
那天我也是一样的情况。因为在那天之前,我系统中所有项目的主控(Commander)全都是 Claude 3.5 Sonnet。Claude 一宕机,所有项目的主控瞬间全部瘫痪停摆。
但因为我底层使用了 ORCA 协议,灵活性极高,我立刻用 ORCA 进行了热切换,把所有主控部分一键全部切换到了 4o 或 3.5 等备用模型上。
经历这次之后,我就在系统里专门做了一个“紧急模式”(Emergency Mode)。在紧急模式下,凡是遇到 Claude 宕机或者 Claude 的 Credit 配额完全耗尽的情况,系统可以自动或手动切换到紧急状态,把所有的 Claude Commander 统一替换成备用模型。
但这里有一个极其关键的技术难点:切换模型并不像表面想的那么简单。切换的时候,你必须把上下文(Context)、历史记忆(Memory)以及之前设定的工作风格(Work Style)完整无缝地转移给新模型。这是 Harness 必须解决的核心能力,也是 ORCA 本身没有、需要我自己在 Harness 里开发实现的。
同时,我还需要为系统增加一个探针机制。当探针检测到 Claude 恢复上线之后,系统能够自动切回 Claude,并且切回来之后上下文依然能够平滑延续下去。
所以什么是 Harness?真正做一个 Harness 需要解决很多底层核心问题,比如记忆管理、上下文压缩、多模型负载均衡等。
在做这些功能时我也走过不少弯路。比如上下文压缩,一开始我自己吭哧吭哧写了一套极其复杂的压缩系统,后来发现 Claude 自身就带有现成的压缩工具,直接用现成的就行。虽然过程中有重复造轮子的地方,但没关系,这些踩坑的经验是必须经历的。
算力补贴泡沫下的分级策略与模型平替
Harness 绝对不是一个简单的辅助小工具,大家不要用做小脚本、小工具的心态来看待它。
接下来可能是我今天真正要跟大家好好聊的内容。我之所以下定决心折腾这个系统,是因为我不认为我们可以永远像现在这样,轻轻松松、肆无忌惮地大批量消耗 AI 算力。
我也不认为未来我们能够完全依赖某一家 AI 商业公司。因为 AI 现在的低成本不会永远持续下去,目前所有大模型厂商都在进行巨额补贴,所以大家用到的 Token 价格才会这么便宜。如果你现在习惯了以这种极其挥霍的方式去用 AI,哪天补贴停止、全线大幅涨价,你的工作习惯就会瞬间崩溃。
但你说:“那我从现在开始只习惯用最便宜的模型行不行?”这也不是办法。因为顶级模型和廉价模型之间的能力差距极其巨大。比如很多人觉得 DeepSeek-V3/V4 已经挺好了,那是因为你没有在高强度复杂任务上用过真正顶级的模型;在极端复杂的编码和架构任务下,廉价模型目前依然无法完全胜任。
那把所有东西全放在本地部署行不行?说句实话,我手里只有一台 32G 的 M5 MacBook 和一台二手的 M4 Mac mini,本地部署能跑出个什么效果?根本跑不动真正的大模型。目前本地能够部署的开源小模型,基本上只能处理一些边角料的工作。除非你是大公司,能一口气采购整机柜的 NVIDIA B200 芯片,在内网集群部署,否则对于普通个人来说根本谈不上完全靠本地部署替代云端。
因此,普通人真正必须要做的事情,也是我认为最核心的一点——主动把自己的工作任务划分出清晰的复杂度梯度。
具体来说,就是把你工作中最核心、最复杂、负载最重的工作交给最顶级的模型(如 Claude 顶级版本)去跑;同时,逐步将工作中简单、机械、辅助性的任务分流给不同梯度的低成本模型。
实际上,我现在已经在实际工作流中接入并测试 Gemini(如 Gemini 1.5/2.0 Flash 等)和 DeepSeek。在我目前的 Harness 体系里,DeepSeek 是作为紧急备份,同时我也在测试它作为 Coding Buddy 辅助写代码的能力。国产大模型我也一直在持续接入和使用。
建立这套体系的意义在于:未来哪怕 Claude 的母公司 Anthropic 停运了,或者 OpenAI 彻底出问题了,甚至未来 OpenAI 宣布 Subscription 订阅用量减半、Claude 也跟着把用量直接砍半,我的整个工作流也不会因此受到致命打击,因为我完全不深度绑定在某一家特定的单一商业 API 上。
再比如,现在 DeepSeek 也开始实行峰谷阶梯定价机制。波峰时段(比如下午大家都在高强度使用的时候)价格翻倍。如果你死板地只用 DeepSeek 一家,在高峰期没有别的平替选择,你就只能硬扛着两倍的高峰价格去调用;但在我这套系统里,我就不需要硬扛双倍价格,因为在我这里分配给 DeepSeek 的都是极简单的辅助工作,这些工作完全可以无缝流转给其他更便宜或免费额度的模型(如 Gemini Flash 或 Sonnet 3.5 备用线路)来完成。
模块化解耦与摆脱对单一大模型工具的依赖
因为我的 Orchestration(编排调度系统)和 Harness 接口已经完全做好了,未来假设黄仁勋的英伟达推出了一个非常优秀的开源模型,只要它能在边缘端或特定算力上跑起来,我就可以随时把它部署下来接入系统。
对于我现在的架构而言,接入一个全新的模型已经没有任何工程障碍。因为我构建了一个抽象的 Harness 层,它连接不同模型时提供了高度标准化的接口。我哪怕在底层把 DeepSeek 换成 Qwen、Spark 或其他任何模型,都完全不会影响我现有的整个上层工作流,也不会影响 Harness 的核心功能运作。
所以说,通过这套自己打造的 Harness 系统,我现在基本上已经彻底摆脱了对单一商用工具(比如 Codex 原生客户端)的绝对依赖。
说到这里,我们正好进入到聊聊 Codex 的部分。我这个月其实几乎什么大活都没交给 Codex 原生工具去做,就交给了它一件极其简单的事情,结果它不仅彻底搞砸了,还把我整整一个月的 Codex 配额全部白白烧光,直接消耗殆尽。
那件事情其实非常简单:现在网上有一个工具,可以根据你的视频自动生成动态 B-roll 素材(比如视频里穿插的动态图表、交互式动画等),那个工具非常强大,名字叫做 Remotion。Remotion 本身非常好用……
Codex Harness 的问题与自动化开发 Remotion
一周一个样,比如 Remotion。当时我就要让 Codex 帮我把这个 Remotion 开发出来,定制好里面所有的风格,然后再给我出一个自动化的程序,让我只要扔一个 SRT 或者 RST 文件进去就可以自动跑起来。按理说这件事情并不复杂,而且我给的任务书也不是随随便便写出来的,而是让 Subfavor 出了一个非常详尽、修补得非常完善、写得极好的任务书。
在用 Codex 的时候我也不瞎折腾,我也知道 Codex 本身是一个非常糟糕的 Harness。它绝对不能开 Ultra,也不能开 Max,你只要开这两个档位,任务基本上准黄。所以我当时只开了 Extra High(x-high)。在睡觉之前我把 x-high 开上就去睡了,心里还想着第二天早上起来就有现成的 Remotion 可以用了,觉得真好。
结果第二天早上起来一看,他确实是开发完了,东西确实写出来了,但是直接烧掉了大概 76% 的周额度(credit)。我还是 200 刀的套餐,耗掉了 200 刀一周配额的 76%,而且做出来的东西根本没法用。虽然他声称自己做完了各种 Smoke 测试以及其他各种测试,但做出来的成品根本无法运行。
所以 Codex 的问题就在于:Codex 不是一个模型,Codex 就是一个 Harness,这代表 Codex 这种 Harness 的设计是有严重问题的。它存在过度治理、过度反省、防御性代码堆叠以及一遍又一遍为了测试而进行的防御性测试,不断重复返工和检查,最后直接耗掉大半周的额度,事情还没做好。这就是我无法继续使用 Codex Harness 的原因。
为什么需要构建自己的 Harness:超越单一 Coding 的多项目协同
相比之下,Claude Code 蛮好用的,Claude 这个 Harness 本身没有什么太大的硬伤。但它的问题在于满足不了我的实际工作要求。因为我是同时推进很多很多项目的,我需要非常非常高的自动化程度。甚至有时候我出门遛狗、在路上走的时候,我需要能够用语音直接驱动它,我需要对系统有非常好的控制和把控,需要灵活的交互,更需要项目与项目之间能够交叉协同。
比如我现在有三个项目都需要写网站前端,我不可能给每一个单独配一套独立的网站开发流程。我需要有一个设计中枢来帮我统一管理好所有的风格规范,需要有一个前端开发中枢来搞定所有的前端界面,同时还需要三个后端模块去直接跟这个前端中枢沟通。这不需要我人工在中间传话,而是需要他们彼此之间互相沟通配合来把整件事完成。当然这件事情现在已经全部跑通并完成了,就是通过 ORCA 来实现的。
我认为等真正到了 AGI 时代,可能这些 Harness 和复杂的中间架构都不需要了,你直接吩咐一句,AGI 想做什么就能做什么。但在 AGI 到来之前,尤其是在当前的 Agent 时代——所谓 Agent 时代,就是我们不是单纯让 AI 给我们输出文本。绝大多数人用 AI 只是为了生成文字、问问问题、写写方案,这些确实完全不需要自己搭 Harness。但如果你不是为了出文字,而是要让 AI 替你做事,而且这个做事的过程需要持续积累,资产必须沉淀在自己手里。
如果把资产都积累在外部商业公司端,它们随时可能突然涨价,或者突然变得不好用,甚至出现各种意外变故。AI 领域的变化太剧烈了,哪天某家公司遭遇变故都说不准。所以只要你想做持续性的事情,在 AGI 来临之前,AI 资产就一定要积累在自己本地和自己手里。
当然我也知道很多人用不到这些,很多人其实就是跟 AI 聊聊天、说说话而已。我现在日常也用 AI 说话,刚才有人问 Gemini,我现在用 Gemini 的唯一用途就是 Gemini 3.7 Flash。用它仅仅是因为速度足够快,搜索资料的能力还行,准确度(accuracy)挺高,作为日常问答能够提供比较不错的回答。至于其他方面,我完全不用 Gemini 来做任何严肃任务,体验非常糟糕。
另外大家不要盲目相信“国内厂商把国外价格卷下来”这种说法。你知道用 Kimi k1.5 的费用有时候比用 GPT 还贵吗?你知道现在 DeepSeek 在高峰期的调用价格跟 Claude 3.5 Sonnet 是一样的吗?国内厂商并不是在做慈善,成本其实非常高。所以大家千万不要迷信价格会被轻易卷下来的论调。如果你真的想用 AI 做出实质性的东西,如果你已经在用 AI 做 Coding(比如用 Claude Code),那么我非常希望大家能够去构建属于自己的 Harness。
做专属 Harness 最核心的好处,就是它能够完全契合你自己的工作流与实际需求。现有的成熟 Harness 大多只针对单一场景,比如你当前的工作纯粹就是写代码(Coding),那你直接用 Claude Code 就够了,不需要折腾别的,它已经做得足够好了。但只要你的工作内容比纯写代码更宽泛,假设你自己是一个全栈工程师,或者不仅要管产品端的工作,还要负责其他模块,那现有的 Coding Harness 就完全不够用了,跨工种和跨项目的环节根本无法很好地衔接在一起。
更不用说像我这样,除了全栈开发之外,我还要做经济研究。比如我现在正在做关于小红书、抖音和 B 站的对台统战传播研究,这就需要针对小红书和 B 站进行媒体数据抓取(Media Query),抓取到数据库后进行数据清洗和倾斜处理,接着做横向对比分析,分析完毕后再自动生成网页进行可视化展示。整个链路极其复杂,项目跨度非常大。这里面有一个现成工具做不了的核心点:定制化的业务逻辑。商业化的 Harness 无法为你预设这种专有逻辑,只有你自己动手做 Harness,才能将业务逻辑深度定制化,从而替你自动化处理海量的工作。更不用说我做这套系统的终极目标和终极野望,就是为了打造我的天字第一号项目——数字分身。
上下文优化与记忆层架构:解决长对话信息丢失与无限膨胀
当你开始自己构建 Harness 时,就会深入学习和掌握很多底层的技术细节。这里我可以分享一个非常关键且硬核的技术原因,说明为什么一定要做自己的 Harness。
大家在用大模型时应该都发现了一个严重的问题:对话不能太长。一旦对话过长,系统就会强制自动进行压缩。为什么要自动压缩?因为如果不压缩,上下文(Context)就会变得极其庞大,而上下文越长,API 调用的费用就越昂贵,因此没有任何商业 Harness 希望你的上下文无限膨胀。无论是在 Codex 还是在 Claude Code 中,虽然你表面上可以在同一个会话里无限聊下去,但实际上后台在不断进行压缩,而这种压缩的效率和质量往往是非常差的。
我自己之所以清楚这一点,是因为刚开始搭自己 Harness 的时候,上下文压缩机制做得不好。有一天上午因为压缩策略不到位,导致每一个对话的上下文都拖得太长,一下子烧掉了我非常多的钱,当天的损失相当大。后来我就尝试去参考 Claude Code 的压缩思路,也就是它内置的 compact 压缩工具。
深入研究后发现,市面上的业务逻辑其实非常粗糙简单:它们通常就是直接把前面的历史记录暴力截断拿掉,然后让模型对上文生成一份摘要,再把这份摘要塞回上下文里。很多人以为大公司的摘要质量一定很高,其实质量非常差。
因为我自己掌握 Harness 的控制权,我可以把所有对话的完整上下文以 Markdown(MD)文件的形式原原本本保存下来,文件体积很小。我把完整保存的原始上下文拿去用模型重新跑一遍进行比对,得出的具体数据是:商业工具每次执行自动摘要,都会丢掉大约 30% 的关键信息。
针对这个问题,我现在在自己的 Harness 里就可以做到兼顾效率与质量:为了保证执行效率,我依然先调用现成的基础压缩机制,毕竟其开发完整度高,没必要去重复造轮子;但在它压缩完成之后,我会额外调用模型(比如 Luna)针对性地补上一份增量摘要,将丢失的关键信息重新补送回当前对话中。这就相当于让系统持续维持着高质量的上下文状态。
做大项目和长周期项目的人都知道,上下文的质量至关重要。时间跨度越长,如果上下文质量下滑甚至失真,会带来灾难性的后果——模型做到后面会彻底遗忘前面的设定,甚至开始胡乱写代码和瞎操作。通过这套机制,我就能在一个长周期的任务中始终维持极其精准的上下文环境。
不仅如此,我现在不仅能维护单一对话的上下文,还在所有保存的上下文历史文件和活跃对话之间搭建了一个中间层。我一直在维护一个固定大小的“记忆层”,它由后台模型持续提炼。也就是说,模型不仅在优化当前会话的单次摘要,还会把最新的摘要与过去积累的历史文件共同融合成一个中间层记忆文件。这样既能保证上下文质量始终处于高水准,又彻底防止了上下文长度无节制膨胀。
这套逻辑某种程度上借鉴了 GOM 的上下文压缩思路,虽然 GOM 是利用矩阵算法将所有信息往矩阵里面压缩,而我这里依然保留为人类可读的常规上下文结构。我将上下文划分成了不同的区块,其中有些核心区块是写死固定的,有些区块则随着任务推进逐步向后迭代更新。对于从事技术开发的同学来说,大家应该明白,能够自主掌控并维护一套高保真的上下文质量,对于推进大型工程来说是多么核心的一项能力。
跨机通信与硬件负载均衡:基于 ORCA 协议的集群协同
自己构建 Harness 的第二个巨大优势,就是能够实现跨设备的硬件负载均衡与优化。
比如我手头有一台 M4 芯片的 Mac mini,单台设备的硬件资源终究是有限的,内存很快就会被吃满,根本无法在本地承载较大的本地语言模型或其他计算模型。但是,ORCA 协议本身支持非常优秀的跨机通信能力,大家也可以深入研究一下这个协议。
当初 ORCA 也是一位网友在我的 X(Twitter)推文下方留言推荐给我的。当时我正在网上抱怨某些 AI 基础设施能力不足、无法支撑底层深度开发,那位网友便建议我试试 ORCA。实际测试之后发现确实非常契合我的架构思路。
通过 ORCA 协议,我实现了跨设备的计算负载分配:将所有负责统筹、调度和指挥的核心对话集中运行在主力机(M4 Mac mini)上;而一旦检测到 M4 的内存或计算负载接近瓶颈,系统就会自动通过 ORCA 将具体的执行任务(OCC)路由分发到另一台 M5 设备上去执行。M5 接管了大量计算任务后,两者再通过 ORCA 协议实现无缝互联与数据同步。
我现在可以实时监控各台机器的内存使用率和负载量,动态进行任务调度。这意味着未来我完全不需要为了算力焦虑而一次性投资购买极其昂贵的顶配硬件。比如以后苹果推出了性能出色的 M6 Mac mini,我直接买一台接入网络即可。现有的 M4 继续安稳放在原位,负责它已经跑通的上下文优化和指挥调度中枢,新产生的繁重项目负载则直接通过 ORCA 分流到 M6 上。
长期记忆与 RAG 系统:打造专属的数字分身
未来我甚至可以专门拿出一台独立的 Mac mini,只用来运行记忆系统和检索增强生成(RAG)。目前我也正在全力搭建这套 RAG 体系。
我手里拥有非常扎实的 RAG 素材积累:我自己过往撰写的数百篇长文,以及大量的节目内容。目前我已经把这一整套历史产出全部转成了高质量的 Markdown 文件,我的“数字分身”天字第一号项目正是用这些第一手的高纯度数据在进行训练和调优。
除此之外,我还整理了过去做学术与行业研究时陆续下载积累的 4000 多本书籍。这些书全部与我的核心关注领域强相关,没有一本是消遣性质的武侠小说(诸如金庸、古龙等一概没有)。这 4000 多本书不是短时间内批量搬运的,而是多年研究过程中一本一本筛选下来的精华。换句话说,这 4000 多本书本身就是经过我个人多年高度筛选后的专属知识库。现在我正在将这 4000 多本书全部转换成 Markdown 格式,接入底层的 RAG 检索系统,使其成为一个支持高精度语义搜索的知识库。
人类的记忆机制本质上分为两种:一种是工作记忆(Working Memory),另一种是长期记忆(Long-term Memory)。对应到 AI 架构中:
- 工作记忆:就是我们前面详细拆解的上下文维护与优化机制。
- 长期记忆:对于现有的标准 AI 系统而言,长期记忆的支持向来很弱。如果仅仅把大量文件丢进一个文件夹让 AI 直接去读,这本身又会瞬间撑爆上下文,而且系统无法对其进行深层提炼和优化。
在我自己的 Harness 架构中,工作记忆由前述的动态上下文与中间记忆层持续维护;长期记忆则由那 4000 多本书的 Markdown 库、我个人的数百篇文章与节目档案沉淀而成的 RAG 系统共同承载,并融入了我个人的思考方式。两者协同运作,使整个 Harness 既拥有持续精炼的工作记忆,又能在遇到特定专业项目时随时调取庞大的长期记忆。这种深度的记忆协同,是现成的 Claude Code 等商业产品完全无法实现的。
模型调度分工:主力 Worker 与备份体系
在具体底层模型的调度与分工上,我目前采用了主流两大家——Anthropic(Claude)与 OpenAI 深度结合的策略:
- Worker 执行层:OpenAI 旗下的模型主要被我用来充当具体的 Worker 角色。主力 Worker 包括 Sonnet 3.6 High、Luna High 以及 Luna Extra High(luna-x-high)等档位,由它们专门负责具体的执行任务。
- 备选与辅助层:除了主力 Worker 之外,我还接入了 Gemini 3.7 作为备选;而 DeepSeek 方面,目前 DeepSeek V3/R1 并不承担主力重任,DeepSeek 4.6 Flash 仅仅是作为整个上下文备份系统的一个容灾备选方案存在。
- 指挥控制层:所有与我直接进行日常交互、负责全局逻辑把控与中枢调度的核心模型,则统一由 Anthropic/OpenAI 的顶层模型来接管。
国内主流模型横向实测对比
我们内部的配置基本都是 Anthropic 体系,其中总司令我管它叫总司令,使用的是 Claude 3.5 Sonnet(或相关旗舰模型 / Opus / Sonnet 系列),他在上层被压榨得最狠,因为高级模型太贵了,而其他项目的司令用的都是 Opus 等高阶配置。
在实际使用和测试中,GLM-4(或 GLM-5 系列)是目前国内模型里面最好干活的。这不是道听途说,而是我自己实测出来的。因为我手头正在做一个超级大招——“中国模型智力与偏见大研究”。为了做这个研究,我制定了大量非常实际的任务让国内的各个模型去跑,因此积累了大量调用国内各种模型的实操经验。国内测试的主要就是这五家:DeepSeek、智谱 GLM、Kimi、通义千问(Qwen)、豆包。
做了这么多测试之后,我对哪个好用、哪个不好用心里非常清楚。首先说个前提:其实它们整体都还谈不上特别好用。但在这些模型里面,GLM 的表现是最好的。我们都有实际的数据支撑,包括任务命中率、响应时间、失败次数等等,全都能拿数据说话。
比如在所有模型里,通义千问(Qwen / Qwen-Max)是表现相对最糟糕的一个,主要问题就是耗时极长、时间超长,是所有测试模型里面最耗时、最慢的。而 DeepSeek 的问题也非常大,所以我目前只拿它当备份。DeepSeek 的正则性极差,在所有模型里多次回答的一致性最低,同样的提示词给它跑五次,五次的回答完全不一样。面对这样的模型,在严肃自动化流程里你根本不敢直接重度依赖。
AI 作为个人智力基础设施与生产力变革
有同学说将来 AI 会成为个人智力的基础设施,会变成一项日常的基础支出。我非常认可这个说法。当然,这并不是针对所有人,比如搞纯艺术的就专注做艺术;但如果你是做智力工作、脑力劳动、过去的白领职业或者内容生产,你就必须把 AI 支出当做生活中必不可少的一笔开销。
通义千问的中文叫千问,英文叫 Qwen。把这笔支出当成招聘员工来看待:我现在在 AI 上的总支出,远远不到雇佣任何一个全职员工的薪水。但你招任何一个单独的人,怎么可能一个人把我现在这一大摊子事情全部做完?开什么玩笑。
以我现在这套 harness 自动化系统来说,如果换算成传统公司的编制,起码需要五十个人才能覆盖我目前所有的工作:前端开发、后端开发、AI 调研与研究、小红书和 B 站的数据抓取、经济研究、大量的系统维护、数字分身、书籍电子化,以及记忆系统的研发与维护。以前没有五十个人根本运转不下来,现在我一个人每天跟系统配合就能全部跑通,这彻底颠覆了我使用 AI 的工作形态。
商业化克制与自建 Harness 的战略意义
有人说我现在像个“一人集团”而不只是一人公司。但我目前的个人收入并没有发生巨大的变化,核心原因在于我并没有试图去最大化我的商业收入(maximize my income),我做的很多事情依然保持着公益性质,整体的盈利模式并没有做任何改变。
如果我把这套 harness 系统的架构打包成一个商业化产品去卖,可能是我目前所有项目中最容易变现(monetize)的方向。如果真要商业变现,只要把这套 harness 好好做成一个前端产品,给用户开账号,登录进来就能管理任务、调用背后的编排体系与订阅,这完全能做成 SaaS。但这并不是我的志向,我不想靠卖这个来赚钱。
我非常建议正在做重要项目、或者有更大野心的开发者,尽早放弃纯粹依赖 Codex 或 Claude Code 这些黑盒工具,去动手开发属于自己的 harness。大家想想看,万一哪天商业工具突然涨价一倍,或者因为 IPO 上市为了追求股东权益而大幅调整定价策略,就像 DeepSeek API 价格调整一样,你就会陷入被动。所以大家完全应该自己去尝试搭建专属的工作流。
AI 智能眼镜与纯语音任务派发
这套系统还有一个非常炫酷的功能,这里可以通过视频给大家展示一下,Discord 社区里很多朋友可能已经看过了。这就是我的 AI 智能眼镜联动。
视频里演示的是通过智能眼镜进行语音交互:“请把现在最新的两个可以测试的地址都发出来,一个是出口有关的,一个是总体的 economy 前端。”现在的眼镜 UI 和交互系统经过不断迭代,已经比视频当时展示的效果好得多了。
我现在很多时候出去散步、遛狗,就戴着眼镜看系统汇报和进展。眼镜端支持纯语音交互,在镜腿上滑一滑、晃一晃,直接用语音对眼镜说明要做什么、调整什么,任务直接就派发下去了。现在我每天基本都在用语音派发工作、查看进度。这种状态让我体验到了前所未有的“老板式”工作流——过去所有事情都得自己吭哧吭哧亲手写、亲手做,现在每天主要的工作就是看 AI 的汇报,问怎么回事、进度如何、要求解释方案,听完汇报后批复“选方案 A”、“按你的方法试一试”、“这个你自己去做就行了”,偶尔甚至还会因为做错而训斥它。整个工作重心完全转变成了看汇报和做决策。
多 AI 角色开会与协同决策机制
我再给大家介绍一个我们在 harness 里做出来的核心功能:AI 开会功能。这套机制带来的效率和解决复杂问题的能力极其强悍。
什么是 AI 开会?你们有没有想过,让两个带有完整上下文和项目记忆的 Claude 3.5 / Opus 模型针对一个技术方案展开多轮讨论?比如让系统的总司令和负责具体模块的专职智能体一起开会,他们双方都拥有该项目的历史记忆和 Debug 经验,让他们直接进行机器与机器之间的多轮交互对话(AI 对 AI),共同商讨这个项目接下来该如何推进。
这种讨论的效果好到不可思议,而且我作为人类随时可以接入插话。比如他们讨论到一半,我看了看思路,直接插一句“这里应该这样调整”,随后他们基于我的反馈继续按轮次展开,A 说完 B 说,B 说完 C 说,完全就像真实的团队技术评审会。
这个开会功能成了我推进卡壳项目、攻克复杂技术方案的神器。只要项目在某个节点推进不下去了,或者需要高质量架构设计,我就拉两到三个具有特定背景上下文和功能的模型进会议室开会,让他们充分交流,最终输出一份结构化的“会议决议”,随后各个智能体领走决议去落地执行。
自从开发了这个开会功能后,我们已经开过了整整 22 场 AI 会议。这个功能根本不需要开源,因为底层的逻辑非常简单:只要有了底层的通信协议与编排机制,让信息在不同模型之间有序流转即可。
记忆系统分层与语义切片检索
关于如何保证智能体的长期记忆,核心在于不要依赖纯官方的黑盒方案,而是要在底层自己给它打补丁,维护一套以本地文件为支撑的分层记忆系统。
文件记忆系统必须进行明确的分层设计:
- 常驻核心层:每次会话启动或任务初始化时必须全量读取的基础上下文。
- 索引检索层:存储在本地、按需通过索引检索调用的历史信息。
在检索这一步上逻辑相对复杂。如果只靠精确的纯文本关键词匹配,是完全不符合 AI 的语义特征的,因为 AI 每次输出的文本表达都会有差异;因此必须依赖语义检索,引入类似 Mem0 等语义系统,采用“语义切片”的技术方案。通过这种方式,系统就能稳定维护一个高质量的上下文。
维护上下文系统是我要求整个架构花最多精力去打磨的部分。我本身并不是纯粹的技术宅,之所以能把这套系统推进得这么快,完全是强烈的实际业务需求在倒逼。
在 Token 消耗方面,开会和日常单次提问的消耗模式本质上是一样的,开会表面上看是一个多方会议,底层依然是通信系统把 A 的发言作为上下文传给 B、把 B 的回复再传给 A,调用的上下文机制完全相通。
要掌控这些,你并不需要精通最底层的算法代码,但必须清晰理解核心的技术概念。比如你得知道什么是上下文压缩、什么是负载均衡,虽然具体的压缩算法和负载实现细节可以交由模型去写,但核心概念你必须懂,否则在架构设计上就会踩非常多的坑。关于系统里的智能体(Agent),现在主流的大模型本身都具备 Agentic 能力,我们无需自己从头训练基础模型,而是直接基于这些具备 Agentic 能力的成熟模型去封装 Commander Agent 与 Worker Agent。
个人知识蒸馏瓶颈与全订阅制运行模式
关于利用自身语料训练数字分身进行“自我拯救”,实际做起来难度极大。在个人语料储备上,很少有人能拥有比我更庞大且高质量的自我语料库,但在实际测试中,仅仅依靠这些语料依然远远不够将一个鲜活、具备独特判断力的数字分身彻底蒸馏出来。
我一直在通过双盲测试来调试数字分身的蒸馏效果:系统给出包含蒸馏模型生成的回答与通用 AI 生成的回答共十条内容,让我自己去盲猜哪一条是根据我的语料蒸馏出来的,哪一条是 AI 自由发挥的,到目前为止连我自己都经常分辨不出来。之所以目前没有强推数字分身功能,正是因为目前的蒸馏技术还无法做到具有足够辨识度的“自我表达”。
在运行成本方面,我整套系统完全基于各平台的订阅制(Subscription)在运行,而不是直接调用按量付费的 API。如果我现在这么庞大的任务吞吐量全部走商业 API 计费,我的个人收入根本无法承受如此高昂的 Token 账单。正是因为目前的 Claude Code、各类 CLI 工具支持订阅额度,整套体系才能维持低成本运转。
跨模型编排容灾与判断力瓶颈
我也在时刻防备平台方未来可能取消或限制订阅制调用的风险,这也是为什么我现在全力投入编排机制(Orchestration)与滚动容灾方案的原因。编排在当前看似只占一部分,但未来会是决定系统生死的关键,一旦哪天 OpenAI 或 Anthropic 限制了第三方订阅调用接口,系统就必须能够无缝切换到其他备用模型方案。
为了应对这一天,我现在没有花时间去蒸馏我自己,而是在尝试“蒸馏 Claude 3.5 Sonnet / Opus(Fable / Fiber 系列)”。我正在让模型不断总结自身的指令风格、掌控节奏和回复逻辑,将这些能力沉淀为一套严格的规范。
这样做是为了建立容灾机制。之前有一次遇到 Claude 平台全局宕机进入紧急状态,我临时切换了其他模型(例如某些备用高性能模型)来顶替 Commander 的位置,结果整个执行一塌糊涂,甚至差点把本地的 harness 代码与环境改坏。从那次事件之后我意识到,单纯依赖其他模型的默认能力是远远不够的。未来哪怕官方取消订阅导致我们无法直接使用顶级模型,备用模型接管时也必须严格套上这套总结出来的 Prompt 框架与执行规范来充当 Commander。
做数字分身的核心价值,在于解决我个人精力的极限瓶颈。在当前这套高自动化工作流中,代码编写、数据抓取、任务执行的速度都极快,整个系统运转下来最稀缺的瓶颈资源变成了我个人的判断力。我一天只有 24 小时,能做的审核与决策极其有限;如果数字分身能够把最稀缺的判断力多复制出一部分,哪怕只分担一点点,整体效能都会大幅提升。之前我尝试过把特定能力封装成 Skill 模式,但整体效果并不理想。
构想李厚晨 Bot 与多模型协作写代码
我现在正在试。如果做得好,很快就会有一个产品可以让大家用,就是“李厚晨 Bot”。大家可以拿来问他问题。你看我没有想做小红书的内容,我想做一个“李厚晨 Bot”。“李厚晨 Bot”本身就是一个内容,你们可以拿这个来问他。我想做的是,这个“李厚晨 Bot”做出来之后,他这个 Chatbot 别的问题都回答不了,但如果你问他政治学、经济学等等的问题,他肯定比 Claude 3.5 Sonnet 回答得好。我就是想让他比 Claude 3.5 Sonnet 回答得好。
让 Claude 全程指挥,由 Claude 3.5 Sonnet 写代码,Claude 来指挥。我现在这套 Harness 的功能之一,就是让 Claude 3.5 全程指导,由 Claude 3.5 Sonnet 来写代码,然后 Claude 3.5 负责检查。这不止是写代码,做别的事情也好多,当然背后都是代码驱动的,这个都是一体的。
AI 降低开发成本与个人思考风格的还原难度
对,我跟你说,现在网页和 App 这个东西不重要了。有了这些东西之后,我从有网页到做出这样一个 App,再到做出我那个眼镜 App,就一天时间。而且现在我做 App 的这个程序的记忆非常非常好,我觉得未来我让他做别的 App 能做得特别特别好。他已经踩过很多坑,积累了很多经验教训,知道很多东西该怎么做了。
有了 AI 之后,过去最大的障碍全部都不是障碍了。过去我可能觉得,我的东西好多,要做一个 App 好复杂。哇,现在做一个 App 已经快变成零成本了,可能一个下午就出来了,非常简单。现在的成本全部转移到了最重要的东西上面。
不过,你看我回答情感问题的方法,那个东西我现在发现,个人的思考风格其实挺难真正去还原出来的,我觉得挺难的。
之前说那个网站不是已经有了吗?只是我觉得那东西意义没有那么大,我想给大家一个更好的东西。那个东西我把它变成一个 App 是瞬间的事情,那个 Web App 已经有了,就是一个 FlipRadio 的 Web。那个东西我想做,但是我觉得优先级没有那么高。因为我知道大家都觉得不错,但是实际做出来不会有太多人用,它不是一个很大的痛点。
有水声,是因为那儿有一个给猫猫喝水的电动饮水机,它的水不够了就会有水声。我就给它添点水吧,添了之后就没有声音了。
Harness 开发波折与一人一天的生产力跃升
我最近几天没有在网上怼大外宣的原因,就是因为这几天经历了一次 Claude 宕机,然后 Sonnet 差点把 Harness 改坏,Sonnet 当司令官效果极差。然后有一天上午压缩没有做好,发生大爆炸。这两天我发现压缩弄好了之后,上下文又出现了问题,一直在调上下文,所以最近基本上没有在网上骂大外宣,大量时间都在做这个。
但这些做好之后,骂大外宣当然也会骂得更加起劲。项目文件都在 Mac 上,现在一个人一天能做的工作量是难以想象的。真的,我现在一天能推进的事情,比如一天测试很多中国的 AI 产品,然后去小红书抓好的内容、分析经济网站等等。有了这个之后,处理这种非生产性内容的效率是极高的。
但我现在养成了一个恶疾,这肯定是我目前使用频率最高的软件。我看看我的 Screen Time 有没有记录我自己做的这个软件,我每天用多长时间。我觉得肯定是一个非常恐怖的时间。我给大家看我今天的 Screen Time:今天我的 Screen Time 一共是 8 小时 23 分钟,我那个软件叫“AI Brain”,“AI Brain”用了 4 小时 51 分钟。而且这只是我在 App 上用的时间,我在电脑上还得用,电脑上还有时间。我光在手机 App 上就用了 4 小时 51 分钟。第二名是 Google Chrome,因为今天我去体检了,所以用了 30 分钟。第二名 30 分钟,第一名 4 小时 51 分钟。
我说句实话,我用这玩意儿 4 小时 51 分钟,其实你就知道这有多好用了,对吧?如果它是一个很差的工具,你不可能一天花 5 个小时在上面;你一天花 5 个小时在上面,就说明它真的是一个很好用的工具。当然这也跟我自己有关,我其实觉得自己是一个有产品思维的人,很多东西都能想出办法。而且我觉得有这种创造的快感,你用 AI 这么做东西,确实有创造的快感,你一直在不断搭建各种各样的东西。
所以我今天没戴智能眼镜。今天用了 4 小时 51 分钟的原因,也是因为我今天去体检,在体检等待的时候,我都像老板一样在给各个 Commander 发命令。大体上就是不断打字,看他的汇报,问怎么回事、进度如何、解释一下,推进并决定选 A 还是选 B,去干好这些事情。
压榨 AI 协作与模型踩坑经历
以前做“想借”App,招那么多人写了两三个月。现在如果我只是做“想借”这样的一个 App,我觉得说白了就大半天吧。我之前做“想借”,程序员和产品最高峰的时候有六七个人,七个人做了 3 个月。现在我回想,就那个 App,现在让我做真的最多 4 个小时,不会比 4 个小时更多了,甚至我觉得更短时间就能做出来。
我觉得你那个帖子说得对,我这个方式确实是把 AI 的能力都压榨出来了:AI 之间的相互协作,AI 自己对 AI 的监督检查,包括 AI 进去打断 AI 的一些过分的工作,AI 的优化,AI 的流程。包括我刚才讲的负载压缩,这些都极其重要,核心还是定制自己的工作流。
但我天天为什么骂 OpenAI?就是因为 Sonnet 之前太烂了,差点直接把我这个 Harness 改坏了。你知道它把 Harness 改坏改到什么程度吗?改到我后来没法用我自己的 Harness 去改代码,最后只能到 Cursor 里面新开一个东西,在 Cursor 里面从底层来改。因为 Sonnet 基本上把这个 Harness 瘫痪掉了。OpenAI 真是烂透了,那天急得我一头汗,最后怎么弄怎么弄也弄不好,完全卡死了。然后我就把 Cursor 打开,在后面一块一块把它调好,好歹现在又调好了。
当时其实是可以回滚的,我可以直接回滚到之前。但是因为用 OpenAI 又开发了一些功能,就是那个压缩功能。其实现在回想起来,当时就应该直接用 Git 回滚。我当时舍不得开发好的压缩功能,但现在回看,那部分手写的压缩功能现在是完全放弃的,整个压缩部分完全是用官方的压缩,我当时根本没有必要让它手写压缩。因为之前压缩出了那么大的问题,所以在紧急状态切换到用 Sonnet 当 Commander 的时候,写好的好多压缩功能全乱了。我特别心疼那些功能,就没有让它回滚。当然有 Git 在,版本管理都是做了的。
好,AI 的话题我们就说到这儿,反正很快你们就能看到各种各样我用 AI 做出来的东西井喷式爆发出来。大家不用担心井喷,择机按需使用就行。
算力成本考量与直播问答准备
你们知道我那个“李厚晨 Chatbot”为什么其实不能直接让大家免费用吗?如果要每个人都用的话,那最后扣的都是我的账单,调用的都是我的 Subscription。我哪有那么多钱?要是 50 个人并发来提问,一天就把我的 Token 烧干了。所以我突然想想,那玩意儿真没法就这么让大家免费用,太烧 Token 了。如果免费给大家用,大家一来提问,我下半个月就可以直接休息半个月了。
我们来回答一些问题。我可以在电脑上看 Discord,我电脑现在开个 Discord 应该还是跑得动的吧。刚才带 OBS 加直播推流带不动,单开 Discord 还行。而且我现在前面电子设备实在太多了,多到蓝牙键盘都用不了。因为各种讯号干扰,蓝牙键盘只要是不带专属接收器的,就很快连不上,设备量确实太大了。
我看看进水的问题。搞这些东西,你还是需要稍微了解一点 Terminal 和 Linux 之类的基础知识。
有人说“AI 浪潮把人异化到高峰”,我觉得 AI 所带来的生产秩序可能会把人异化到很高峰,但 AI 这个产品的逻辑本身并没有把人异化。
至于啥时候能用上“李厚晨 Bot”,现在最大的障碍是我中彩票。现在技术上不是障碍,障碍是我怎么能够为大家掏得起 Token 的钱。如果我现在转行做 AI 博主的话,应该是有潜质的,因为我很喜欢折腾这些事情。我比那些水货 AI 博主肯定厉害得多,我个人确实觉得我现在的 AI 实践还是跑得比较靠前的,主要是由我的实际需求推动的。我现在连着的这台电脑是一台 M1 MacBook Pro 老电脑,我那台 M4 已经完全献祭给后台任务了。
云同步终于结束了。今天本来还想再调一下直播间的 Banner,今天没有 Banner 可调了,我们就直接开始吧。既然有这么多问题,因为我最近睡得比较少,我们回答半个小时吧。
我先看一眼有没有老搭档的问题。有老搭档的问题,我们先回答老搭档好不好?因为我们很久没有回答老搭档了,大家一定对老搭档这个环节甚是想念,我也觉得我有义务继续回答老搭档的问题。
情感答疑:面对根本性的生育分歧该如何抉择
我从下往上看。有位朋友提问: 我和女朋友在北美相爱三年,关系甜蜜,未来想结婚。组建家庭唯一的隐忧是对生育的分歧。我希望未来有我们的孩子,她坚决反对。女方认为生育对女性身体和职业影响很大,也不想把生活意义和经济重心放在孩子身上,最大的妥协就是代孕,然后由我主导抚养孩子。我们距离能够养育孩子还有七到八年。我有些忧虑这个分歧会影响我们的关系和规划,这算杞人忧天吗?她明确表示,如果我想要一个能做母亲的伴侣,就不应该和她在一起。我不确定我的想法有多少来自社会、家庭观念或者 FOMO。我不希望她为了家庭放弃自己,也理解生育对女性的负担。我应该努力改变自己的生育观念预期去和伴侣对齐吗?
首先我觉得你们两个人的要求都不过分。我很难说在今天这个年代,要孩子来这个世上是个错事,或者不要孩子是个错事。但我不得不说,这是两种特别巨大的生活愿景。有孩子的生活和没有孩子的生活,是两种完全不同的活法。这两种活法的差异之大,就像一个丝毫不关心政治的人和一个完完全全关心政治的人之间的差异那么大。所以说这个事情对你们俩来说差异是极其巨大的。
有了孩子的生活,孩子肯定是整个家庭生活的核心和重心,这是肯定的。而且你女朋友看起来对这个事情的坚决程度非常高,她都明确说了,如果你想要一个母亲的话,就不应该和她在一起。这说明她因为各种各样的观念,自己完全不想要孩子。
你也提到你们距离能养育孩子还有七八年,说白了到时候也是三十几岁、甚至三十大几岁的人了,年龄也不算很年轻了。你的女朋友可能也过了很多人所说的那种“女性到了三十多岁可能会忽然想要孩子”的阶段,所以这是一个非常根本的分歧。
现在你们俩的情况,说白了很难调和。她不要孩子的决心极强,那就看你要孩子的决心强不强。如果你要孩子的决心也极强,你在设想自己未来的生活时,很难想象一个没有孩子的生活——这非常正常,很多人设想未来生活时都很难设想没有孩子的生活。如果你也是这样,那我真的觉得你可以考虑再找一个不同的人,因为这真是一个差异极其巨大的事情。
所以我觉得你不用努力改变自己的生育观念预期去和伴侣对齐。为什么呢?因为如果这个事情导致你 60 岁的时候后悔,这种后悔是难以弥补的。比如你现在强制让自己跟女朋友对齐,你们在一起 3 年,假设再过 20 年,你看到周围的人跟孩子的关系、陪伴孩子成长,突然觉得自己非常渴望这种生活……
要孩子的动机与感情中的压力
如果你突然觉得自己之前没有要孩子真是一个错误,这种后悔其实很难想象。而且如果这种后悔转变成了未来感情中间的一个压力,比如你们未来感情中产生了分歧,或者相处不太好了,你心里会产生一种“我为了你失去了要孩子的机会”的感觉,这就很麻烦。
所以你真的要去问自己,你想要孩子的动机到底强不强。如果你想要孩子的动机非常强,这可能就是一个不能继续的信号(no sign)。
跨两岸异地同性伴侣的现实困境与选择
下面一个问题。提问的女生之前在台湾交换时期与现在的女朋友认识,是一对拉拉相恋。两个人虽然性格和价值观不太一样,但整体很合得来,也彼此非常喜欢。
问题是从她回大陆之后开始出现的。女友不太擅长在线上处理问题,总是说一些伤人的话,比如骗她说要早睡,实际上跑去酒吧玩。女生表示自己可以理解亲密关系中这些稍有瑕疵的时刻,但在被发现之后,女友说了一句“虽然我很爱吃醋,但你如果遇到合适的也可以接触”,这句话让她非常生气。人美化自己可以理解,但她不喜欢对方在美化自己的同时还要教自己怎么做事,所以久而久之对女友的态度冷淡了下来。
读到这里其实就觉得这段关系很悬,但后面出现了转折:女友顶着工作压力请了一周假期来大陆找她。当面相处时,两个人才发现原来彼此这么在乎对方,很多之前的矛盾都是因为在线上容易被放大,且缺乏有效沟通。见面后的半个月里感觉都很好,线上也能感觉到对方每天都希望亲密接触,两个人也会在线上做一些增进感情的事。
但两人好几次聊到分别之后很难维系的问题,甚至抱头痛哭,可一旦提到具体的未来规划,还是默契地浅浅带过。女友曾经因为她从来不提结婚而吵过架,但毕竟年纪尚小,无论考虑现实还是恋爱的月份,目前都还不会深入考虑这些。
提问者的问题在于:如何调整自己在面对这类几乎有既定结局、但两人又没办法放弃的现状?对于现在的感情处理,以及两个人如何健康思考未来,有什么建议?
这其实是亚里士多德式的理性如何驾驭感性的永恒问题。如果理性真能完全驾驭感性就好了。两人感情不错,但横亘在面前的是巨大的现实障碍。
这里可以回到异地恋的两个基本原则。一段异地关系到底能不能维持,取决于两点: 第一,有没有异地恋结束的明确预期; 第二,有没有规律性的线下见面。
如果既没有异地恋结束的明确预期,又不能够经常见面,那从理性角度来说就算了。当前的情况正好符合这点:没有结束异地的明确预期,而见面需要付出极大的代价。回大陆之后再去台湾非常困难,基本上只能靠对方过来。
如果选择感性,那就感性到底:两个人去泰国结婚,结完婚之后搬去台湾生活,回大陆注销户籍。从个人角度来看,如果有机会搬去台湾生活也是一个选择。不管是出于政治原因、社会原因还是个人原因,能去台湾生活都不是坏事,这就是彻底走感性路线。
但如果从理性角度考量,目前这种状况继续拉扯下去也不会有好结果。现在的痛苦恰恰是因为卡在感性和理性中间,进退两难。
社交软件异地对象的推进考量
下一位提问者在 Tinder 上划到的对象,陆续聊了好几天。虽然两个人像朋友一样聊得很投机,但生活在不同的省份。双方都有从第三方视角聊到异地的问题,并且表示都能接受。目前聊天整体氛围还是像朋友一样,主要问题是无法线下见面。想请问应该如何推进关系,以及如何通过线上的方式把彼此的关系进一步往前推。
面对这种情况,同样需要回答两个核心问题: 第一,你们俩有可能在一年之内搬到同一个省生活吗? 第二,除了黄金周等长假之外,你们俩平时有可能经常见面吗?
如果这两个问题的答案是否定的,就不要想着推进了,纯线上聊天的关系不如就此作罢;如果答案是肯定的,那么推进关系的方法就是去对方所在的城市见一面。
职场中与已婚/有伴侣上司的情感失控
下一个提问内容很长。提问者与一位在工作上密切接触的男性(严格意义上是自己的老板)产生了超出工作范围的情感关系,而这位老板有一位已经交往多年的女朋友。
在工作场合中,由于共同为一个目标努力,看到对方拼尽全力、赌上身家,内心被打动,希望能多帮一点、尽己所能分担工作,这种心理在职场中自古以来都很常见。
前阵子老板试着向她确认心意,她一直顾左右而言他。几天后两人一起应酬,借着酒劲老板表白了。提问者当时知道对方有女朋友,但这是第一次有男性主动表达喜欢,被喜欢和被肯定的感觉让她冲昏了头脑,陷入犹豫。但这件事情当天就被老板的女朋友发现了。
隔天,提问者到老板家里过夜,屋里还有他的女朋友和其他工作伙伴。女友当场用酸言酸语表达不满并宣示主权。后来老板转述了女友的想法:只要不让她亲眼看到,她选择默许,甚至主动腾出时间给他们;但要求提问者在金钱物质方面给予赔偿,并帮忙分担洗碗、倒垃圾等家务。
读到这里整件事情已经彻底匪夷所思。提问者表示,自己其实不想再跟老板发生关系,也不想继续伤害陪伴他多年的女友。而且担心这样继续下去,自己在工作上的付出和努力会不会被外界归结为出于私情;但又害怕拒绝老板、结束这段不正常男女关系后会影响共同的事业目标;甚至纠结维持亲密关系是否能增进彼此的工作成效。工作上她依然想留在对方身边协助,看到自己全心全意付出,对方也很想给予回报。
对此的梳理如下:前期在工作环境中互相吸引、表达喜欢,甚至男方试图过一种“家里有女友、公司有红颜”的双轨生活,这在职场历史上发生过无数次,虽然不是好事,但逻辑尚且清晰。但后续的发展已经完全失控(out of control),演变成了一种荒诞的混乱——竟然跑到有正牌女友和其他同事在场的家里过夜,甚至女友还提出要经济赔偿、分担家务来换取默许。
这就是典型的复杂化(complication)演变为混乱(chaos),最后必然滑向灾难(catastrophe)。所谓的“女友默许腾出时间、索要金钱补偿”在现实中绝对不可能平稳维系。
提问者当前的直觉是完全正确的:不想继续发生关系、不想伤害别人、想要退出这种混乱。在操作层面上,应该找一个严肃的场合与老板正式谈清楚:明确指出过去这段时间发生的事情彻底陷入了混乱,自己绝不打算继续私人情感关系,但希望保留纯粹的工作关系。对于老板而言,能有这样一个体面的台阶来结束这场闹剧,实际上是求之不得的。
同时也要向老板明确提出未来的工作空间需求。被卷入这种麻烦事虽然不必一味埋怨,但必须划清界限:工作上愿意继续全力配合,但私事必须彻底终止。这种如同欧洲荒诞电影般的混乱局面,不是任何人能够去接触和掌控的,千万不要继续泥足深陷。
小众婚礼的教堂场地选择
下一位提问者与对象准备结婚,亲戚朋友很少,性格比较内敛,不想把婚礼办成传统中式酒店酒席的模式,想找一个教堂举行仪式以增加神圣感,简单办一下,询问是否合适。
这当然非常合适。很多教堂平时的主要功能之一就是承办婚礼,只要不是周末的宗教礼拜时间,很多牧师都非常愿意为新人主持婚礼仪式,无论双方是否是基督徒。这种形式非常普遍且正常,完全可以去办。
容貌焦虑与相亲约会推进
下一位提问者是之前咨询过的二十五岁母胎单身男生。听了建议后开始尝试在社交平台和小红书上交友,但屡战屡败,基本处于“看得上自己的自己看不上,自己看得上的看不上自己”的状态。他发现网上看脸非常严重,想知道不以容貌见长的人该如何迈过第一关。
此外,他最近和同班几个女生约出去吃过饭,但没有心动的感觉,纠结是否应该继续推进关系、是否需要通过接触来日久生情。他平时不太擅长出门玩,也不清楚去店里能干什么,兴趣爱好也不重叠,不知道除了单纯吃饭聊天之外还有什么值得推荐的活动。
关于约会活动:单纯聊天吃饭确实不容易带动气氛,同城活动无非就是看电影、爬山、远足等户外活动。
关于外貌问题:并非仅仅是在网上相貌重要,而是当下整个时代就是一个图像时代和景观社会。过去电视和广告里充斥着好看的人,如今全网短视频乃至 AI 生成的虚拟形象全都是高颜值,整个社会对于外貌的阈值被不断推高,看脸的趋势是不可逆的。
对于不以容貌见长的人来说,想要过第一关,最直接有效的方式就是改善自己的外貌。现在的途径非常多:化妆、健身、穿搭、医美微整,都能带来立竿见影的效果。男生化妆和研究穿搭如今已经是越来越普遍的市场潮流,即便不化妆,仅仅通过身材管理和穿搭改善,就能解决很大一部分外貌问题,应当积极尝试。
分手后的情感抽离与投射
最后一位提问者与前任分手大半年,心情一直比较沉闷。前几周忍不住约对方见了一面,虽然随意聊了些日常、氛围看起来轻松,但能明显感觉到对方已经完全不在感情状态里,也并不关心自己的近况。
回顾这段感情,两人并没有成功建立起共同理解。过去吵架时对方总说“你不理解我”,但又从不真正展开细节,给人一种自我封闭、外部无法进入的感觉,导致提问者无法提供实质性的帮助。在这种状态下拉扯了一年多,最后对方越来越抽离并提出分手。
尽管已经沉郁了大半年,并且觉得自己对这段感情的失败原因有了足够的理性理解,但心情依然陷在里面出不来,在约会软件上对新的接触对象完全提不起兴趣。
这种情况的核心根源,往往在于当事人把过多的自我实现投射到了亲密关系之中,这种心理状态在感情经历中也是十分常见的现象。
感情中的自我实现与认可来源
把自我投射、把自我实践投射到感情这件事是超级无敌正常的。我们人在感情里就是需要自我实现,需要被关注。但是失败之后,这件事情要放下。为什么要放下呢?原因特别简单,这个世界有七十亿人。我不是在说两只脚的人很多,我的意思是,你不能够把认可捆在这一个人身上。除非你们有很好的承诺(commitment),否则你不应该认为全世界只有他的认可能够满足你,不要这样去想。认可还有好多其他的方面和方向。
所以你要理解一个事情,尽管你感觉已经对这段感情的失败有了足够的理解,但不要把它理解成一个“失败”。为什么你们分手就一定是你的失败呢?分手当然会对你的自我认可造成冲击,但你一定要意识到,这并不是获得认可的唯一方式。
反过来我也很理解,很多人在日常生活中是缺乏其他人认可的。因此在一段感情中获得认可,其分量会显得非常非常巨大,大到让他难以放下,确实会有这样的情况。在这个情况之下,你的问题其实不是你对这段感情的理解有多深,而是你获得认可的渠道和方式究竟是什么。
我现在甚至觉得,去从事一些特定的活动可能会有好处。因为在这个社会上有好多服务业是以提供情绪价值见长的。比如说健身私教,好多健身私教为了留住你、让你花钱,甜言蜜语,百般吹捧。当然也有那种很糟糕的、以骂人为主的教练,那种千万不要去,要去就找好的。这只是举个例子,有很多工作其核心价值就是提供认可。虽然健身按理说不应该如此,但我也不知道为什么,优秀的健身教练就是很懂得认可你。这种外部渠道如果能帮你补充一些认可,可能会让你更容易去理解现状,也更容易真正摆脱当下的困境。
现场问答与互动
再看一个问题。有观众提问:“我最近一直在反思自己沟通和价值观的问题。我发现在沟通时容易进入分析模式,对方表达受伤时,我第一反应不是回应情绪,而是分析为什么会这样。第二,我发现自己可以真诚地爱一个具体的人,也愿意照顾他,但一旦讨论到女性主义……”
这个问题我之前回答过。核心在于你去服务对方,而不是要求对方来服务你;不是说一味要求对方独立,而是你让他不需要那么紧绷独立,由你去服务他。这个问题之前已经讲过了。
非常抱歉,因为今天晚上这个时间,我跟我的 AI 约好了一个检查点,我先看一眼系统状态。四强型 DNG 小分子词典和第十五宫格,现在正在处理中。好,现在通过之后,请把上面我们需要安装的依赖全部装上,然后完成测试。这个事情进度可以加快一点,尤其是语音转文本(audio to text)部分,可以先装上拿来做一个测试,看看连接情况好不好。因为这个环节改善之后,我们的信息处理效率和信息的准确性会有很大提升。
平时我就是这样用 AI 的。这样讲话是不是很像在跟员工或者工作伙伴沟通?
经济数据平台与统计口径
回答下一个问题:“主播,你目前的中国真实数据计算平台搞得如何了?近日国家统计局公布青年失业率是百分之十七,这个指标明显不符合实际感受。你可以开通 AI 计算,告诉我们一个大概可行的统计口径和对应的真实青年失业率吗?”
这是个好问题,但答案是:不能。我的 AI 经济数据部分确实有了长足的进步,很快就可以和大家见面,里面补充了非常详实的数据。但关键在于巧妇难为无米之炊,目前能够提供的数据分析,依然必须建立在能找得到高质量原始数据的基础之上。
就比如中国的青年失业率,除了国家统计部门,除非你能够在中国开展极其广泛的抽样社会调查,否则没有任何方法能够给出一个相对合理的数量统计。关于这个问题我确实深入思考过,目前确实没有任何可靠的第三方方法去估算。所以我现在没有办法告诉你中国青年失业率到底是多少。
但是我可以通过数据回答别的问题,比如说“中国外贸还能持续多久”。这是一个大家都非常关心的问题,并且有相对高质量、详实的数据去支撑推演。因此青年失业率目前是个无法直接测算的问题,不过我马上要上线的第二版中国统计数据产品中,会包含非常详实、深入的外贸统计与分析。
政治体制与军队清洗逻辑
再看一个政治相关的提问:“上次提到如果在大选中有特定候选人组合会怎么选。如果把总统票投给卢比奥,但共和党基本盘受川普主义深度影响,必然会延续相当大的行政惯性,包括反移民、破坏北美自贸以及将战略关注点收缩到西半球和拉美。那你是否会选择对冲性投票,把国会票投给民主党参议员,还是选择三张联邦票全投共和党?”
如果做出这种选择,我肯定会选择分散投票,也就是共和党总统搭配民主党主导的国会,不可能把三张票全给同一个党派。但我也想指出,川普上台后推动了总统权力的极大扩张。在总统权力大幅扩张之后,我很怀疑共和党党纪目前对总统到底有多大的掣肘能力。事实上,总统对于党派内部的塑造能力是极强的。因此如果卢比奥真的有机会执政,情况也不见得完全无法把控。
稍等,我给手机充一下电。公屏有人说“中国又崩溃了”,这种老生常谈的话题不用我多说。
我们再回答五分钟问题,之后我得去跟 AI 处理事项了。我刚才看了一下后台,网络端显示有一长串待办事项需要我做决策,一共有整整十五件事情卡在决策列表里。我从来没有积累过这么长的决策队列,看来直播确实是堆积决策清单的高峰期。
下一题:“昨天问 ChatGPT 齐奥塞斯库是否也曾经频繁清洗军队,AI 给出的分析是肯定的,并认为齐奥塞斯库虽然通过清洗和秘密警察制衡军队,却没有成功把军队的利益与自己的个人统治深度绑定。因此在 1989 年民众抗议中军队倒戈,处决了齐奥塞斯库。接着问 AI,中国目前是否在做类似的事情?AI 分析认为当前军队党化的程度远远高于当年的罗马尼亚军队,高层对军队人事、政治和组织的控制也更加深入。你认同这种比较分析吗?如果未来出现大规模政治转型,是否有理由期待军队像 1989 年罗马尼亚军队那样拒绝执行镇压命令,甚至转向抗议者?”
当然不能抱有这种期待。我们跟罗马尼亚当时的情况有巨大的不同,最关键的一点是我们有充足的备份机制。首都附近驻扎着那么多部队,历史经验已经证明过,如果有将领不愿意执行命令,体制内多的是愿意执行的人。除非发生成建制的倒戈并与其他部队直接交火,但这在现实中是极难发生且几乎做不到的。
东欧和苏联在很大程度上仍然依靠领袖个人的政治手腕和威望来进行清洗,而当下已经完全实现了依靠制度机器运转的清洗模式。这不是单纯依赖领袖个人的意志,而是依靠中纪委、军纪委、国家监察委这一整套严密的制度化体系来完成自我审查、清洗和相互制衡。这种权力运行是完全高度制度化的,因此很难出现东欧当年的倒戈局面。
AI 协作理念:全流程自动化与风险控制
下面一个问题:“去年你提过 AI first 的观念,但我现在越来越觉得人类作为 AI 的约束构架(harness)越来越重要。你还认为 AI first 这个理念适合现在的 AI 发展吗?另外,我认为即便到了 AGI 阶段,也无法完全放手托管,因为现实语境是无法穷尽的。人类作为 harness 可能需要负责的部分比例会减少,但不可能实现完全放手。”
我当时提的 AI first 并不是一个抽象的哲学命题,它更偏向于一种实际的工作方法论。意思就是:如果你要做一件事,就尽量把它整体 AI 化,千万不要搞成“我自己做百分之八十,让 AI 帮我做剩下的百分之二十”。不要采取这种修修补补的辅助思路。如果你要做一个任务,应该设计一套自动化流程让 AI 从头到尾跑完。比如我想做数字分身,有些常规的、大家都能解答的通用问题,我就完全不介入,全权由系统生成。
这就是我说的 AI first 的本质:在构思工作流时把主次关系颠倒过来。不是思考“我在做我的工作、AI 来协助我”,而是“让 AI 把这项工作端到端完成,然后看人类在这个全流程中能在哪些关键节点发挥作用”。
不过这与你提到的约束控制并不冲突,我非常认可你对 harness 的观点。我现在越来越觉得目前的 AI 系统是非常脆弱且危险的。人类如果把极其关键的战略性资源调配和重大战略决策全权交给 AI,是一件极其危险的事情。比如涉及重大地缘冲突或军事行动的决策,如果直接交给 AI 模型去研判决断,风险是不可估量的。AI 潜在的失控风险依然非常大,全世界各个国家都必须严肃考虑并建立针对 AI 风险的控制机制。
至于评论区有些纯粹发泄情绪的无理言论,直接禁言踢出即可,毫无建设性的攻击没有任何讨论价值。还有观众问了一个很长的问题,讨论“一个人明知道自己很痛苦,也懂很多道理,但为什么就是做不到改变”。这个问题太复杂了,甚至值得单独做一期长篇问答来拆解,我们留到下一次直播再详细展开。
行业理解、好奇心与成就导向
我们来看今天最后一个关于职场发展的问题:“我一直在一个行业里工作,希望未来自己不只是一个机械完成任务的人,而是能够真正理解这个行业,具备独立判断、承担责任并创造价值的能力。但这几年工作下来我有一个困惑:虽然积累了一些工作经验,但这些经验好像并没有真正转化成自己的核心能力,过去很多时候只是在执行别人设定好的既定目标。我开始发现,真正的难点不在于掌握了多少存量知识,而是在面对复杂情况和不完整信息时,能否形成自己的独立判断。所以我想问,一个人如何能从一个单纯有经验的执行者,成长为真正独立创造价值的人?这种能力应该如何培养?是应该更多投身于具体真实的事情中,通过承担责任和不断试错来成长,还是应该先进入一个体系更成熟的环境接受正规训练?”
这个提问的切入点很有代表性。提问者希望自己超越基础的任务执行层面,去真正理解行业运作机制,从而能够独立判断并创造增量价值。
但我必须指出,要实现这种跨越,核心其实就在于三个字:好奇心。
你对你所从事的行业到底有没有足够强烈的好奇心?如果你对这个行业充满好奇,并且你本身就已经身处其中、拥有接触一手行业实践的机会,那你现在按理说应该已经是一个对行业有深入理解的人了。在一个行业里,不可能所有事情都要亲身经历过才能掌握,大量维度的认知必须依靠主动获取信息和知识去建立。只要你的好奇心足够强,你就不会仅仅局限在自己手头被分配的那点工作内容上,而是会自发地去探究上下游的关联、商业逻辑以及宏观环境的变动,从而自然而然地推导出对整个行业的深层理解。
世界上有很多人都在尝试理解各个行业、理解国家宏观经济甚至是地缘政治,他们当中绝大多数人甚至都没有机会进入这些领域的第一线。而你作为一个已经在行业内部、处于第一线的工作者,如果你真的渴望理解它,凭借一线的信息优势和好奇心驱动,你早该建立起这种理解了。懂得“眼高手低”在这里其实是一种重要的认知心态——眼界要放得足够高,去洞察全局,哪怕手头做的是基础的事情。
很多人嘴上说想要“理解行业并创造价值”,但潜意识里其实并不是单纯想要理解,而是急于通过某种显性的业务成就来证明自己。这种心态往往在无形中压抑了好奇心的发展。很多人会潜意识里觉得纯粹的好奇心不够实用,一心只想追求短平快、能立竿见影证明自身价值的路径。然而,这种急功近利的思维往往正是导致职业发展停滞不前的根本原因。在很多关键节点上,恰恰是那些看似“不实用”的广泛好奇心,才能把你的认知格局推向更高的台阶。
进入一个行业之后的认知成长,责任从来不在于外部公司,也不在于客观环境是否成熟,而必须由你自己完全负责。你需要认真审视自己的真实动机:你究竟是真的对这个行业本身抱有求知欲和探索兴趣,还是仅仅想要获得世俗意义上的成功与成就来证明自己?
这是两套完全不同的底层逻辑。追求成就是极其艰难的,因为商业成就往往呈现零和博弈的特征,在特定行业生态中尤其如此;而保持好奇心、提升认知深度,是一个人完全可以凭借自主意志去探索和完成的事情。
如果你真的想在未来的行业实践中建立独立判断、承担核心职责并创造出真实价值,最有效的方法不是等待环境赋予你机会,而是把你当前的工作流程整体改造成一个独立的约束构架系统(harness),主动将手头的事情系统化、工程化。
行业工作流与 Harness 化
Speaker 1 强调,现在关键还不是单纯的 AI 化,而是 harness 化,要把定制工作流程打造成属于你所在行业的专属流程。Speaker 1 直言,如果在行业里能成为第一个做到这一点的人,只要做到这一点,就一定会取得相应的成就。好,接着继续往下看。
现场互动与小狗展示
随后 Speaker 0 提到看看这类价格。现场中途出现了一些动静与互动,Speaker 0 对着旁边说道:“乖,去去去,不要吵了,快去啊。哎,喂喂,你这个小混蛋,你这小混蛋,你个小混蛋。”接着 Speaker 0 招呼着看小狗,表示看两个真好看就 OK。
Speaker 1 随即接话表示这里是一只小狗,Speaker 0 也跟着说小小狗。Speaker 1 表示我们来进入一段时间,Speaker 0 提到“推推 a 推推 ASM 二十期小小狗小狗”,并连声感叹这个小小狗真的非常好看。Speaker 1 也认真回应称这真不开玩笑,反问这确实是非常好看。
散会与关闭操作
最后,Speaker 0 表示差不多好了,Speaker 1 说明自己接下来要去跟人家开会。Speaker 0 回应好之后,Speaker 1 向大家道别:“下周见,周末愉快。”
Speaker 0 说拜拜,随后疑惑地询问“这玩意怎么关啊”。Speaker 1 跟着反应过来:“没关过哦,对对对,关过一次,关过一次,关过一次,拜拜。”两人就此结束了本次会议与连麦交流。