Gemma 4 真相:不仅是智能,更是自动化的“苦力” | 端侧模型会是 Token 黑洞的终结者吗? 人民公园说AI 2026-04-14

Gemma 4 开源与参数“水分”

[主持人]: Gemma 4 没多长时间就已经有 1 亿次的下载,我觉得水分有点大。这些标准是 Google 的标准,对以党员的要求要求自己。对,就这个事情,你指望它智能没用,这事情你要指望它能去做自动化,因为自动化是最烧 Token 的。我靠,那个简直就是 Token 黑洞。这老修得出结论:没大学生好用。

老修: 今天我们也换了一个风格,我跟老修在现场。我终于要来现场了。

[主持人]: 对对对。神游回去。你知道我们最近也是比较出名了,出名了呢,就是大家开始会提需求了。说:“哎,你们这个能不能不要跟三个人开腾讯会议一样?这个可不可以真的来线下录一下?”你们明明在现场,为什么要开这个?多录为了证明是现场的,我举一下这个杯子,这多角度的都是真的现场,不是合成的,不是没有 AI 参与。有人说看我们视频,看著看著感觉就好像 Token 在燃烧,你们几个是不是 AI 做的?他总觉得我们有人是 AI。今天真的证明我们是有场地的,是真人的。

[主持人]: 聊一下最近几个我觉得比较关心的事情,其实我也一知半解,但是我们刚好聚一起,就聊一下。最近还有一个很火,是 Google 的 Gemma 4 的开源。它的开源号称是很强的,我觉得它最重要的是把一个 Turbo 的算法也利用进去了。它二十几个 B 的小模型,能力差不多已经等于 600 个 B 左右的 DeepSeek,以及像 GLM-5 等等的能力,它的编程能力是很接近的。它才二十几个 B 就达到了,我们是 600 多个 B,差了二十几倍到三十倍。

[主持人]: 这个事情,当然实测并没有那么强,但是也没有那么拉胯。它官方视频下面,大家说别吹了。大家都觉得是吹,但它确实进步了。不过它讲的时候,确实是跟自己比的,拿了好多的基线是跟它的 Gemini 3 去比的。那些标准是 Google 的标准,你也不知道拿别的标准是什么样子。但至少除了跑分,现在也会拿很多新东西出来。这次 Gemma 这个,小苏这边也是最早在问我有没有试一下,我很关心这个事情。我当时看了一下参数和跑分,觉得水分有点大,但后面觉得还是试一下。至少我跑到手机上去跑,那个 APP 我挺喜欢的,就是 Google 的 Edge Gallery

移动端实测:发烫与选型的困惑

[主持人]: Edge Gallery 那个 APP 上去以后,给了我几个场景。虽然又是“谷歌风”,就像以前让我们选到底是 Think 还是不 Think,要 Deep Research 还是干嘛。上来又要选是 Chat 还是 Agent,有五六种选法,无力吐槽。上去了我也不知道选哪个模型,还好我们提前做过功课,知道最重要的就是那几个:2B、4B,还有 26B、31B。不管你怎么组合,它给了几个场景,刚上来都觉得有点难理解。但换上去之后至少能跑,虽然手机发烫,我手机一直发烫。

[主持人]: 我为什么关心这个呢?因为如果你真的像吹的那么牛逼,实际上我的“虾粮”问题就解决了。我的“虾”(指代某种自动化工具或设备)帮我做的一些事情其实还是很简单的。如果你真的能像你吹的那么强,而且现在不是说用 Ollama 也能够直接在你的“小龙虾”上面装 Gemma 4 模型了。实际用下来,我觉得这又回到一个悖论:你要云端还是本地?当云端好到一定程度、便宜到一定程度,没人去用本地了。就跟当时的云计算一样,一开始大家都会骂:“我他妈为什么去用那个云端呢?”现在我们都很正常地去用浏览器。

[主持人]: 坦白说,你真的以 Google 的标准要求它,Gemini 3 Flash 的速度跟 Gemma 4 差不多。我个人感觉没有多大区别,这证明它云端确实很快,而且更智能。后面我跟我们技术小伙伴聊了一下,他说有一个点我觉得还是蛮奇葩:你指望它智能没用,你要指望它能去做自动化。因为浏览器自动化UI 自动化动不动就让大模型去做,Codex 没两下就刷完了,额度瞬间用完。

煤油发电机与特斯拉储能:本地模型的定位

闲哥: 我说一个我特别亲身的感受,你可能特别有同感。这个东西特别像煤油发电机。当时咱不是做零售吗?有一次我去参加本地庙会,给了我一个摊位,但本地不给电,你需要自己带一台发电机,要不然只能卖不用电的东西。我就推了一台便携式小冰箱去,那是接电的小冰箱。这边特别兴煤油发电机,接上它能撑个 5 到 10 小时,不行再加煤油。我就觉得这种本地模型就像这个:你最好有一个应急时用,或者没事的时候省点电费。但你要说现在又有网,云端模型又接得上,这种时候小模型的作用就没那么大。但它本身绝对具备非常好的价值。

[主持人]: 闲哥,你这个比喻让我想到了 TeslaMegapack 储能。屋顶搞个太阳能,在那边收集免费的电储存起来,晚上车回来就充电。就像我们小区楼下总有人在晒被子,我让他挪开点,他说:“太阳又不要钱,你管我?”其实本地模型对我们而言更像这个。因为我已经有沉没成本了,无论是 iPhone、Mac,还是家里那些跑“龙虾”的服务器,钱都已经花了。只要在合理范围内,不要跑到机子死机,平时烧个 CPU 处理一些自动化任务,帮我收集信息、处理信息,那我很爽。因为我大部分的 Token 都花在浏览器自动化上了,它们真的很消耗资源。

老修: 没错,我有个具象的比喻。我是 Anthropic 的 Max 会员,一个月 200 美刀。它最近推了 Computer Use,除了浏览器还能操控电脑上的任何 APP。那个简直就是 Token 黑洞。我让它帮我收集几个微信公众号的信息做本地加工,主要是上网去爬,结果几天就把赠送的 1 万积分干光了,提示我要花钱买。1 万积分要 100 美金,我才用了一天。这玩意真用不起!但它属于量大但很笨的工作。如果本地模型虽然不快,但能跑两天跑出来,烧一点我本地的闲置资源,那是肯定 OK 的。

底线策略:模型压缩与“脏活累活”

[主持人]: 你们讲的在心理上属于“有总比没有好”的底线策略。但说实话,有多少人真的会手机断网去修图、问 AI?这种场景其实很少。我觉得真正有价值的场景是:以后像 Gemma 这种模型可能压缩到 2GB、3GB,就像一个 Photoshop 的大小。你就把它理解为电脑手机上必装的一个软件,但它不要承担全部工作。它专门做自动化,给 Claude Code 或者 Gemini 打下手,干一些脏活累活。路由过去让它去干,这是合理的。

老修: 对,比如我们事情搞完了,帮你剪剪视频、搞搞字幕。你下个剪映,肯定要下几个素材包,你就把它理解为一个默认的素材包。不要对它的智能有啥期待,但良心讲,它其实还可以,而且还是多模态,图也能理解。虽然现在资源有点吃不消,但我认为 6 个月到一年半内会有跳跃。如果不开源的版本可能会做得更好。

[主持人]: 为什么这个对 Google 特别重要?Google 最近特别拉胯。你知道每逢三四月,“清明时节雨纷纷,Google I/O 欲断魂”。Google I/O 之前这谷歌真的表现不佳。你看 Gemini 之前限额,最长竟然搞成 5 天才放一次水,后来被骂惨了才改成 5 个小时。如果你用过 Gemini 模型去干活,你会发现它有多拉胯,基本上是不可用的,在执行任务这一块有严重缺陷。

商业博弈:协议变动与“渣男”策略

小苏: 就算哪怕是 Gemma 4,我听到一个评论:大家从商业角度讲,说这就是个坑。你看 Gemma 前三代开源协议改了好几回,一度差点变样,现在到了 Gemma 4 又变成 Apache 2.0 这种开放方式。那你不怕到 Gemma 5 的时候,你用得很爽、设备都跑上去了,它又给你收紧协议?到时候你的工具链和服务器都得用它的。

闲哥: 谷歌就得像我一样做个“渣男”,脚踏五条船。首先,这东西本身就不是 ToC 的。协议对于技术小白来讲,最多就是个话题。我觉得 Google 在端侧的实验可能会种下一颗种子,就像蒲公英一样。万一真有人做出好东西启发了它,它马上可以变成产品级的东西。而且它现在在“小龙虾”这件事上已经落后了,现在就看谁 Token 烧得多。没准 3 个月后,有人用 2B 这种极小的本地端模型做出一个超级 APP,放颗卫星也未可知。

[主持人]: Google 这家公司不能用一般公司的角度去看,它是一个富豪,广撒网、多子多福。它挺像腾讯的,平时挺松散,一个项目一堆人在做。真的到了生死局,创始人出来搞一把。Gemini 最近的更新都在“雕花”,比如跟 NotebookLM 整合功能、升级语音模式,但正事都没做。

御三家的竞争:Agent-to-Agent 的未来

[主持人]: 我说的“正事”是工作面端。Claude Code 出来以后,OpenAI 也要放出一个集 ChatGPT、Codex 和浏览器于一身的超级 APP。但你看 Google 现在也就是放个风,实际上还没动作,可能远远落后。它去年的多模态超长上下文优势,现在已经被追平了,御三家全部都达到百万级上下文了。在干“脏活累活”上面,Gemini 真的不行。但这次放 Gemma 4 强调 Agent 执行能力,我觉得挺好,拿来做自动化的经济性最高。我反而期待 Google I/O 到时候放出一个 All-in-one 的 APP。

老修: 还有一个数据:Gemma 4 在端侧已经有 1 亿次下载,iPhone 比例应该不低,因为 2.6G 的包手机跑得很流畅。我感觉未来不会刻意讲端侧和对端了。就像 iPhone 一样,你不会觉得自己在用 AI,但到处都是 AI。就像 Wi-Fi 和移动网络切换,你感觉不到,它自动就路由掉了。

闲哥: 以后它在浏览器里用 Gemini,我们也感觉不出来。现在的端侧模型解决的是能耗和机能问题。其实端侧模型干的事情跟云端完全不一样,它可能在手机后台做自动化任务,或者优化电池管理、管理后台进程。它最终就是一个你看不见的 APP。

[主持人]: 它会在自己的生态里生长。这里面有一个共性,就是计算量和计算方式会有很大变化。很多东西不再是人直接去用,而是由 Agent 去用。现在的 APP 是为人设计的,有 UI、有操作流程,这对 Agent 极其不友好。Agent 觉得我们的交互非常垃圾,关键东西一句话能讲清,还得点好几个地方。现在讲究 CLI 重写。

[主持人]: 现在的 API 对 Agent 也不友好,因为健全机制太原始。理想状态是:你有代理,我有代理,我们授权给代理,代理之间自主交互。这需要 Agent 有身份、有权限范围。如果这些基础层做好了,Agent 的效率会提升非常多。

闲哥: 我不同意,我觉得大部分东西都不会变。这段时间我用“龙虾”的感受是:虽然有很多重复性工作可以交给它,但生活中 80% 的东西还是要自己去经历。很多 APP 最后会并行,效率类的用 CLI 或 Agent-to-Agent,但融合了体验的东西会变得更繁复,像画画一样,有各种抽象的风格。这种美是人类自己欣赏的,不是为了纯粹的效率。

[主持人]: 好,那这期节目就到这里。最近热点很多,我们也可能直播 Google 的 AI 大会。希望 Google “大善人”好人一生平安,也希望顶级的 Claude Code 和端侧模型合起来为我所用。这些东西不要等,赶快用起来。感谢大家收听,拜拜。

老修/闲哥: 拜拜。

📌 文中提及的人物和组织

公司/组织: Google, OpenAI, Anthropic, Tesla

产品/模型: Gemma 4, Gemini, DeepSeek, Claude Code, ChatGPT