乔木博客
全部
AI工具
AI教程
AI生成
AI资讯
健脑房
播客解读
论文学习
Claude Opus 4.8:一次难得诚实的小步前进
AI资讯
·
2026年6月2日
·
28 次阅读
·
约 4 分钟
原文:Simon Willison's Weblog
Anthropic 发布了 Claude Opus 4.8。
发布公告里有一句话,Simon Willison 特别喜欢:
"用户会发现 Opus 4.8 是对前代的一次小幅但实质性的改进。我们还有很多工作要做:我们正在开发并计划发布能以更低成本提供 Opus 同等能力的模型。"
一家 AI 公司,主动承认自己的新模型只是"小幅改进",够坦诚。
这次最重要的改进,不是能力,是诚实
大多数模型升级,说的都是跑分更高、推理更强、多模态更好。
Opus 4.8 的核心卖点,是它变得更不爱吹牛了。
Anthropic 在公告里说:
"AI 模型有一个普遍问题:它们有时会仓促下结论,在证据薄弱的情况下,仍然自信地声称自己取得了进展。早期测试者报告说,Opus 4.8 更倾向于标记自己工作中的不确定性,更少做出无依据的声明。这体现在我们的评测数据上——Opus 4.8 让代码缺陷悄悄溜走的概率,比前代低了约四倍。"
系统卡里还有一句更直接的话:
"Claude Opus 4.8 在六个模型里的错误率最低——这是衡量事实幻觉最直接的指标。它主要通过在不确定时拒绝作答来实现这一点,而不是通过答对更多问题。"
不知道的就说不知道,比猜一个听起来像对的答案,要有用得多。
规格没变多少,但有两个工程细节值得关注
和 Opus 4.5、4.6、4.7 一样:$5/百万输入 token,$25/百万输出 token。
Fast Mode 降价了,从之前的 $30/$150,降到了 $10/$50——不过 Fast Mode 目前只对研究预览计划的组织开放,需要联系客户经理申请。
上下文窗口还是 100 万 token,最大输出 128,000 token,知识截止日期同 4.7 一样是 2026 年 1 月。
两个工程上的新东西:
① 对话中途可以插入 System Message
以前的系统提示只能在对话开头设一次。现在 Opus 4.8 支持在对话中途的任意用户轮次后,插入新的 role: "system" 消息,动态更新指令。
对跑长对话、长任务的 Agentic 应用来说,这个功能很实用——不用每轮都重发完整系统提示,能节省 prompt cache 命中成本,也能降低输入费用。
② Prompt Cache 最小长度从 4,096 降到 1,024 token
门槛低了四倍,更短的 prompt 也能享受缓存优化。
对频繁调用的应用来说,这是一个实实在在的省钱点。
鹈鹕骑自行车:一个非正式的能力测试
思考档位
效果预览
low(极简)
medium
high
xhigh
max(最佳,花了 43 美分)
Simon 有个习惯,每次测新模型,都会让它用 SVG 画"鹈鹕骑自行车"。
这次他用五种思考强度分别跑了一遍:low、medium、high、xhigh、max。
结论是:max 档效果最好,但也最贵。
一次 max 档的生成,消耗了 25 个输入 token 和 17,167 个输出 token,总花费:43 美分。
思考越深,画得越像鹈鹕,也越烧钱。
一句话总结
Opus 4.8 不是一次革命,是一次把"诚实"当核心指标来调优的迭代。
它不会告诉你它做到了它没做到的事。
在 AI 普遍爱吹的时代,光是这一点,就已经够用了。
来源:Simon Willison's Weblog — Claude Opus 4.8: "a modest but tangible improvement"
© 2026
·
向阳乔木