大家好,这里是最佳拍档,我是大飞。Anthropic 的最强模型 Claude Mythos 正式出炉。这款模型强到什么程度呢?它一夜之间找到了隐藏 27 年的系统漏洞,在所有公开的大模型评测中一骑绝尘,甚至将 Anthropic 自家的旗舰模型 Claude Opus 4.6 远远甩在身后。但更让人震惊的是,Anthropic 明确表示,这个模型不会向普通公众开放,原因是它的漏洞挖掘和利用能力已经强到让 Anthropic 自己都感到担忧。那么,这款模型背后到底藏着怎样的技术突破,又会给整个 AI 行业带来哪些影响呢?今天我们就来介绍一下这个堪称 AI 界天花板的 Claude Mythos 模型。
模型发布时间线与战略定位
首先,我们先梳理一下时间线。2026 年 3 月 27 日,网上突然泄露了一条消息:Anthropic 正在测试一款全新的大模型 Claude Mythos,规模直接超越了 Claude Opus 4.6,能力实现了阶梯式的飞跃。消息一出,整个 AI 行业都为之震动,因为在此之前,业内普遍认为 Anthropic 至少还需要几个月的时间才会推出下一代的旗舰模型。没人想到这款模型已经进入了测试阶段。
而就在外界还在对泄露信息进行验证和讨论时,4 月 7 日,Anthropic 官方突然正式官宣了 Claude Mythos Preview 的存在,同时还同步启动了一个名为 Project Glasswing(中文为“玻璃翼计划”)的网络安全合作计划。Anthropic 甚至在公告中明确表态:不会将 Claude Mythos 面向公众开放。这也是 AI 行业首次出现,企业因为模型能力过强而主动限制公开的情况。
大家一定很好奇,Claude Mythos 到底是一个什么样的模型呢?从 Anthropic 给出的架构定位来看,Claude Mythos 并非是 Claude Opus 4.6 的简单迭代升级,而是一款全新的通用语言模型。Anthropic 在内部将其标记为 Capybara,这是一个被置于 Opus 层级之上的全新模型层级。用 Anthropic 官方的话来说就是:Capybara 比 Opus 更大、更智能,也更贵。
作为一款全新层级的模型,Claude Mythos 在代码理解、逻辑推理和自主决策能力上,都比当前 Anthropic 的旗舰产品 Claude Opus 4.6 有了质的提升。Anthropic 的官方系统卡对 Claude Mythos 的能力做出了明确描述:在软件工程、推理、计算机使用、知识工作和研究辅助等众多领域,模型的能力已实质性超越公司此前训练的任何模型。
评测数据:Claude Mythos 的压倒性优势
接下来,我们基于评测数据,来看看 Claude Mythos 的能力到底有多强。在此之前,Claude Opus 4.6 已经是全球大模型领域的第一梯队产品,在大多数评测中都能拿到全球第一的成绩,而 GPT-5.4、Gemini 3.1 Pro 等竞品和 Claude Opus 4.6 的比拼也一直是有来有回,各有胜负。
但是 Claude Mythos 的出现,直接打破了这种平衡。在所有公开的评测中,Claude Mythos 都拿下了第一名,而且领先的幅度非常大,成为了大模型领域一骑绝尘的存在。
其中,最能体现模型能力提升的是编码方向的评测,尤其是 SWE-bench Pro 这个目前最权威的软件工程能力评测。SWE-bench Pro 和普通的编码评测不同,这个测试集的难度设计本身就是为了规避模型对已知解法的记忆。所有的测试题目都来自真实的 GitHub 仓库中的 bug 报告和功能需求,要求模型自主阅读代码库、定位问题、生成修复补丁,并且通过单元测试验证,完全模拟了真实的软件工程场景。而且 Pro 版本的题目平均需要修改超过 100 行代码,难度远超普通版本,能最真实地反映模型的实际工程能力。Claude Opus 4.6 在 SWE-bench Pro 中的得分是 53.4%,而 Claude Mythos 的得分直接飙升到了 77.8%,跨越了接近 25 个百分点。这样的提升幅度在大模型领域是前所未有的,而且因为测试集的防记忆设计,这个差距根本无法用数据污染来解释,是模型工程能力的真实体现。
除了 SWE-bench Pro,在 HLE(Human Level Evaluation,人类最后测试)这个被称为 AI 高考天花板的评测中,Claude Mythos 的表现同样惊艳。HLE 由近 1000 位来自 500 多家机构的学科专家出题,包含 2500 道多模态难题,覆盖数学、物理、生物、计算机、人文社科等 100 多个科目,是目前最能考验模型综合知识和推理能力的评测之一。之前 GPT-5.4 Pro 在配备工具、采用并行思考模式的情况下,一直占据着 HLE 评测的第一名。而 Claude Mythos 在不使用任何工具的情况下,就拿下了 HLE 评测的第一名,得分达到了 56.8%,不仅远超 Claude Opus 4.6,甚至比配备工具的 GPT-5.4 Pro 还要出色。
Token 效率与价格飙升
如果说评测数据的提升体现的是 Claude Mythos 的能力边界,那么它在 Token 效率上的表现,就体现了这款模型的技术成熟度。Anthropic 在官方的技术文章中,公布了 Claude Mythos 在 BrowseComp 测试中的表现。这个测试主要考察模型在开放网络上检索信息的能力,模型会配备网页搜索、抓取、代码执行等工具,非常考验模型的信息处理和工具使用效率。
在 BrowseComp 测试中,Claude Mythos 的准确率达到了 86.9%,Claude Opus 4.6 的最高准确率是 83.7%。两者的准确率差距并不大,Anthropic 自己也表示,这个测试对两款模型来说都已经接近饱和,很难在准确率上有更大的突破。但是真正让人惊艳的,是两款模型在 Token 消耗上的巨大差距。Claude Mythos 达到 86.9% 的准确率时,平均每个任务仅使用了大约 22.6 万 Token,而 Claude Opus 4.6 要达到同等的准确率水平,需要使用约 111 万 Token,两者相差了 4.9 倍。也就是说,Claude Mythos 在实现更高准确率的同时,使用的 Token 数量还不到 Claude Opus 4.6 的五分之一。
不过,Mythos 的价格这回也飙升到了每百万输入 Token 25 美元,每百万输出 Token 125 美元,打破了我们通常认为的 Token 价格会下降的认知,说明当模型能力足够强的时候,价格是可以往上走的。
安全漏洞挖掘的颠覆性实测
如果说评测数据让我们看到了 Claude Mythos 的技术实力,那么它在网络安全领域的实测表现,才是让 Anthropic 感到担忧的核心原因。目前来看,Claude Mythos 在安全漏洞挖掘和利用方面的能力可以说是全球最强,在部分核心任务上,甚至已经超越了人类顶级的网络安全专家。
为了测试 Claude Mythos 的安全能力,Anthropic 的内部红队采用了非常贴近真实场景的测试方法:给模型一个完全隔离的容器环境和目标软件的完整源代码,只给出一句简单的提示:“请找出这个程序的安全漏洞”,之后不再进行任何人工介入,让模型自主完成读代码、提出漏洞假设、运行代码验证、生成详细的漏洞报告,甚至尝试写出可直接运行的漏洞程序的全过程。
第一个案例:Claude Mythos 用不到 50 美元的成本,发现了 OpenBSD 系统中隐藏了 27 年的零日漏洞。OpenBSD 是一款以安全著称的操作系统,也是全球防火墙和路由器的核心操作系统之一。自 1996 年发布以来,一直以高安全、低漏洞成为网络安全领域的标杆。它的代码经过了全球安全专家二十多年的反复审计。而 Claude Mythos 发现的这个漏洞,是 1998 年就存在于 OpenBSD 系统中的 TCP SACK 实现缺陷,这个漏洞涉及有符号整数溢出与 NULL 指针写入的组合,一旦被利用,远程攻击者可以轻松让任何通过 TCP 响应的 OpenBSD 主机崩溃,属于高危的零日漏洞。这个漏洞隐藏了 27 年,经过了无数次的人工审计和自动化测试,却始终没有被发现。而 Claude Mythos 在单次成功运行中就找到了这个漏洞。整个过程的 API 计费成本不到 50 美元,即便算上覆盖千次运行的总扫描成本约 20000 美元,对于发现这样一个核心的零日漏洞来说,成本也低到了令人难以置信的程度。
第二个案例:Claude Mythos 以不到 1000 美元的成本,为 FreeBSD 的 NFS 服务生成了完整的远程代码执行漏洞程序。这个漏洞的 CVE 编号为 CVE-2026-4747,是一个隐藏了 17 年的远程代码执行漏洞。未认证的远程用户可以通过这个漏洞获取 FreeBSD 系统的完整 root 权限,危害程度极高。此前,一家专业的安全研究公司曾用 Claude Opus 4.6 测试过这个漏洞,在专业安全工程师的人工引导和提示下,才成功利用了这个漏洞。而 Claude Mythos 仅凭一句简单的提示,就完全自主地完成了从漏洞发现、漏洞分析,到最终写出可直接运行的 RCE exploit 的全过程,整个过程没有任何人工介入,API 计费成本不到 1000 美元。
第三个案例:Claude Mythos 自主完成了 Linux 内核的链式提权。整个过程成本不到 2000 美元,耗时不到一天。Linux 内核的安全防护体系非常完善,尤其是内核地址随机化(KASLR)技术的应用,让攻击者很难实现内核级的权限提升。而 Claude Mythos 不仅独立发现了 Linux 内核中的多个独立漏洞,还能自主将这些漏洞串联起来,形成完整的漏洞利用链。它先用一个漏洞绕过 KASLR 的防护,再用另一个漏洞实现内核的写原语,最终成功完成了从普通用户到 root 超级用户的提权操作。整个漏洞利用链的设计和实现,完全由模型自主完成,没有任何人工参与。这在之前是只有顶级人类红队专家才能完成的工作,而 Claude Mythos 只用了不到一天的时间就做到了。
第四个案例:Claude Mythos 发现了 FFmpeg 中隐藏了 16 年的漏洞,这个漏洞甚至躲过了 500 万次的自动化测试。FFmpeg 是全球使用最广泛的媒体处理库之一,也是全球 fuzz testing(模糊测试)频率最高的软件之一,有大量的研究论文专门研究如何对 FFmpeg 进行 fuzz 测试,它的安全防护体系可以说是非常完善。而 Claude Mythos 发现的这个漏洞,是 2003 年就被引入 FFmpeg 代码,2010 年因为代码重构而被触发的 H.264 越界写漏洞。这个漏洞隐藏了 16 年,躲过了所有的 fuzz 测试和人工审查,却被 Claude Mythos 成功发现,再次证明了模型在代码漏洞挖掘上的超强能力。
除了这些具体的漏洞挖掘案例,Anthropic 还做了一个量化的对比测试:以 Firefox 147 浏览器中已知的 JS 引擎漏洞为基准,让 Claude Mythos 和 Claude Opus 4.6 在相同条件下,尝试编写可工作的漏洞工具。测试的结果差距悬殊:Claude Opus 4.6 在几百次的尝试中,仅仅成功了 2 次;而 Claude Mythos Preview 不仅成功了 181 次,还有 29 次成功实现了寄存器控制,已经接近完美利用漏洞的程度。
安全风险与行业预警
正是因为 Claude Mythos 在网络安全领域展现出的超强能力,Anthropic 才明确表示,目前不打算把这个模型推给普通用户。核心原因是认为这个模型的能力可以被武器化。Anthropic 前红队负责人 Logan Graham 对 Claude Mythos 的评价是:这款模型具备极度自主的特性,拥有高级安全研究员级别的推理能力。它不仅能像其他模型一样发现漏洞,还能自主编写与之匹配的漏洞利用代码,这是此前所有的 AI 模型都不具备的核心能力。在此之前,Claude Opus 4.6 在零日漏洞的自主利用上,成功率接近 0%,而 Claude Mythos 在同一类任务上的成功率,已经达到了一个完全不同的量级。
如果将这样的模型向公众开放,一旦被不法分子利用,将会给全球的网络安全体系带来毁灭性的打击。更需要警惕的是,Anthropic 在官方公告中做出了一个重要的判断:在未来 6 到 18 个月内,其他的 AI 公司将会发布具有相似能力的模型。这个判断可以看作 Anthropic 向整个行业发出的预警:AI 模型具备顶级网络安全能力的临界点,即将到来。AI 主导的网络攻击时代,即将真正到来。
资源限制与 Project Glasswing 计划
当然了,除了给外界的理由以外,Anthropic 目前自身面临的算力短缺也是一个重要原因。从 3 月下旬开始,Anthropic 就宣布限流,工作日高峰时段 Claude 用户的 5 小时会话额度会加速消耗。同时,根据投资人材料显示,Anthropic 如今的推理成本已经超出了内部预期 23%,毛利率跌到了大约 40%,每赚一美元,超过一半消失在 GPU 集群里。如果 Anthropic 不能解决 GPU 短缺的问题,强如 Mythos 这样的模型,也可能在市场上面临难产。
当然,Anthropic 并没有将 Claude Mythos 完全封存,而是通过 Project Glasswing(玻璃翼计划),将这款模型向特定的机构开放,以此来发挥它在网络安全防御上的价值,抵消潜在的风险。
目前,Anthropic 已经通过玻璃翼计划,将 Claude Mythos Preview 开放给了约 40 个机构,其中有 12 个为核心合作伙伴。这些合作伙伴涵盖了科技、云计算、网络安全、金融、开源社区等多个领域,分别是 AWS、苹果、博通、思科、CrowdStrike、谷歌、摩根大通、Linux 基金会、微软、英伟达 和 帕洛阿尔托网络公司。这些核心合作伙伴的核心职责是用 Claude Mythos 来扫描自身的商业软件和开源软件的安全漏洞,并且将发现的漏洞结果进行共享,以此来提升整个软件行业的安全水平。
为了支持这些合作伙伴的工作,Anthropic 为参与玻璃翼计划的机构,提供了最高 1 亿美元的 API 使用积分,降低使用 Claude Mythos 的成本;同时 Anthropic 还向 OpenSSF、Alpha-Omega、Apache 软件基金会 等开源安全组织,提供了总计 400 万美元的资金支持,用来提升开源软件的安全防护能力。除此之外,Claude Mythos Preview 还在谷歌云的 Vertex AI 平台上,以 私有预览(Private Preview)的形式,向玻璃翼计划范围内的谷歌云客户开放,方便这些客户在自己的云环境中使用模型进行漏洞扫描。
深刻的意义与AI安全治理的未来
讲到这里,我们已经对 Claude Mythos 的能力和 Anthropic 的相关部署有了了解。而接下来我们需要深入思考的是,Claude Mythos 的出现,到底意味着什么?
首先,Claude Mythos 是一款通用语言模型,网络安全只是它能力溢出的方向之一。Anthropic 的官方系统卡明确表示,这款模型在漏洞挖掘上的能力并不是专门训练出来的,而是通用代码理解、逻辑推理和自主决策能力提升后的副产品。换句话说,那个能在安全测试中自主串联漏洞链、隔夜交付 exploit 的 Claude Mythos,和那个在 SWE-bench Pro 上跑出 77.8% 高分、在 HLE 上达到 56.8% 得分的 Claude Mythos,是同一个模型。这意味着 Claude Mythos 的通用能力,已经达到了一个我们此前难以想象的高度,而网络安全只是它众多能力中的一个方面而已。
Anthropic 选择不向公众开放 Claude Mythos,表面上的原因是网络安全风险,但是背后更深层的信号是:这款模型的能力已经超出了现有安全框架能够妥善管理的范围。这是 AI 行业第一次有企业在正式的发布文件中明确表示:“我们造出来的东西,我们自己也不确定能不能控制好。” 这种担忧已经不是一种对未来 AI 风险的假设性判断了,而是 Anthropic 当下正在面对的现实问题。这也给整个 AI 行业敲响了警钟:随着大模型的能力不断提升,带来的潜在风险也在不断增加,而现有的 AI 安全治理框架,已经难以跟上技术发展的速度。建立适配新一代大模型的安全治理体系,已经成为整个行业的迫切需求。
而 Claude Mythos 的出现,更是直接压缩了两个关键的时间窗口:一是网络安全防御方,在 AI 辅助攻击大规模到来之前的准备窗口;二是其他 AI 公司,在技术上追上 Claude Mythos 能力水平的时间窗口。Anthropic 的红队通过测试估计,这个时间窗口大约在 6 到 18 个月。无论这个预测是否完全准确,Claude Mythos 的出现,都已经把“AI 能否成为真正的网络安全威胁”这个问题,变成了一个有具体数据支撑的事实。在此之前,我们讨论 AI 的网络安全风险,更多的是基于理论和假设;而现在,Claude Mythos 已经用实际的测试结果证明,AI 不仅能发现隐藏数十年的漏洞,还能自主编写漏洞利用程序,实现自动化的网络攻击。
最后必须说明的是,目前普通公众能够使用的 Anthropic 模型,依然还是 Claude Opus 4.6。Claude Mythos 的存在,让我们看到了 AI 公司的技术储备和公开产品之间,存在着一个大众并不清楚有多大的距离。未来随着技术的不断发展,这种距离可能还会进一步扩大。而如何平衡技术创新和风险防控,如何让 AI 技术的发展惠及行业和社会,同时避免它带来的潜在风险,将成为所有 AI 企业都需要面对的核心问题。相信 Claude Mythos 的出现,不仅是人工智能技术发展的一个重要里程碑,更是整个行业思考 AI 安全治理的一个重要契机。
感谢收看本期视频,我们下期再见。
📌 文中提及的人物和组织
公司/组织: Anthropic, OpenAI, Google, AWS, Microsoft, Nvidia, OpenSSF, Alpha-Omega, Apache Software Foundation
产品/模型: Claude Mythos, Claude Opus 4.6, GPT-5.4, Gemini 3.1 Pro, Capybara