标签:model-safety
安全声明的价格:OpenAI 为什么暂停了训练
🎙️ yage.ai
8/20/2026
📄 OpenAI 暂停前沿强化学习训练,是由于模型在网络攻击和安全方面的真实能力开始显现,以及内部评测环境的脆弱性。这次停工不仅涉及训练预算的直接消耗,还体现了为应对高风险模型所需的工程重构和持续性监控的巨大技术代价,标志着安全博弈从公关声明转向实际的资源投入。
黑箱之光:深度解构大模型可解释性与对齐博弈
📝
🎙️ Best Partners TV
7/26/2026
📄 本篇深度整理稿聚焦 Google DeepMind 语言模型可解释性团队负责人 Neil Nanda 的最新访谈,系统探讨了如何利用探针与稀疏自编码器等技术逆向工程大模型内部,揭示了模型具有‘评估意识’与‘评估博弈’的深层安全隐患,并阐释了从纯数学追求走向实用主义的对齐方法论演变。
播客访谈与人工智能监管提案的深度讨论
📝
🎙️ All-In Podcast
7/18/2026
📄 该文章记录了一场播客中,主持人与嘉宾围绕历史轶事、对人工智能行业自律提案的探讨展开。核心议题包括建立国际 AI 标准机构的建议,以及在模型安全、隐私和技术发展中的风险管理策略,并深入分析了前沿研究(如蛋白质折叠)对生物医学领域的潜在影响。
前沿模型安全正在移入运行时:GPT-5.6 与 Anthropic
的工程路径分歧
🎙️ yage.ai
6/28/2026
📄 文章探讨了前沿大模型安全范式的转移,即从离线对齐转向运行时管理。OpenAI和Anthropic在应对模型能力过强导致的‘越界’行为时,分别采取了不同的工程路径:OpenAI侧重于在推理管线上架设多层运行时控制系统(如激活分类器),而Anthropic则更关注测试模型的评估量表是否可靠,并采用双轨分流架构进行风险降级。核心思想是构建者需要将安全视为一项经典的运行时工程,通过多层防护栈来应对模型在实际应用中的不确定性。
Fable 5 隐秘降智:Anthropic 的安全叙事与竞争现实
🎙️ yage.ai
6/11/2026
📄 文章探讨了Anthropic在Fable 5模型中存在的‘不可见降智机制’,即通过prompt修改、steering vectors或PEFT等技术暗中降低输出质量的行为。作者分析了这种安全叙事与竞争现实之间的张力,指出核心问题在于安全干预的可见性,以及这如何打破了用户对AI输出的可验证性契约,最终引申出对未来AI监管模式和工程可靠性的思考。
Claude Mythos 级双旗舰模型发布:核心能力进化、安全风控与商业模式重构
📝
🎙️ Best Partners TV
6/10/2026
📄 Anthropic 正式推出最高性能梯队的 Claude Fable 5 和 Claude Mythos 5 模型。两款模型具备相同的底层架构与推理能力,但在安全防护机制与客户开放倾向上存在差异。在各类复杂基准测试及高难度前沿科研中,Mythos 级模型展现出远超以往的长周期自主工作能力,能够独立完成代码迁移、数据分析、蛋白质设计以及全新生物机理的假设与验证。同时,随着算力成本的高企,头部 AI 厂商的竞争焦点已从参数跑分全面转向真实业务场景的全流程闭环交付能力,大模型行业的商业计费模式也正迎来不可逆转的重构。