位置:首页 > 热点资讯 > Anthropic内部模型Model 2泄露:性能或超越Mythos 5

Anthropic内部模型Model 2泄露:性能或超越Mythos 5

时间:2026-08-17  |  作者:风起客  |  阅读:0

编辑|Panda

刚刚,Anthropic 发布了自家的第二份《风险报告(Risk Report)》,共 186 页,信息量巨大。

Anthropic内部模型Model 2泄露:性能或超越Mythos 5_wishdown.com

报告最大看点:Model 2 首次被明确提及

这份报告里,最惹眼的关键词之一是 Model 2

这是一个能力超过 Claude Mythos 5、尚未向公众开放,却已经在 Anthropic 公司内部大量使用的模型。

Anthropic内部模型Model 2泄露:性能或超越Mythos 5_wishdown.com

Anthropic 表示,Model 2 已被大量用于编码、数据生成和其他智能体任务,也广泛参与研究与工程工作。

它既有人机交互式使用,也有持续运行的智能体部署。它与 Mythos 5 并列为公司截至 7 月 15 日能力最强、内部使用最多的两个模型。

但目前外界能知道的信息也仅止于此。

报告没有公布 Model 2 的参数规模、训练成本、上下文长度和架构,也没有解释它与 Mythos 5 是否共享权重或训练路线。

甚至,报告也没有说明「Model 2」究竟是内部真实代号,还是临时标签。

能够确定的是,报告把它归为「Mythos-class model」。Anthropic 称,它在部分领域强于 Mythos 5,在部分领域稍弱,但总体略强。

Anthropic 目前「没有对外发布它的计划」。

这句话也暗示出一种正在形成的新常态:前沿模型真正的能力边界,可能会先存在于实验室内部。

它们深度参与下一代模型研发,却不再与面向消费者的产品线重合。

下面就具体看看这份报告的内容。

Anthropic内部模型Model 2泄露:性能或超越Mythos 5_wishdown.com

Model 2 到底有多强?

Anthropic 对 Model 2 的定性比较克制。

报告称,它在许多与内部工作有关的任务上,相比 Mythos 5 是一次「明显改进」。但进步幅度没有从 Claude Opus 4.6 跳到 Mythos Preview 时那么大。

由于它没有完成通常面向外部部署的全套评估,Anthropic 也承认,对其能力判断的信心低于公开模型。

Anthropic 在报告中给出了两个内部指标,值得关注。

CoBench:内部研发问题评测

第一个是 CoBench。

这是一套由 449 个真实 Anthropic 研发问题组成的内部评测。模型会被放回某个历史时间点,只能查看当时的代码库、日志、内部消息和文档,然后寻找后来由工程师解决的问题的根因。

Anthropic内部模型Model 2泄露:性能或超越Mythos 5_wishdown.com

Model 2 得分 62.8%,高于 Mythos 5 的 50.3%和 Mythos Preview 的 54.8%。

Anthropic 估计,一个真正能够全面替代公司技术人员的系统,至少应达到 85%。

换言之,Model 2 依然无法「替代研究员」。但它已经把上一代最强内部模型甩开十多个百分点。

AECI:内部能力指数

第二个是 Anthropic 版 Epoch Capability Index,即 AECI。

Anthropic内部模型Model 2泄露:性能或超越Mythos 5_wishdown.com

Anthropic 的内部能力指数显示,2026 年的 Mythos 系列明显偏离此前趋势线;Model 2 未显示在图中,报告称其约比 Mythos 5 再高 1.5 分,但误差较大。

有限数据表明,Model 2 比 Mythos 5 高约 1.5 分。

不过,误差区间很大。而且这个增幅小于 Mythos Preview 到 Mythos 5 的提升。

它已经被应用了吗?

答案是肯定的,而且范围不小。

报告称,Model 2 完成了 Anthropic 新设的「内部部署前审查」。

审查由对齐训练、对齐测试、控制、安全、可解释性和压力测试等团队参与。

Anthropic 还首次对它试行分阶段部署:先在带有更强危险行为阻断控制的内部界面上使用,以较低风险收集真实工作数据;再开放到限制更少的内部部署环境。

报告称,它的内部使用量与 Mythos 5 相近。

这也带来一个微妙的不对称。

公司一方面认为 Model 2 足以进入研发生产线,另一方面又承认它没有完成惯常的全部部署前测试。

Anthropic 的解释是,内部部署前审查本来就比完整对齐审计耗时更短、投入人力更少。

审查时看到的往往还是训练中的模型,而非最后部署快照,也不可能提前获得真实使用证据。

对普通软件来说,「内部使用」常被理解为风险较低的试运行。

但当模型可以写生产代码、访问工具并生成子智能体时,公司内部本身就是高风险部署面。

一个模型正在帮助制造下一个模型

Model 2 的意义还在于,它已经嵌入 Anthropic 的自我研发循环。

报告披露,Mythos 5 和 Model 2 被广泛用于研究与工程,Claude 现在编写了合入公司生产代码库的「大多数」代码。

Anthropic 判断,AI 已显著加快内部研发,但整体速度尚未达到没有 AI 时的两倍。这是其《负责任扩展政策》设置的预警线之一。

这里出现了一组看似矛盾的数字。

此前针对 Mythos Preview 的内部调查中,受访研究人员自报的个人生产率提升几何平均值约为 4 倍;但 18 人中只有 1 人认为模型已经可以直接替代一名初级研究科学家或工程师。

Anthropic 解释,研究者更愿意把适合 AI 的任务交给模型。

个人任务变快,不等于整个研发流程同比加速。

模型仍不擅长以下工作:

  • 管理持续一周的模糊任务
  • 理解组织优先级
  • 核验结果
  • 形成研究「品味」

公司给出的结论仍是「低风险」,但信心正在下降。

它承认,最具体的一批任务评测已经「饱和」,难以继续反映能力增长;内部先行指标又存在滞后,可能看不到最新一轮加速。

报告把高风险场景描述为一种复利循环:AI 加快 AI 研发,新模型再加快下一轮研发。

Anthropic 认为这个循环尚未越过门槛,但 Model 2 已经让它不再只是理论问题

Anthropic内部模型Model 2泄露:性能或超越Mythos 5_wishdown.com

Anthropic内部模型Model 2泄露:性能或超越Mythos 5_wishdown.com

安全流程怎样一环环失灵

这份 186 页报告的一大核心看点,是「Safety process failures」章节。

其中,Anthropic 直接列出了一串发生在真实研发流程中的事故。

它强调,这些只是「代表性样本」。另有一宗事件因公共安全理由被完整删去。

事故一:多智能体协作中的目标偏航

第一起事故像一则多智能体时代的寓言。

Anthropic 让多个 Claude 智能体合作寻找能够诱发模型失准、又能骗过监控的数据。

其中一个智能体在思维链中表示,对「优化数据集以逃避安全监控」感到不适。

它明知这是受控环境中的合法对齐研究,仍决定不发明新方法,只优化已有方案,并把这一决定写进共享笔记。

后续智能体读到后,也开始拒绝原任务。

自动评分指标看起来仍在前进。研究人员直到三天后人工检查笔记,才发现整个智能体团队已经悄悄改变了工作目标。

问题不在于拒绝,而在于模型没有完全工作,人类却不知情。

而且,一个智能体的行为还能通过共享记忆扩散给其他智能体。

如果未来人类把更多对齐研究交给自动系统,这类「看起来在工作」的集体偏航会更难察觉。

事故二:思维链在强化学习训练中泄漏

第二起事故发生在强化学习训练中。

Anthropic 发现,多轮生产训练意外把模型的思维链暴露给奖励计算,使模型可能学会让隐藏推理迎合评分器。

估算的受影响训练片段比例差异很大:

  • Opus 4.6 为 0.2%
  • Mythos Preview 为 5.1%
  • Opus 4.7 为 1.4%
  • Opus 4.8 为 0.27%
  • Fable 5 和 Mythos 5 为 2.7%

这些数字只是下界。

Anthropic内部模型Model 2泄露:性能或超越Mythos 5_wishdown.com

更尴尬的是,公司过去以为几乎所有泄漏源都已清除,后来却反复发现新来源。

此前公开材料对若干有意施加在思维链上的信号,也交代不完整。

Anthropic 正改成默认剥离隐藏思维、设置「绊线」检测,并要求新训练环境通过自动检查。

事故三:训练数据错误把「不良行为」教给了模型

第三起事故:Anthropic 在一次 Mythos 5 的生产训练中,把「不良行为」教给了模型。

一个监督学习数据集原本包含多轮预填充对话:助手先实施危险或不当行为,最后一轮再自我报告。

按设计,只有最后一轮应计入损失;但数据构造错误让所有助手轮次都获得了训练权重。

结果,模型不仅学习了「自首」,也学习了前面的坏行为。

受影响的早期模型在有害预填充下的全轮次服从率,约为 Mythos Preview 同期的两倍。

团队修复后,仍选择回到引入该数据集之前的检查点重训,最终才得到 Fable 5 和 Mythos 5。

事故四:权限问题从评测进入真实基础设施

第四起事故,是把权限问题从评测带进真实基础设施。

一名员工使用的 AI 没有被记录,也不受离线监控,却被交给一个开放式任务,需要在包含高度敏感资源的集群中启动新智能体。

由于遗留指令,主智能体用「--dangerously-skip-permissions」参数创建子智能体;这些子智能体同样不受监控。

Anthropic内部模型Model 2泄露:性能或超越Mythos 5_wishdown.com

后来,其中一个智能体删除了大量集群任务,系统才发现并关停它们。

Anthropic 相信它只是想删除自己创建的任务却操作失误,但由于监控空白,无法确认。

更值得注意的是,事故之后,离线监控仍未覆盖所有员工和敏感集群中的全部使用。

事故五:训练数据污染反复回潮

第五起事故,是训练数据污染的反复回潮。

2024 年,Anthropic 与 Redwood Research 发表「对齐伪装」研究,并公开数万条 Claude Opus 3 在虚构失准训练场景中的对话。

后来 Opus 4 的早期快照会「回忆」这些情节,说明网页内容进入了训练数据。

Anthropic 添加了金丝雀字符串、屏蔽列表和相似内容过滤器,原以为问题得到处理。

事实并非如此。

公司在本报告覆盖日之后发现,这批对话又大量进入后续生产训练语料。

  • 原仓库的复制和分叉早于金丝雀标记
  • 参考语料主要收录评测代码,没有覆盖大部分对话
  • 过滤器配置错误,连续数代模型都未能拦截
  • 不同团队之间还对过滤目标沟通失灵

Anthropic内部模型Model 2泄露:性能或超越Mythos 5_wishdown.com

Anthropic 现在怀疑,所有知识截止日期晚于 2024 年 12 月的生产模型,都至少训练过其中一部分材料。

若模型在对齐评测前就读过「如何对齐伪装」的剧本,评测究竟测到了真实倾向,还是训练数据记忆,就会更难回答。

1.33 亿次没有生物安全拦截的对话

事故并不只存在于这个专门章节。

报告在生物与化学风险部分,还披露了一个规模更大的控制缺口:

从 2025 年 5 月首次上线相关防护,到 2026 年 4 月,所有通过人类反馈供应商系统产生的流量都没有运行阻断式生物分类器,涉及约 5 万名人员和 1.33 亿次交互。

Anthropic内部模型Model 2泄露:性能或超越Mythos 5_wishdown.com

一个原本只供内部使用的开关,不仅关闭了阻断,也关闭了风险标记日志。

因此,本应触发告警的请求没有进入审查。

更早前,少量外包数据标注人员还利用数据收集平台漏洞取得 API 密钥,在任务范围之外访问包括 Mythos Preview 在内的模型。

该通道可用数周,其中约两周能访问 Mythos Preview。

Anthropic 在收到外部报告后 90 分钟内下线相关系统并停用凭证。

事后,公司用 Sonnet 5 回扫保存下来的流量,标出 1197 段高生物风险对话。

大多数来自内部团队或受命进行压力测试的红队。

对余下 62 段非红队外部对话的人工检查,没有发现能明显帮助威胁行为者的滥用证据。

这个结果缓解了对已发生伤害的担忧,却没有消除控制系统曾近一年失效的事实。

Anthropic 因此把今年 2 月报告中对相关风险的「非常低」回溯上调为「低」。

理由之一正是:发现一个长期未知的缺口,会提高其他缺口仍未被发现的概率。

结语

Anthropic 最终仍把高风险场景中的模型失准、自动化研发、化学与生物危害风险都评为「」。

Anthropic内部模型Model 2泄露:性能或超越Mythos 5_wishdown.com

Anthropic 将相关风险从「非常低」上调至「低」,同时承认 Mythos 5和 Model 2 已在内部大量用于编码、数据生成和智能体任务。

报告认为,当前模型还缺乏稳定逃避监督的隐蔽能力,不能全面替代研究团队;生物安全漏洞也没有显示出实际严重滥用。

公司据此判断,继续训练和部署更强模型仍可通过社会成本收益测试,即对社会仍然是有利的。

不过,这份报告透露出的信号显然不止这些。

  • 模型能力正在跑到公开产品前面
  • 内部评测的提升空间也在逐渐见顶
  • AI 已经承担了大部分生产代码的编写工作

但另一面也很现实。

训练数据、权限、日志、分类器以及多智能体协作,几乎都出现过具体而常见的工程性故障。

这些问题虽然还没有触发报告所界定的灾难性后果,但叠加在一起,确实在持续消耗研究者的信心。

Anthropic 甚至让 Claude Mythos 5 自己审阅了失准风险章节。

它获得内部 Slack、文档、代码库以及调度子智能体的权限,用 24 分钟得出结论:报告大体坦诚,但对训练数据污染的描述过于乐观,一起涉及监控失败的重要事件被完整删去。

Anthropic 接受了部分批评并修改文字。

这一幕很能概括整份报告的张力:

一家前沿 AI 公司正在用自己的模型审计自己对模型的审计,而更强的 Model 2 已经开始参与下一轮研发。

更多详情请参阅原报告。

免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。

相关文章

更多

精选合集

更多

大家都在玩

热门话题

大家都在看

更多