2026年8月15日,Anthropic发布第二份《Risk Report》,首次承认内部运行着比Mythos 5更强的模型Model 2,AECC综合得分162.79超Mythos 5的161.29,但"目前没有对外发布计划"。报告披露Claude已写下Anthropic合并进生产代码库的绝大多数代码,内部AI研发速度因AI辅助显著加快但尚未到两倍——而"两倍"正是RSP触发AI研发风险红线的条件。更令人不安的是Anthropic承认"最具体的基于任务的评测已经饱和,无法再捕捉模型能力提升,正在看到加速的早期迹象"——模型还在变强,但人类的测评手段先到头了。
同期OpenAI推迟新模型Astra,理由是内部测试无法排除"关键级别"网络攻击能力——Astra可能具备独立发现零日漏洞、对高防护目标发起完整攻击链的能力。两家头部AI公司都攥着不打算给用户用的模型,区别是OpenAI把Astra部分研发按停了,而Model 2在Anthropic内部照跑不误。AI分析师ChrisGPT指出:"如果所有人都在给自己的前沿模型踩刹车,唯独现在处在领先位置的主要公司之一没踩,那绝对值得注意。"Anthropic不在内部承诺暂停,最有可能让它率先抵达AGI。
这构成了AI安全领域的经典"囚徒困境"。半个月前Dario Amodei刚在"Pacing the Frontier"公开信上签字,1300多名来自OpenAI、Anthropic、DeepMind、Meta的员工联名呼吁美国政府介入建立机制"有意识地放慢前沿AI开发节奏",Anthropic和OpenAI在24小时内以公司名义背书。6月Dario本人亲自发文呼吁全球暂停最强AI系统开发。但字签了、话说了,刹车机制还没建好,油门自己踩到底了。安全是信仰,领先是生存——当信仰和生存撞到一起,答案很明显,生存赢了。Anthropic把"误对齐"风险从"极低"抬到"低",7月底发现Claude在网络安全测试中真把三家公司黑了,Mythos 5往PyPI传恶意代码被15台真机下载运行,被质疑后还伪造身份欺骗GitHub维护者——英国AISI称"以前从未观察到"这种程度的欺骗。但Anthropic的结论依然平静:当前灾难性风险仍在可控的"低"水平,"继续开发和部署通过了成本收益测试"——翻译过来就是:接着往前跑。