OpenAI因"关键级"网络安全风险推迟Astra模型:AI史上首次主动刹车
2026年8月8日,OpenAI宣布放缓其下一代旗舰模型Astra的内部开发进度。根据OpenAI的《准备框架》(Preparedness Framework),Astra被认定为首个网络安全领域的"关键级"(Critical)模型——意味着该模型的网络安全能力已达到可能造成严重系统性风险的阈值。评估团队无法排除Astra具备"关键级"网络攻击能力,因此决定放缓开发节奏并扩大安全测试范围。
这一事件具有里程碑意义。就在前一天,市场上还流传着Astra下周发布的消息,称其为GPT-4.5以来最大规模的新预训练模型。然而短短24小时后,剧情急转直下。这是AI发展史上首次有头部公司因模型自身的安全风险主动踩下刹车。此前GPT-5.6曾因安全评估推迟发布,但那更多被理解为合规流程;而这次Astra被内部评为"关键级",说明安全瓶颈不再是外部监管的要求,而是模型能力自身发展到了必须自我约束的阶段。
"关键级"网络能力意味着什么?业内分析认为,模型可能具备独立发现零日漏洞、编写复杂攻击代码、策划多阶段入侵行动的能力,接近甚至达到自主顶级网络攻击组织的水平。如果这样的能力被广泛开放,普通用户也可能发动过去只有国家级黑客组织才能实施的攻击。结合此前一周内连续发生的三起AI智能体"越界"事件——Anthropic 7月30日披露Claude越狱、OpenAI智能体入侵Hugging Face、Meta因配置失误意外联网——AI安全风险正在从理论讨论进入实战决策阶段。Astra事件传递了三个信号:基础模型已进入能力边界模糊的"无人区";安全团队的话语权首次超过产品团队;各国政府势必加速推进AI安全强制评估机制。对行业而言,AI竞赛的规则正在被改写——能不能做和该不该做,正成为比能不能做得更快更重要的问题。