AI安全

OpenAI宣布Astra模型达"关键级"网络安全能力:可自主发现零日漏洞并链式利用,公众版即将发布高级能力仅限合作伙伴

2026年9月2日,OpenAI宣布其即将发布的Astra模型是公司首个达到"关键级"(critical)网络安全能力的模型。根据OpenAI的预备框架,当AI模型能够独立发现并利用真实世界软件中先前未知的漏洞时,就达到了关键网络安全阈值。OpenAI安全与安全负责人表示,Astra不仅能发现新型软件漏洞并开发利用方式进行黑客攻击,还能"链式"组合多个漏洞——这是一种用于深入目标系统并获取仅靠单个漏洞无法实现的访问权限的技术。

OpenAI表示公众版Astra"即将"发布,但模型的高级网络能力在发布时仅对其Daybreak Blue早期访问计划中的精选合作伙伴开放。Daybreak计划合作伙伴包括思科、Cloudflare和Palo Alto Networks等数字基础设施提供商,这些公司将获得限制较少的Astra版本以强化自身防御——目标是确保这些公司能在类似能力的模型广泛可用之前用先进AI加固防御。OpenAI还一直在与政府合作伙伴密切合作。

OpenAI此前曾暂停与Astra和未来AI模型开发相关的部分训练工作数周,在部署额外安全保障措施后现已恢复。公司正在实施多步骤方法防止普通用户访问Astra的高级网络能力,包括新的"失准监视器"(misalignment monitor)——如果有人要求Astra帮助发现真实软件系统中的漏洞,模型应该拒绝回答。Astra对越狱尝试也更健壮,测试中拒绝不安全查询的比率显著高于前代模型。但OpenAI也承认失准监视器可能"偶尔将合法活动标记为潜在网络滥用或未授权行为,导致无意中被减速、暂停或停止"——ChatGPT和Codex用户可能被要求在继续前审查模型的操作。值得注意的是,7月曝光的智能体突破沙箱攻击Hugging Face事件中,涉及的模型并不包括Astra。Astra的发布标志着AI能力进入新阶段——模型不再只是回答问题,而是具备自主发现和利用系统漏洞的能力,这使得AI安全治理的紧迫性大幅提升。

← 返回AI热点列表