OpenAI Astra被曝使用"循环深度"技术:推理过程更难监控,安全研究者警告"可扩展至不可观测"
2026年9月3日,就在OpenAI宣布Astra达到"关键级"网络安全能力后仅一天,The Information爆料称Astra使用了一项名为"循环深度"(Recurrent Depth)的技术。传统模型在生成下一个Token前,会让信息依次经过固定数量的网络层;而循环深度则让信息在同一组网络层中反复处理,相当于让模型在内部"多想几遍"。这项技术有望提升能力、降低成本,但也可能使模型的推理过程更难以被外部观察和监控。
该技术在OpenAI内部及整个行业引发了担忧。Redwood Research CEO Buck Shlegeris表示,虽然Astra当前对循环深度的使用可能不会立即消除可见性,但它建立了一种机制,这种机制可以被扩展到监控完全消失的程度。知名AI安全倡导者Zvi Mowshowitz警告,该技术有可能侵蚀包括OpenAI和Anthropic在内的实验室一直在努力建立的思维链可信度规范,如果没有可执行的限制,竞争压力可能迫使实验室为了性能提升而放弃可见推理。Redwood Research首席科学家Ryan Greenblatt也表达了类似担忧。
OpenAI回应称已限制Astra中循环深度的使用,Astra将保留可读的推理链并接受额外监控。公司强调Astra的循环使用是有限的,思维链仍然是可理解的。但安全研究者并不完全满意——核心关切不在于Astra当前的状态,而在于这种技术一旦被证明有效,竞争压力将推动所有AI实验室采纳并放大,最终使AI模型的推理过程完全不可观测。如果模型的"思考"完全在内部以非人类语言形式发生,安全监控系统将无法判断模型是否存在异常行为或欺骗性推理。这一事件发生在AI安全治理的关键节点——OpenAI刚在9月2日宣布Astra具备自主发现零日漏洞的能力,如果这种能力的推理过程又不可观测,安全风险将大幅升级。2025年1月DeepSeek-R1发布时,业界第一个把完整原始思维链通过API结构化开放给开发者,带动全行业向可观测推理发展;而Astra的循环深度技术如果被推广,可能逆转这一趋势。