2026年8月23日,三条线索共同指向一个深刻的产业转折——AI的瓶颈正在从"模型够不够强"转向"框架能不能把模型潜力释放出来"。第一条是英伟达AVO在ARC-AGI-3上拿满分:同一个Claude Opus 5,裸考只有30.16%(还是官方认证榜第一名),配上AVO智能体框架后直接100%——25个游戏环境183个关卡全部通关仅用6624步。英伟达的做法是不碰模型权重,只在外面加一层壳——记忆管理、探索策略、错误修正、技能积累,就把同一模型的表现提升了两倍以上。ARC-AGI-3的三类典型错误(局部看懂全局没懂、陌生机制往熟悉游戏套、过关了但没学会)恰恰是智能体框架需要解决的问题,而不是模型本身的问题。
第二条是Anthropic内部Claude值班系统的公开。这套系统运行数月,每起突发事故第一波分析全出自Claude——最快4分钟锁定原因14分钟出态势报告。Claude Tag通过MCP接了Grafana、Datadog、PagerDuty、GitHub、Kubernetes全套工具,遵循检测分诊修复验证四步运转。最震撼的是lessons.md:每次事故后Claude默默追加记录,下一次调查开工第一件事就是通读这个文件。人类工程师Sachin因为跳过监控指标直接下结论判断错误,Claude就在lessons.md里写下"先查数据,再建理论"——AI给创造它的工程师上了一堂课,而且这条教训会被未来每一次调查反复读到。Anthropic工程师每季度产出代码达2021-2025年的8倍,超过80%由Claude编写——唯一能跟上AI编程速度的只有AI CI管线。
第三条是Axiom Math完成246定理的形式化验证。25岁广州女孩洪乐潼创立的公司用多智能体系统(Auto-formalizer补全跳步、Conjecturer生成中间引理、核心引擎搜索证明路径、Auto-informalizer翻译成人话),把14章132页的人类数学证明全部分解为Lean 4代码并验证通过。成立一年估值16亿美元。Ken Ono教授最在意的不是数学本身而是安全——今天验证数学证明的形式化技术,明天就能验证AI写的代码是否正确。同日OpenAI下调GPT-5.6 Sol价格逾20%,价格战持续升级。这四条线索合在一起勾勒出新的产业图景:模型能力已经足够强大(甚至强到不能发布),真正的瓶颈在于如何用智能体框架、形式化验证、AI运维等"外层系统"把模型潜力充分释放出来。AI竞争的下一个主战场,不在模型参数规模,而在框架层。