技术突破
英伟达AVO刷爆ARC-AGI-3满分:华人班底183关全通,同一个模型从30分跳到100分
2026年8月23日,英伟达的通用编码智能体AVO在ARC-AGI-3基准上拿了满分!它在25个游戏环境里通关了全部183个关卡,总共只花了6624步,RHAE拿到100.00%。而此前单独用Claude Opus 5裸考成绩只有30.16%——那还是官方认证榜上的第一名。英伟达的做法是不碰模型,只在外面加一层壳——同一个Claude Opus 5,分数直接从30分跳到了满分。
ARC-AGI-3是出了名的"不讲武德"——把智能体直接扔进一个陌生游戏,规则和目标都不给,全靠自己按、自己看、自己猜。有的环境能上下左右挪,撞上蓝黑色方块画面就转90度;有的连走都不让走,只能点,靠点击把格子颜色循环成目标图案。每个环境至少六关,越往后越狠——第一关五步能过的第六关得走五十步。ARC Prize归纳出三类典型错误:一是局部看懂了全局没看懂,二是把陌生机制往熟悉的游戏上套,三是过了关却没学会——Opus曾经只用37步就打通了ka59的第一关,但对点击机制的理解从头就是错的,进到第二关还抱着那套错理论不放最后卡死。
AVO满分的意义远超ARC-AGI-3榜单本身。它证明当前最强模型本身可能已经具备解决复杂智能体任务的能力,但需要合适的"智能体框架"把这种能力释放出来。英伟达在不改动模型权重的前提下,仅通过智能体架构设计(记忆管理、探索策略、错误修正、技能积累)就把同一模型的表现提升了两倍以上。这也印证了此前的判断——AI能力的瓶颈越来越不在"模型会不会想"而在"智能体框架能不能把模型的能力充分用出来"。如果一个30分的模型配上好框架能考满分,那么模型能力评测的意义就需要重新定义——"模型裸分"和"智能体系统分"之间可能存在巨大差距。