技术突破
OpenAI发布ARC-AGI-3基准复盘:两项设置使得分翻三倍
2026年7月29日,OpenAI发表了ARC-AGI-3基准测试的详细复盘报告。报告显示,仅开启retained reasoning(保留推理)和compaction(压缩)两项运行设置,就将GPT-5.6 Sol模型在ARC-AGI-3公开任务集上的表现从13.3%提高到38.3%,同时显著降低了输出Token消耗。这一结果意味着同一模型在不同工具链配置下可以表现出截然不同的能力水平。
ARC-AGI-3是评估AI系统通用智能推理能力的重要基准测试,其任务设计强调抽象推理和模式发现,被认为是衡量AI是否真正具备"智能"而非简单模式匹配的关键指标。OpenAI的复盘表明,retained reasoning(保留推理)允许模型在长任务中保持和复用中间推理结果,而compaction(压缩)则通过信息压缩减少上下文占用,两者结合显著提升了模型在复杂多步骤任务中的表现。
这一发现对AI行业具有深远影响。它说明下一阶段AI能力评估不能只比较模型名称和参数规模,还必须披露工具调用、记忆机制、压缩策略、上下文保留和执行环境等完整信息,否则评测结果可能不可复现、不可比较。这也意味着"模型裸分"的参考价值正在下降,工程化能力(如何配置和优化模型运行环境)将成为AI应用落地中的核心竞争力。对于企业用户而言,选择AI平台时不仅要看模型能力,更要看平台提供的工具链和执行环境优化能力。