技术突破

小模型打赢大模型:Inherent发布Faraday智能体,270亿参数击败Claude Opus 4.8和GPT-5.5

2026年8月24日,伦敦AI初创公司Inherent发布AI智能体Faraday,在科学论文复现任务上击败了远比自己大的前沿模型。Faraday基于Qwen 3.6——一个仅270亿参数的小模型,而它的对手Claude Opus 4.8和GPT-5.5的参数规模至少在数千亿级别。在分布内机器学习任务中,Faraday在73%的任务上优于Claude,60%优于Codex;在分布外的AI科研任务中同样保持领先。平均来看,Faraday比Claude提升6%,比Codex提升8%。

Fadaray的设计哲学非常巧妙:它决定"做什么"但把代码执行委托给GPT-5.5 Codex。也就是说,小模型负责科学直觉、实验设计和研究方向判断——这些需要"研究品味"(research taste)的能力,而大模型负责把研究方向翻译成可执行代码。Inherent更看重的不是能否达到正确的数值结果,而是实验设计质量、科学严谨性、对原始研究的忠实度以及资源使用效率——这些综合品质被Inherent称为"研究品味"。Faraday通过强化学习训练,奖励信号来自复现结果与原始论文的吻合度。

这一结果的意义远超Faraday本身。它再次印证了此前英伟达AVO在ARC-AGI-3上的发现——模型参数规模不是决定性因素,智能体框架架构才是释放能力的关键。270亿参数的小模型配上好的框架能打赢数千亿参数的裸考大模型。更重要的是,Faraday展示了"小模型决策+大模型执行"的混合架构——用小模型的低成本和快速迭代做高层决策,用大模型的代码能力做底层实现。这种分工对AI产业的启示是深远的:未来最强大的AI系统可能不是"一个巨大的模型包揽一切",而是"多个不同规模模型各司其职"的编排系统。对于AI开发者和企业而言,这意味着不必一味追求最大模型——在合适的框架设计下,小模型也能发挥出超越大模型的能力。

← 返回AI热点列表