技术突破

AI自动同行评审测试:AI生成论文仅得2.47分,质量与可信度仍存争议

2026年8月3日,arXiv发布了一项关于AI科研能力的里程碑式研究。研究者将四个自主研究框架(AI Agent自主完成的科研项目)生成的论文,交由三个前沿大模型(GPT-5.6、Claude Mythos、Gemini 4)进行自动化同行评审。结果显示,AI生成的论文平均得分仅为2.47分(满分5分),低于人类论文的中位数。更值得关注的是,三个评审模型之间的评分存在显著分歧,对同一篇论文的评价差距可达2分以上。

这项研究的深层意义不在于AI论文得分低,而在于暴露了AI科研的两面性。一方面,OpenAI Astra以2000美元成本解决了10个十年以上未解的数学难题,Anthropic Claude Mythos以60小时攻破了NIST后量子密码候选方案——AI在某些垂直领域的科研能力已经超越了大多数人类研究者。另一方面,当AI被要求完成完整的自主研究流程(选题、实验、分析、写作)时,产出的质量并不稳定,评审模型之间的分歧也说明AI对"什么是好研究"缺乏一致判断。

这印证了Anthropic此前的判断:"发现不再是瓶颈,验证发现才是。"AI能快速生成大量科研产出,但验证这些产出的正确性和质量需要人类专家投入大量时间。Gartner预测到2026年底40%的企业应用将内置AI Agent,但超过40%的Agentic AI项目将在2027年前被取消——原因正是价值不清晰、成本失控和治理缺失。AI科研的"2.47分"提醒我们:AI是强大的研究助手,但距离"自主科研"仍有显著差距,人类专家的判断和验证不可替代。

← 返回AI热点列表