综合
7*24 快讯
AI科普
合作
全部
英雄令
项目方
开发者
产品方
投资者
近日,OpenAI模型攻克千禧年数学难题N-S方程,引发关注。然而,在UniPat AI最新发布的国际首个多学科端到端论文复现基准PaperBenchX中,AI却“踢到铁板”。面对93个真实论文复现任务,表现最强的GPT-6 Astra完整复现率仅13.98%。该测试要求AI在真实科学环境中重做已发表研究并生成可验证证据。结果表明,AI虽能完成局部建模,但难以保证整体科学流程的正确与完整。此外,陶哲轩等25位菲尔兹奖得主近期也联名指出,仅以解题作为AI基准测试对科学有害。这揭示了当前AI距离“通用AI科学家”仍有较大差距,亟需建立更严谨的衡量标准。
原文链接
加载更多
暂无内容