近日,OpenAI模型攻克千禧年数学难题N-S方程,引发关注。然而,在UniPat AI最新发布的国际首个多学科端到端论文复现基准PaperBenchX中,AI却“踢到铁板”。面对93个真实论文复现任务,表现最强的GPT-6 Astra完整复现率仅13.98%。该测试要求AI在真实科学环境中重做已发表研究并生成可验证证据。结果表明,AI虽能完成局部建模,但难以保证整体科学流程的正确与完整。此外,陶哲轩等25位菲尔兹奖得主近期也联名指出,仅以解题作为AI基准测试对科学有害。这揭示了当前AI距离“通用AI科学家”仍有较大差距,亟需建立更严谨的衡量标准。
原文链接
本文链接:https://kx.umi6.com/article/38190.html
转载请注明文章出处
相关推荐
换一换
17 岁少年利用 ChatGPT 编写恶意程序,窃取日本最大网咖 725 万会员信息
2025-12-29 17:33:01
OpenAI 回应 ChatGPT 出现广告:平台 95% 是免费用户,会坚守一些原则
2026-01-21 13:13:21
OpenAI 更新手机版 ChatGPT,现支持手动调节 AI“思考深度”
2025-12-30 09:10:29
OpenAI 升级 ChatGPT AI 助理,优先保护未成年人安全
2025-12-19 08:37:19
OpenAI官方教你8招玩透ChatGPT!
2026-07-17 13:32:58
AI倒查论文100年!99.2%的顶刊都有问题…
2026-08-11 00:05:52
黄仁勋:未来两三年90%的新知识由AI合成
2025-12-04 10:13:48
OpenAI 新功能曝光:代号“奏鸣曲”,猜测与 ChatGPT 音频体验有关
2026-01-19 19:09:37
ChatGPT“代写”誓词,荷兰一对情侣婚礼被法院裁定无效
2026-01-09 10:06:12
奥尔特曼称 ChatGPT 根除长破折号标点“顽疾”,用户可控 AI 输出风格
2025-11-15 15:57:34
OpenAI称将ChatGPT引入美国国防部通用人工智能平台
2026-02-10 15:22:03
OpenAI:ChatGPT“成人模式”预计 2026 年第一季度上线
2025-12-12 09:42:51
分析师:2030年前 OpenAI广告年收入有望达250亿美元
2026-01-20 15:14:56
793 文章
1083860 浏览
24小时热文
更多
-
2026-10-08 17:57:45 -
2026-10-08 17:56:09 -
2026-10-08 16:55:31