北京时间4月17日,OpenAI发布多模态推理大模型o3,自称性能超越行业对手。然而,研究机构Epoch AI的第三方测试显示,o3在FrontierMath上的得分仅为10%,远低于OpenAI此前宣称的25%。Epoch AI认为,双方测试差异可能源于评估框架、测试时间和数据集的不同。此外,ARC Prize Foundation称公开版o3经过优化,性能不及预发布版本。基准测试争议正成为AI行业常态,近期xAI和Meta的模型也面临类似质疑。
原文链接
本文链接:https://kx.umi6.com/article/17500.html
转载请注明文章出处
相关推荐
换一换
马斯克起诉OpenAI OpenAI上市计划或遇重创
2026-04-28 17:29:04
OpenAI急眼了!四页密信怒撕Claude,80亿营收全掺水
2026-04-14 17:09:22
更多银行参与软银的400亿美元银团贷款 助其投资OpenAI
2026-04-30 16:34:37
像真人聊天!OpenAI发布GPT-Live:AI可同步听与说
2026-07-09 12:02:21
OpenAI正式发布GPT-5.5
2026-04-24 09:02:17
OpenAI三位高管同日离职
2026-04-21 00:33:46
诺和诺德宣布与OpenAI建立战略合作伙伴关系
2026-04-14 15:05:51
OpenAI官方教你8招玩透ChatGPT!
2026-07-17 13:32:58
中信证券:合纵连横PE巨头 OpenAI与Anthropic加速布局企业级AI市场
2026-05-15 08:31:57
塑料兄弟情!OpenAI怒斥苹果草率应付合作 反被苹果控诉挖走40名大将
2026-05-15 16:56:33
DeepSeek单日吞下8万亿Token OpenAI被迫降价追赶
2026-08-03 16:11:17
OpenAI狂砸500亿美元算力预算 AI军备竞赛全面升级
2026-05-07 12:17:00
报告:Anthropic企业采用率首超OpenAI
2026-05-14 13:40:50
770 文章
942370 浏览
24小时热文
更多
-
2026-09-06 21:14:00 -
2026-09-06 20:12:34 -
2026-09-06 20:10:47