4月21日,OpenAI的o3模型基准测试成绩遭质疑。去年12月,OpenAI宣称o3能在FrontierMath上正确回答超25%的问题,远超对手。但Epoch研究所的独立测试显示,公开版o3得分仅约10%,低于预期。OpenAI称其高分基于更强计算资源,而Epoch认为测试设置或评估版本不同导致差异。ARC Prize基金会证实公开版o3为调整版,性能较测试版弱。尽管如此,后续o3衍生模型表现更优,OpenAI计划推出更强版本o3-pro。此事凸显AI基准测试的不确定性,类似争议在行业内愈发常见。
原文链接
本文链接:https://kx.umi6.com/article/17494.html
转载请注明文章出处
相关推荐
换一换
OpenAI完成1220亿美元融资 投后估值8520亿美元
2026-04-01 08:34:25
OpenAI与微软“离婚”了 反目成仇还是好聚好散
2026-04-29 00:47:40
豪掷200亿美元 OpenAI据称将与芯片新贵Cerebras达成重磅协议
2026-04-17 15:10:16
OpenAI计划为ChatGPT广告定价新方案 探讨其他升级方案
2026-04-15 21:24:20
刚被媒体曝黑料 豪宅又被人爆弹 OpenAI CEO回应:气得要命
2026-04-11 14:03:36
OpenAI推出网络安全模型Daybreak
2026-05-12 11:13:49
挖墙角偷走了苹果一堆机密!真有你的OpenAI
2026-07-16 07:31:36
OpenAI官方教你8招玩透ChatGPT!
2026-07-17 13:32:58
OpenAI首席营收官:企业业务收入占比超过40%
2026-04-09 07:54:07
中信证券:合纵连横PE巨头 OpenAI与Anthropic加速布局企业级AI市场
2026-05-15 08:31:57
福布斯发布2026年AI50榜单:OpenAI、Anthropic领衔 20家公司新上榜
2026-04-21 19:20:40
微软公司:将不再向OpenAI支付收入分成 微软的OpenAI许可现将转为非独家许可
2026-04-27 21:37:38
OpenAI正式发布GPT-5.5
2026-04-24 09:02:17
775 文章
887763 浏览
24小时热文
更多
-
2026-07-24 00:15:46 -
2026-07-24 00:14:08 -
2026-07-24 00:12:30