4月21日,OpenAI的o3模型基准测试成绩遭质疑。去年12月,OpenAI宣称o3能在FrontierMath上正确回答超25%的问题,远超对手。但Epoch研究所的独立测试显示,公开版o3得分仅约10%,低于预期。OpenAI称其高分基于更强计算资源,而Epoch认为测试设置或评估版本不同导致差异。ARC Prize基金会证实公开版o3为调整版,性能较测试版弱。尽管如此,后续o3衍生模型表现更优,OpenAI计划推出更强版本o3-pro。此事凸显AI基准测试的不确定性,类似争议在行业内愈发常见。
原文链接
本文链接:https://kx.umi6.com/article/17494.html
转载请注明文章出处
相关推荐
换一换
微软AI营收首度揭密:严重依赖OpenAI 营收占比或达70%
2026-08-06 09:24:31
一句「哈哈」引发的苹果OpenAI窃密大战
2026-07-16 13:42:09
刚刚,OpenAI首席未来学家离职!曾被马斯克骂蠢驴
2026-07-09 15:08:12
欧盟委员会对OpenAI开放新型ChatGPT模型访问权限表示欢迎
2026-05-11 20:28:29
OpenAI芯片核心叛逃Anthropic!就在量产前夜
2026-06-07 20:48:02
马斯克称OpenAI是自己的创意 现任CEO奥尔特曼是“小偷”
2026-04-29 14:26:51
DeepSeek单日吞下8万亿Token OpenAI被迫降价追赶
2026-08-03 16:11:17
奥特曼趁马斯克出差爆猛料:他曾想让子女继承OpenAI
2026-05-13 12:33:09
为了AI iPhone 苹果正式起诉OpenAI
2026-07-14 01:36:25
OpenAI三位高管同日离职
2026-04-21 00:33:46
从哈佛辍学的前OpenAI研究员踏足AI制药,拿下20亿美元估值:VC在赌什么?
2026-07-17 17:44:20
独家专访|苏炜杰加入OpenAI:Scaling Law撞墙后为什么需要数学家出手?
2026-06-29 15:36:01
郭明錤:OpenAI进军手机 正与联发科、高通合作开发处理器
2026-04-27 12:10:29
785 文章
1018737 浏览
24小时热文
更多
-
2026-09-06 21:14:00 -
2026-09-06 20:12:34 -
2026-09-06 20:10:47