近日,随着AI推理模型的兴起,基准测试成本显著上升。据第三方机构“人工智能分析”数据,评估OpenAI的o1推理模型需花费2767.05美元,远高于非推理模型GPT-4o的108.85美元。类似地,Anthropic的Claude 3.7 Sonnet测试成本为1485.35美元,而其非推理版本仅需81.41美元。高昂的成本主要源于推理模型生成大量token,且现代基准测试更复杂,涉及多步骤任务。例如,OpenAI的o1生成超4400万个token,是GPT-4o的八倍。尽管模型性能提升,测试成本仍居高不下。AI初创公司“通用推理”的CEO罗斯·泰勒指出,MMLU Pro测试单次成本已超1800美元。专家警告,免费或补贴的模型测试可能影响评估公正性。截至发稿,相关机构正计划扩大测试预算以应对这一挑战。
原文链接
本文链接:https://kx.umi6.com/article/17078.html
转载请注明文章出处
相关推荐
换一换
消息称微软正开发内部 AI 推理模型,并测试 xAI、DeepSeek 等多种 OpenAI 替代方案
2025-03-07 23:15:11
OpenAI o3 模型遭质疑?第三方实测分数远低于自测成绩
2025-04-21 09:34:53
Geekbench AI 性能跑分工具 1.0 发布,支持 PC 手机全平台
2024-08-16 10:43:57
中国信通院牵头的大模型基准测试ITU国际标准正式发布
2025-04-11 14:56:48
消息称百度计划 8 月底前发布 AI 推理新模型,未来几个月推文心 5.0
2025-08-07 16:52:59
UL Solutions 推出 AI 文本生成基准测试,支持英伟达、AMD、英特尔三家显卡
2024-12-11 17:33:56
阿联酋推出低成本AI推理模型 宣称“性价比”超同行20倍
2025-09-09 22:23:30
具身智能领域首个行业标准正式发布
2026-03-26 22:25:30
黎曼猜想,AI推理模型的梗
2024-11-18 10:34:12
仅仅一天,Gemini就夺回了GPT-4o拿走的头名
2024-11-22 17:08:30
OpenAI o3 模型基准测试成绩遭质疑,实测分数远不及宣称
2025-04-21 08:32:30
阿里云通义团队发布AI推理模型
2024-11-28 16:33:43
多项力压 Grok 4、OpenAI o3,谷歌推出 Gemini 2.5 Deep Think 模型
2025-08-01 23:08:15
790 文章
958989 浏览
24小时热文
更多
-
2026-09-06 21:14:00 -
2026-09-06 20:12:34 -
2026-09-06 20:10:47