9月26日,OpenAI发布全新AI评估基准GDPval,用于衡量前沿模型在真实经济价值任务中的表现。该基准覆盖美国九大行业44个职业的1320项任务,由资深专业人士设计,确保真实性与复杂性。与传统评测不同,GDPval要求模型完成多模态交付物,如文件处理、幻灯片生成等。首轮测试显示,Claude Opus 4.1综合性能最佳,GPT-5在特定领域准确性领先。研究表明,前沿模型完成任务速度比专家快100倍,成本仅1%。但OpenAI指出,数据未包含人工监督等现实因素,且目前基准局限在一次性任务,未来将扩展至更复杂场景并开放部分数据集供研究。
原文链接
本文链接:https://kx.umi6.com/article/25970.html
转载请注明文章出处
相关推荐
换一换
OpenAI挖来了个F1级别车手搞公关
2026-05-27 15:32:34
马斯克称OpenAI是自己的创意 现任CEO奥尔特曼是“小偷”
2026-04-29 14:26:51
美国政府将干预新AI模型发布:全球五大前沿实验室均已加入
2026-05-06 17:28:57
A社化身A割!Claude官宣永久提额25%,结果到手反而少17%
2026-09-01 16:44:57
涨价浪潮下 DeepSeek推动AI“价格战”:百万Token输入0.25元
2026-04-26 10:07:20
DeepSeek单日吞下8万亿Token OpenAI被迫降价追赶
2026-08-03 16:11:17
OpenAI用1年时间证明 你并不用为AI换浏览器
2026-08-09 14:58:58
报告:Anthropic企业采用率首超OpenAI
2026-05-14 13:40:50
关于 Hugging Face 入侵事件,OpenAI 终于放出了时间线
2026-08-17 17:19:48
OpenAI狂砸500亿美元算力预算 AI军备竞赛全面升级
2026-05-07 12:17:00
OpenAI开创“算力换股权”玩法:奥尔特曼向数百家YC创企发出邀约
2026-05-20 17:49:51
中信证券:合纵连横PE巨头 OpenAI与Anthropic加速布局企业级AI市场
2026-05-15 08:31:57
谷歌掀桌,一口气甩出16个AI王炸
2026-05-22 12:45:33
842 文章
1015884 浏览
24小时热文
更多
-
2026-09-07 14:53:07 -
2026-09-07 13:49:31 -
2026-09-07 12:47:55