9月25日,OpenAI发布新基准测试GDPval,评估其AI模型与行业专家的工作表现。结果显示,GPT-5在40.6%的任务中媲美或优于人类,而Anthropic的Claude Opus 4.1在49%的任务中表现相当。测试基于美国GDP贡献最大的九个行业,涵盖44种职业,包括医疗、金融和制造业等。尽管AI尚未全面超越人类,但进步显著:GPT-4o此前仅13.7%胜率,而GPT-5提升了近三倍。OpenAI首席经济学家表示,AI可帮助从业者节省时间,专注于更高价值工作。未来,OpenAI计划扩展测试范围,以覆盖更多复杂任务。
原文链接
本文链接:https://kx.umi6.com/article/25894.html
转载请注明文章出处
相关推荐
换一换
紧随 OpenAI 步伐,Anthropic 宣布上线 AI 医疗服务
2026-01-12 15:40:18
A社化身A割!Claude官宣永久提额25%,结果到手反而少17%
2026-09-01 16:44:57
OpenAI GPT-5 拥有博士级能力?谷歌 DeepMind CEO:无稽之谈
2025-09-14 17:44:15
GPT-5通关《宝可梦水晶》创纪录!9517步击败赤爷,效率碾压o3三倍!
2025-08-26 17:48:25
谁是最强“打工AI”?OpenAI亲自测试,结果第一不是自己
2025-09-26 14:31:48
Claude一个插件吓哭华尔街,软件公司集体暴跌,2万亿元一日蒸发
2026-02-05 20:07:14
10 万次 Claude 真实对话洞察,AI 平均可缩短工作任务时间约 80%
2025-11-26 12:42:50
Claude的脑子里,也长出了一块「意识」
2026-07-07 10:16:09
GPT-5攻入数学圈,证明定理快过博士生?网友热议AI新角色
2025-09-19 20:18:56
GPT-5.6一发布,Claude终于舍得重置Fable 5额度了
2026-07-10 18:04:41
Anthropic 用 AI“写”智能体,Claude 仅短短一周半时间做出编程助手 Cowork
2026-01-14 14:38:53
ChatGPT和Claude争了个寂寞!用户重叠仅11%,中国应用霸榜移动端
2026-03-11 16:12:21
商汤开源 SenseNova-SI 模型:能理解空间结构,号称多项评测领先 GPT-5
2025-11-11 00:37:55
745 文章
959238 浏览
24小时热文
更多
-
2026-09-07 14:53:07 -
2026-09-07 13:49:31 -
2026-09-07 12:47:55