2025年研究生考试结束后,清华SuperBench测评团队对多个大语言模型的数学推理能力进行了评测。测试结果显示,OpenAI的GPT-o1模型以140+的高分领先,智谱的GLM-Zero-Preview和阿里的QwQ分别位列第二、第三。测评团队采用了统一的网页端测试方式,确保了评测的公正性和准确性。测试发现,深度推理模型普遍表现优于基础模型,但OpenAI的o1依然处于领先地位。
原文链接
本文链接:https://kx.umi6.com/article/11673.html
转载请注明文章出处
相关推荐
换一换
国内模型进步显著 有望带来AI应用更广泛商业化机会
2025-02-05 09:01:46
6天连发6模型,阶跃稳稳蝉联多模态卷王
2025-01-22 12:56:12
阶跃星辰副总裁李璟:今年将是Agent爆发的元年
2025-02-23 18:03:49
Meta首席科学家:大模型永远达不到人类智力
2024-05-23 18:28:42
GPT未竟的革命,由o1接棒:或是LLM研究最重要的发现
2024-09-15 11:27:46
对话智源研究院副院长林咏华:当下已进入语言模型深水区 预计2025年会出现更多新的多模态模型
2024-12-20 16:36:40
实测新版LiblibAI:终于把模型、生图、工作流塞进一个碗了
2025-10-15 10:32:33
蚂蚁武威:下一代「推理」模型范式大猜想
2025-05-21 00:47:21
DeepSeek深夜发布多模态大模型 图像性能跑分力压OpenAI竞品
2025-01-28 04:39:04
斯坦福揭秘 o1-preview 软肋:数学竞赛题稍作修改,准确率骤降 30%
2025-01-31 17:59:25
华泰证券:云厂AI算力自用需求或超预期
2024-05-24 10:48:09
DeepSeek-R1、o1都在及格线挣扎!字节开源全新知识推理测评集
2025-03-07 09:31:19
WormGPT 卷土重来:Grok 等主流 AI 平台被“越狱”制造钓鱼邮件、恶意脚本等
2025-06-19 11:47:39
775 文章
972420 浏览
24小时热文
更多
-
2026-09-07 15:59:33 -
2026-09-07 15:57:28 -
2026-09-07 15:56:09