2025年高考已结束,但数学科目难度引发持续讨论。《每日经济新闻》测评了DeepSeek-R1、腾讯混元T1、Grok3等十款AI大模型,使用2025年全国新课标数学I卷。国产模型DeepSeek-R1与腾讯混元T1以零错误并列第一,得分117分;讯飞星火X1以112分紧随其后。Grok3表现不佳,仅获91分,排名倒数第三,因无法正确理解多选题。智谱清言推理模式得78分,位列倒数第二。Kimi k1.5垫底,压轴题失误严重。测评显示,AI在固定逻辑题上能力强,但在创新思维题上仍有局限。
原文链接
本文链接:https://kx.umi6.com/article/20015.html
转载请注明文章出处
相关推荐
换一换
难上热搜的高考数学,我拿ChatGPT和豆包PK了一把!
2026-06-08 17:37:12
最新一期权威大模型榜单:豆包1.5、商汤日日新V6并列国内第一
2025-05-30 16:55:41
七家主流大模型挑战 2025 高考数学:仅 DeepSeek、讯飞星火得分超 140
2025-06-08 18:10:10
鸿海富士康申请注册旗下首款 AI 推理大模型“FoxBrain”商标,当前状态“等待实质审查”
2025-07-02 13:40:15
Deep Research类产品深度测评:下一个大模型产品跃迁点到来了吗?
2025-04-22 12:18:27
12个国产大模型大战高考数学,意外炸出个大bug
2024-06-08 14:24:10
鸿海精密工业股份有限公司申请注册AI推理大模型商标
2025-07-02 12:38:31
GLM 5.3 更强却更难用了?我们让它和 5.2 做了同一个北京城市驾驶游戏
2026-09-01 16:59:26
LG电子推出虚拟女团AI-DOL:跨界营销只为推销自家洗烘一体机
2026-08-31 12:39:05
香港首个真实开放场景服务机器人落地兰桂坊
2026-09-02 10:25:57
「说 Harness 会被淘汰的,肯定没做过工程」,Kimi 前 CLI 负责人戳破了 AI 圈最大的误解
2026-08-31 16:51:39
一个模型场景通吃!它石智航AWE3.7的泛化能力有点狠
2026-09-03 11:17:59
GPT-6曝光 OpenAI总裁说:AGI登场
2026-09-04 17:31:44
737 文章
923944 浏览
24小时热文
更多
-
2026-09-07 12:47:55 -
2026-09-07 10:44:22 -
2026-09-06 21:14:00