1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

标题:谷歌Gemini 2.5在小学数学题上翻车

大洋彼岸昨夜热闹非凡,谷歌推出Gemini 2.5,号称“最智能模型”,尤其擅长高级推理与编码,在AI排行中拔得头筹。Gemini 2.5的官方Demo展示了其生成曼德博集合、制作动画气泡图及设计像素风跑酷游戏的强大能力。此外,该模型面向普通用户免费开放。

然而,Gemini 2.5在实际应用中遭遇挑战。测试中,多个顶级AI模型面对简单数学题纷纷“折戟”。例如,一道竹竿能否通过城门的问题,让所有模型不约而同套用勾股定理,却忽视了现实的三维空间特性。最终,Gemini 2.5等多数模型未能给出正确答案。

在另一道关于鸡蛋的问题中,Gemini 2.5和DeepSeek R1准确抓住了“最多”的条件,给出了正确答案。而o3-mini、GPT-4.5和Claude3.7虽考虑了动作重叠,却忽略了“最多”的限制,导致出错。Grok3的回答更是脑洞大开,认为还能保留两个完整鸡蛋。

在涉及逻辑推理的渡河问题中,Gemini 2.5和Claude3.7 Sonnet思路清晰,成功解答;而o3-mini和GPT-4.5的回答则过于牵强,GPT-4.5甚至提出让船空载往返。Grok3与DeepSeek R1同样未能答对。

在涉及复杂情节的经济故事题中,Gemini 2.5、Claude3.7 Sonnet、Grok3和DeepSeek R1均得出正确答案,而o3-mini和GPT-4.5则深陷细节难以自拔。

在多模态测试中,Gemini 2.5、Claude3.7 Sonnet和Grok3成功识别图像并计算得出杯高,而o3-mini和GPT-4.5则胡乱作答,DeepSeek R1仅能识别图片中的文字,未能正确理解图像。

综合来看,Gemini 2.5的正确率高达80%,表现相对稳健。Claude 3.7 Sonnet次之,正确率为60%。相比之下,OpenAI的o3-mini和GPT-4.5则完全失手,正确率为0。

原文链接
本文链接:https://kx.umi6.com/article/16205.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
腾讯升级大模型研发架构 前OpenAI顶尖研究员出任首席AI科学家
2025-12-17 18:59:08
马年4大顶流模型会师阿里云Coding Plan开工!Token量大管饱,自由切换真香
2026-02-26 00:01:12
终于用上AI的公司 发现业务被大模型公司抢了
2026-07-19 14:15:02
美国禁掉Fable5后 智谱暴涨47%
2026-06-18 00:02:46
顶尖技术+标准产品+创新模式+可靠服务,打造大模型商业落地中国范式
2025-12-16 10:32:22
国产AI又一轮爆发 MiniMax M3大模型要来了:10-15倍性能改善
2026-05-27 12:26:00
终于要变聪明了!特斯拉官宣接入豆包
2026-06-24 15:38:03
阿里千问大模型换将,32岁林俊旸官宣告别
2026-03-04 10:27:38
上海制造,AI入魂:央国企率先“重用”大模型,自动化设备被换下
2026-07-17 18:46:05
「说 Harness 会被淘汰的,肯定没做过工程」,Kimi 前 CLI 负责人戳破了 AI 圈最大的误解
2026-08-12 00:01:28
全球大模型第一股要来了 智谱发布IPO招股书:代码能力并列全球第一
2025-12-19 23:17:39
腾讯AI下了一场「及时雨」
2025-12-19 10:42:16
美图吴欣鸿回应大模型竞争:美图应用数据仍在快速增长
2026-02-05 18:05:31
24小时热文
更多
扫一扫体验小程序