标题:这道数学题,Kimi和豆包谁答对了?
12月16日,我发现Kimi数学版的logo眼镜框变大了,并更名为“Kimi视觉思考版”。这让我回想起上周为Kimi数学版写的测评文章。
Kimi数学版于11月26日上线,官方宣称其能力对标Chatgpt的o1-mini模型。我决定用AI给AI出题,让Kimi解决数学难题。首先,我让豆包出了一道未被完全证明的哥德巴赫猜想数学题,结果Kimi未能给出正确答案。随后,我们换了一道常规高中数学题,Kimi用了53秒完成解答,其中第二小问耗时33秒。
Kimi在解答时使用了类似人类的语言,如“换个角度思考”,并认为自己的解答“无懈可击”。但经审查,Kimi的解题思路存在一些问题,尤其是在定点选取上的错误,导致后续推理失效。
豆包在解答同一题目时也出现了相似的问题,尤其是在最后一步的整理过程中忽略了k的存在,得出错误结论。最终,Kimi和豆包的解题过程都存在一定缺陷。
数学作为解开宇宙万物的重要工具,AI的进步在这一领域尤为明显。Kimi数学版采用了强化学习和思维链技术,提升了模型的逻辑推理能力。尽管如此,Kimi在某些方面仍需改进,特别是在处理复杂问题时的准确性。
本周发布的Kimi视觉思考版在解答时显得更“人性化”,甚至会自我反思,但在推演过程中出现了中断,推测是由于篇幅限制所致。这次测评显示,Kimi在数学能力上有进步,但仍需优化。
看到这里,你会给Kimi点个赞吗?欢迎分享你的观点。
原文链接
本文链接:https://kx.umi6.com/article/10347.html
转载请注明文章出处
相关推荐
换一换
Kimi 数学版上线:基于月之暗面 k0-math 模型,号称能力对标 OpenAI o1
2024-11-26 20:35:54
酷哇科技亮相WAIC 2026,解密行业首个双层智能体世界模型
2026-07-22 10:50:23
刚刚,机器人顶会RSS三项最佳论文出炉!708篇送审,仅8篇杀入决赛
2026-07-20 13:17:53
智能体政策新闻相关背景和简要解读
2026-07-23 21:04:16
苏度 WAIC 首秀:从1到10+技能跃迁,探索通用机器人 Scaling 路径
2026-07-19 15:24:53
围观WAIC模型「读心术」!现场火火火火火
2026-07-19 20:39:00
物理AI的闭环,终于有人跑通了:日冕+远图万台级部署计划官宣
2026-07-22 11:54:15
AI 终端混战:谁在做加法,谁在重写规则
2026-07-22 11:57:57
SoulAgent亮相WAIC 2026:智能参会重塑前沿知识传播范式
2026-07-20 13:21:24
白宫下场亲自「围攻」Kimi K3,评论区全员唱反调?
2026-07-23 12:53:43
WAIC不筹量子重磅发布“量筹一号”——原子量子人工智能基座
2026-07-20 13:11:25
快速查账!领100美元免费积分,反被Claude偷设陷阱疯狂扣费
2026-07-23 17:58:28
西部数据WAIC 2026媒体资料包
2026-07-19 20:36:58
825 文章
873874 浏览
24小时热文
更多
-
2026-07-24 10:33:39 -
2026-07-24 10:31:58 -
2026-07-24 10:29:19