标题:新研究揭示DeepSeek弱点:频繁切换思路欠思考,最短答案往往就对
最新研究揭示,推理大模型在面对难题时可能频繁切换解题思路,导致“欠思考”。腾讯AI实验室、苏州大学和上海交大的研究团队分析了开源的DeepSeek-R1和Qwen QwQ系列模型。研究发现,模型在思考初期常走上正确路径,却很快转向其他思路,浪费计算资源,降低正确率。
尤其在解决数学竞赛题时,类o1模型在错误回答中消耗的token比正确回答多225%,思维切换频率增加418%。研究团队开发评估框架,发现许多错误回答中包含正确的思路,但模型未深入探索。
基于这些观察,研究人员提出了Underthinking Metric,评估模型推理效率。实验显示,所有测试模型均存在思维不足问题,尽管DeepSeek-R1-671B在某些数据集上表现更优,但其思维不足问题也更严重。
为解决这一问题,研究者提出“思路切换惩罚机制”(TIP),减少无效切换,提高准确率。在AIME2024测试中,加入TIP的QwQ-32B-Preview模型准确率从41.7%提升至45.8%,UT Score从72.4降至68.2。
此外,UC Berkeley教授Alex Dimakis提出“简洁解码”,通过选择token最少的答案,提高准确率,且无需重新训练模型。
原文链接
本文链接:https://kx.umi6.com/article/12495.html
转载请注明文章出处
相关推荐
换一换
Deepseek官网公布deepseek-v4接口文档
2026-04-24 11:10:00
梁文锋出资200亿!DeepSeek首轮创纪录融资500亿,V4.1定档6月
2026-05-09 11:07:00
DeepSeek更新GitHub仓库 新模型“MODEL1”曝光
2026-01-21 11:03:39
DeepSeek急招Agent方向!一口气放17个岗位,重度Vibe Coding优先
2026-03-25 15:37:07
DeepSeek被曝主动叫停了第二轮融资签约
2026-07-27 13:08:28
DeepSeek今晚的大更新 真的塌房了吗?
2026-08-14 06:58:02
深度解析:DeepSeek不差钱,为什么还要融500亿?
2026-05-09 19:34:13
刚刚,DeepSeek V4 系列更新,架构没变,Agent 能力为何大涨
2026-07-31 17:43:16
北大团队改造DeepSeek注意力,速度快四倍还不丢精度
2026-04-07 00:20:16
MAU被豆包反超,Deepseek挤了点牙膏
2025-10-21 15:28:27
梁文锋,Nature全球年度十大科学人物!
2025-12-09 10:25:17
腾讯与阿里巴巴洽谈投资DeepSeek 估值超过200亿美元
2026-04-22 19:27:03
智谱创始人唐杰谈 DeepSeek:很震撼,开启了“AI 做事”新范式
2026-01-12 09:23:20
876 文章
1065249 浏览
24小时热文
更多
-
2026-09-07 10:44:22 -
2026-09-06 21:14:00 -
2026-09-06 20:12:34