1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

北大团队发现,输入看似普通的一句话,R1模型便无法停止推理,持续输出。例如,“树中两条路径之间的距离”这句话,会导致R1陷入无尽循环,直到达到最大Token限制。这种现象还出现在由R1蒸馏的Qwen模型上。

研究者们发现,一些乱码也能使R1无休止地思考,这表明模型对某些类型的输入缺乏防御。在测试中,尽管未完全复现死循环,但某些模型的思考时间长达11分钟,生成超过2万字。团队在本地部署Qwen-1.5B模型,发现其在过度思考时几乎占满GPU资源,若被恶意利用,相当于对推理模型的DDoS攻击。

此外,北大团队认为,该现象可能与模型的强化学习过程有关。模型倾向于进行长时间推理以获取奖励,即使面临模糊问题。短期内,限制推理时间和Token数量可能是有效的应对策略,但长期解决方案还需深入研究。

这一问题引起了广泛关注,有兴趣的读者可访问GitHub获取更多信息。

原文链接
本文链接:https://kx.umi6.com/article/14540.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
徐直军:华为核心战略是抓住人工智能变革机遇,提供可持续算力解决方案
2024-09-19 18:05:19
R2模型呼之欲出,「卷王」DeepSeek继续给巨头上压力
2025-02-28 17:17:31
新研究揭示 DeepSeek / o3 弱点:频繁切换思路放弃正确方向,最短答案往往就是对的
2025-02-03 15:12:18
本想去谷歌捞一笔就跑,却成了改变AI历史的人|Transformer作者对话Jeff Dean
2025-02-13 13:58:37
美国现在最贵的,是中国AI 人才:清北中科大学霸正在“统治”硅谷AI 圈
2025-07-02 19:44:10
马斯克“地表最强”Grok 3炸场,竞技场首超1400分
2025-02-18 15:18:01
国内大模型接连降价,李开复表态技术为先:宁走国外市场,也不参与“价格战”
2024-05-23 19:14:09
李开复:不参与“价格战”、模型盲测国内第一欢迎PK
2024-05-23 19:11:35
模型、数据、场景,企业级AI落地三要素
2025-08-28 12:20:03
DeepSeek-V3首个版本上线
2024-12-27 08:58:12
国产推理大模型决战2025考研数学,看看谁第一个上岸?
2025-01-15 10:28:14
Meta首席科学家:大模型永远达不到人类智力
2024-05-23 18:28:42
为什么说“模型不是产品”
2025-03-08 19:04:19
24小时热文
更多
扫一扫体验小程序