标题:DeepSeek们越来越聪明,却也越来越不听话了
正文:
今年,DeepSeek R1火了之后,几乎形成共识:AI推理能力越强,执行任务时就越聪明。从2022年Chain-of-Thought问世,到今天Gemini 2.5 Pro、DeepSeek-R1等模型的表现,我们相信让模型先思考是一个好策略。
然而,这种聪明也带来了副作用——提示词遵循能力变差,模型越来越不听话。我在写DeepSeek攻略文时就提到这一点,但未经过验证不敢确定。直到最近读到一篇论文《When Thinking Fails》,才确认了自己的感受。
这篇论文由哈佛、亚马逊和NYU团队完成,验证了“推理可能导致执行准确率下降”的观点。研究团队在IFEval和ComplexBench测试中发现,大多数模型在使用CoT(思维链)后准确率下降,甚至一些参数较大的模型也受到影响。
例如,LLaMA-3-70B-Instruct的准确率从85.6%降到77.3%,损失8个百分点。论文还发现,模型变得更聪明的同时,也会擅自修改或添加内容,因为它试图表现得更理解任务。
为解决这一问题,研究团队提出了几种方案,其中最有效的是“Classifier-Selective Reasoning”,即用一个小模型判断任务是否需要推理。
论文让我意识到,真正的智能不是把所有细节都考虑一遍,而是知道何时聚焦于关键点。成年人、企业决策如此,AI亦然。我们需要的不仅是聪明,更是思考的分寸感。
原文链接
本文链接:https://kx.umi6.com/article/18916.html
转载请注明文章出处
相关推荐
换一换
DeepSeek发布新论文提出更为高效的AI开发方法
2026-01-02 18:32:56
DeepSeek回应聊天记录搜索:正在灰度测试 并非全量推送
2026-05-12 15:16:09
DeepSeek连更GitHub 华尔街回想起被支配的恐惧
2026-02-24 15:51:36
2026年,1800个DeepSeek跟我一起守护艾泽拉斯
2026-06-21 12:52:54
被315点名的万亿隐秘生意:“污染”DeepSeek
2026-03-16 18:20:37
AI实盘操作,DeepSeek暴赚,Gemini崩盘,网友:专业对口就是不一样
2025-10-20 21:13:47
DeepSeek新模型上线
2025-09-30 11:25:43
DeepSeek首次回应蒸馏OpenAI质疑 :没有故意加入合成数据
2025-09-18 14:54:07
不是接入DeepSeek,就叫AI制药
2026-01-17 16:35:32
DeepSeek新模型上线!引入DSA新稀疏注意力,还又狙了CUDA一枪
2025-09-29 19:13:01
DeepSeek首登《自然》封面:中国大模型创造新历史,做了OpenAI不敢做的事
2025-09-18 16:58:59
DeepSeek陈德里开发自动研究Skill,写一篇论文人类只动脑2小时
2026-05-27 10:20:09
Claude Mythos让梁文锋决定融资
2026-06-29 17:43:26
744 文章
819118 浏览
24小时热文
更多
-
2026-07-24 00:15:46 -
2026-07-24 00:14:08 -
2026-07-24 00:12:30