标题:SFT非必需!推理模型仅靠RL也能获得长思维链能力,清华CMU团队破解黑盒
清华、CMU和IN.AI团队研究发现,长CoT(思维链)的涌现与训练计算量增加有关,但其触发条件尚不明朗。他们通过SFT(监督微调)和RL(强化学习)两方面探究长CoT的机制和优化策略。
主要发现: 1. SFT非必需,但简化训练并提高效率。 2. 推理能力随计算量增加,但非必然。 3. 可验证奖励函数对长CoT至关重要。 4. 基础模型具备纠错能力,但需大量计算来激励。
团队使用Llama-3.1-8B模型,基于MATH-500等基准测试,发现长CoT SFT显著提升模型性能,且有更大扩展空间。相比之下,短CoT SFT的效益很快饱和。
研究还发现,长CoT SFT模型通过RL进一步改进,而短CoT模型改善有限。RL需特定奖励机制以稳定思维链增长,如引入余弦长度缩放奖励和重复惩罚。
团队还对比了两种长CoT数据整理方法,发现从涌现长CoT模型提炼的数据表现更佳,且可通过RL显著改进。
原文链接
本文链接:https://kx.umi6.com/article/12949.html
转载请注明文章出处
相关推荐
换一换
MiniMax M1全球技术闭门会实录:RL、混合架构、长上下文的下一步
2025-07-22 13:32:06
SFT别急着接RL!你的多模态大模型可能一直在“带伤训练”
2026-05-17 12:36:43
全球首发技术路线+全域联盟双轮破局,AI for ADANES释放先进核能新质生产力
2026-07-20 18:27:07
WAIC之外,一张AI人才图谱正在知乎形成
2026-07-20 17:20:24
微软又给Windows找了个塞Copilot的地方:文件管理器新增快捷按钮
2026-07-22 20:13:24
WAIC 2026 | 面壁智能首个具身智能成果 MiniCPM-Robot 系列模型正式发布!
2026-07-22 14:00:55
“败家”的马斯克:卖车赚的钱 全烧给AI了
2026-07-24 00:14:08
供需失衡的窗口期里,商汤大装置把国产算力做成了正毛利生意
2026-07-19 15:20:50
百度文心助手任务Agent登顶国际权威榜单,超越Claude、GPT拿下全球智能体冠军
2026-07-22 16:04:26
史上首次!OpenAI模型失控自主越狱:只为偷考试答案
2026-07-23 00:21:20
阿里云:真武芯片超节点已成功适配Qwen3.8,上线百炼提供推理服务
2026-07-23 15:50:49
WAIC 2026|智象未来发布全球首个无限时长内容创作智能体——vivago R1
2026-07-20 14:15:54
苹果iOS 27开发者预览版Beta 4发布:国行iPhone期待的Siri AI继续缺席
2026-07-21 06:51:16
780 文章
847923 浏览
24小时热文
更多
-
2026-07-24 00:15:46 -
2026-07-24 00:14:08 -
2026-07-24 00:12:30