1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

标题:SFT非必需!推理模型仅靠RL也能获得长思维链能力,清华CMU团队破解黑盒

清华、CMU和IN.AI团队研究发现,长CoT(思维链)的涌现与训练计算量增加有关,但其触发条件尚不明朗。他们通过SFT(监督微调)和RL(强化学习)两方面探究长CoT的机制和优化策略。

主要发现: 1. SFT非必需,但简化训练并提高效率。 2. 推理能力随计算量增加,但非必然。 3. 可验证奖励函数对长CoT至关重要。 4. 基础模型具备纠错能力,但需大量计算来激励。

团队使用Llama-3.1-8B模型,基于MATH-500等基准测试,发现长CoT SFT显著提升模型性能,且有更大扩展空间。相比之下,短CoT SFT的效益很快饱和。

研究还发现,长CoT SFT模型通过RL进一步改进,而短CoT模型改善有限。RL需特定奖励机制以稳定思维链增长,如引入余弦长度缩放奖励和重复惩罚。

团队还对比了两种长CoT数据整理方法,发现从涌现长CoT模型提炼的数据表现更佳,且可通过RL显著改进。

原文链接
本文链接:https://kx.umi6.com/article/12949.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
SFT别急着接RL!你的多模态大模型可能一直在“带伤训练”
2026-05-17 12:36:43
MiniMax M1全球技术闭门会实录:RL、混合架构、长上下文的下一步
2025-07-22 13:32:06
巨简单,更懂家!海信JUOS正式发布:行业首个家庭智能伴侣级AIOS
2026-09-02 10:24:20
严查!网信办处置一大批用AI生成数字泔水、儿童邪典视频账号
2026-09-02 11:27:30
《后西游记》爆火!官方出品纯AI 真人演员全失业
2026-09-02 19:46:27
GPT-6带火循环Transformer,阿里早已布局
2026-09-05 23:32:44
AIVC只是前菜!复旦提出生命算子,统一生命建模
2026-09-01 12:33:49
谷歌AI硬气一回:Gemini 3.8仅用15%价格接近Opus5 斩获8项编程第一
2026-09-03 00:58:51
黄仁勋140亿美元豪赌一只鸭
2026-09-04 17:33:09
GPT-6曝光 OpenAI总裁说:AGI登场
2026-09-04 17:31:44
没有全科优秀,具身模型别想进入百万小时
2026-08-31 17:52:44
姚班校友主导,Claude攻克费马大定理首个完整形式化证明
2026-09-05 10:04:54
A社化身A割!Claude官宣永久提额25%,结果到手反而少17%
2026-09-01 16:44:57
24小时热文
更多
扫一扫体验小程序