正文:2025年7月,CMU研究团队发布论文指出,训练大语言模型的数学能力可能对其通用领域表现产生负面影响。研究评估了20多个模型在数学推理、其他推理任务及非推理任务上的表现,发现采用监督微调(SFT)的模型常出现负迁移,尤其在非推理任务上表现更差;而强化学习(RL)训练的模型则展现出更强的迁移能力与泛化性。通过PCA分析和Token分布偏移实验,研究进一步表明RL微调对模型原有知识的保留更优,同时提升了特定领域的逻辑能力。研究认为,强化学习可能是实现可迁移推理的关键。论文已发布于arXiv。
原文链接
本文链接:https://kx.umi6.com/article/21375.html
转载请注明文章出处
相关推荐
换一换
卓世科技,股改完成!
2026-01-05 15:08:15
腾讯混元大模型品牌 Hunyuan 更名为 HY
2025-12-10 15:53:58
雷军宣布:小米AI人才招聘专项正式启动!
2026-03-30 16:59:23
杨植麟当主持人的大模型圆桌:张鹏罗福莉夏立雪都放开说了
2026-03-27 23:23:11
智谱AI今日正式上市,一文讲透你想知道的6件事
2026-01-09 21:35:10
Kimi春节档挣超一年钱!这口“龙虾肉”大厂开始抢吃了
2026-02-26 01:05:27
机器人运控训练步入分钟级时代!清华AIR开源UniLab:3分钟训好人形,速度暴涨10倍,Mac上也能跑
2026-06-02 12:26:59
刚刚,智谱港交所敲钟!市值528亿港元
2026-01-08 11:04:01
亚马逊云科技发布多款大模型
2025-12-03 14:25:54
混元OCR模型核心技术揭秘:统一框架、真端到端
2025-11-30 11:05:21
全球大模型第一股要来了 智谱发布IPO招股书:代码能力并列全球第一
2025-12-19 23:17:39
智谱AI,排名「第二」
2025-12-21 12:41:26
终于用上AI的公司 发现业务被大模型公司抢了
2026-07-19 14:15:02
712 文章
771072 浏览
24小时热文
更多
-
2026-07-24 00:15:46 -
2026-07-24 00:14:08 -
2026-07-24 00:12:30