正文:2025年11月17日,前Meta研究员田渊栋团队发布了一篇关于大模型强化学习(RL)训练现象的研究论文。研究聚焦于RL训练虽显著提升性能,却仅改变极少数参数的奇特现象。论文提出‘三门理论’,揭示了RL参数更新背后的深层机制:KL锚定限制漂移,模型几何引导低曲率方向优化,bfloat16精度过滤微小变化。实验表明,RL更新稀疏度高达36%-92%,远超监督微调(SFT)的0.6%-18.8%。此外,研究发现传统参数高效微调方法在RL中效果不佳,主成分权重更新常导致不稳定。论文为RL算法设计提供了新思路。
原文链接
本文链接:https://kx.umi6.com/article/28547.html
转载请注明文章出处
相关推荐
换一换
LeCun曝Meta作弊刷榜,田渊栋:我没想到这个结局
2026-01-04 14:07:29
田渊栋AI创业估值315亿,老黄苏妈都投了,姚班施天麟也是合伙人
2026-05-14 15:43:30
奖励是假的,能让Qwen提升25%性能却是真的!
2025-05-29 19:38:47
阿里通义团队开源 R1-Omni:多模态模型 + RLVR,让各模态作用清晰可见
2025-03-11 19:46:02
太疯狂了!Meta裁员裁到田渊栋头上,连组员一锅端
2025-10-23 13:04:46
人大高瓴赵鑫团队新作:先拆掉 RLVR,再重建推理模型训练
2026-01-19 13:57:39
田渊栋卡帕西力荐Nano Banana新玩法:论文变漫画、手写解题以假乱真,谷歌这波赢麻了
2025-11-24 13:57:29
NuerIPS唯一满分论文曝光,来自清华上交
2025-11-11 17:16:47
田渊栋被裁后新offer排到法国!原来Llama 4.5训完后被卸磨杀驴了
2025-10-24 09:29:01
在 AI 最火热的时候,AI 大牛田渊栋写了本小说《破晓之钟》
2024-08-23 13:23:52
全球首发技术路线+全域联盟双轮破局,AI for ADANES释放先进核能新质生产力
2026-07-20 18:27:07
刚刚,智谱建了一座只用国产芯片的数据中心
2026-07-23 12:50:17
业内首款超算+智算的大规模计算底座,在WAIC上我们找到了
2026-07-22 15:01:30
730 文章
781839 浏览
24小时热文
更多
-
2026-07-24 00:15:46 -
2026-07-24 00:14:08 -
2026-07-24 00:12:30