1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

SFT别急着接RL!你的多模态大模型可能一直在“带伤训练”

PRISM团队 投稿
量子位 | 公众号 QbitAI

在多模态大模型(MLLM)的后训练中,行业普遍采用“先SFT,再RL”的两步范式。然而,香港科技大学(广州)、南洋理工大学、清华大学等机构的研究发现,SFT不仅未能为RL铺路,反而悄悄挖坑,导致模型性能下降。

研究显示,在7个主流多模态benchmark测试中,SFT后的模型性能显著下降。例如,Qwen3-VL-8B模型在SFT后准确率从63.3%降至58.1%,强化学习(RL)仅能将其恢复到基线水平。这意味着RL可能一直在“还债”,而非真正提升性能。

问题根源在于SFT引入的两类偏差:
1. 表面模仿:SFT优化目标是均匀的token级loss,导致模型学会“长得像”正确答案,而非“想得出”正确答案。
2. 感知与推理漂移:多模态场景下,视觉定位错误和逻辑推导失败被混为一谈,进一步加剧分布偏移。

现有RL算法无法修复这些偏差,因为它们专注于RL阶段内部问题,如采样效率和策略崩溃,而未解决SFT遗留的分布偏差。

PRISM提出了一种三阶段流水线:SFT → 分布对齐 (PRISM) → RLVR。其核心创新是中间的分布对齐阶段,通过混合专家判别器分别处理感知漂移和推理漂移,提供解耦的纠正信号。此外,PRISM采用黑盒蒸馏方法,无需访问教师模型logits,仅需API调用即可完成对齐。

实验表明,PRISM在Qwen3-VL的4B和8B模型上均取得显著提升,尤其在数学推理和通用视觉理解任务中表现优异。消融实验进一步验证了每个组件的重要性。

PRISM的出现揭示了SFT与RL之间的“隐形断层”,为多模态大模型后训练范式提供了关键补丁。让模型在推理任务上更进一步,未必需要更复杂算法或更多数据,只需在SFT和RL之间加入分布对齐步骤。

Arxiv:https://arxiv.org/abs/2604.28123
Github:https://github.com/XIAO4579/PRISM

原文链接
本文链接:https://kx.umi6.com/article/35893.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
让「GPT-4V」跑在手机上,这家中国大模型公司做到了
2024-08-07 11:18:02
企业级OpenClaw最强拍档来了!万亿参数的国产多模态大模型,刚刚开源发布
2026-03-05 19:45:14
多模态大模型的多语种文字理解能力还有很长的路要走,字节、华科联合发布MTVQA Bench
2024-06-21 17:23:05
CVPR2025视频生成统一评估架构,上交x斯坦福联合提出让MLLM像人类一样打分
2025-06-12 17:39:33
「生数科技」完成数亿元Pre-A轮融资,百度投了 | 36氪首发
2024-06-06 16:27:59
阶跃星辰 CEO 姜大昕:智能终端可能成为未来的 AI 入口
2025-11-16 15:39:12
密室逃脱成AI新考场,通关率不足50%,暴露空间推理短板丨清华ICCV25
2025-07-14 14:19:19
张宏江消除“Scaling Law放缓”恐惧,直言未来将迎来“自主智能”的世界
2024-12-07 17:49:03
港大字节提出多模态大模型新范式,模拟人类先感知后认知,精确定位图中物体
2024-05-27 16:15:00
生数科技再获数亿元大额融资,Vidu领跑多模态大模型赛道
2025-09-19 11:12:21
大模型如何避免“狭义AI陷阱”?
2024-07-15 21:50:24
GPT-4o能拼好乐高吗?首个多步空间推理评测基准:闭源模型领跑
2025-04-23 11:52:51
多模态大模型HappyHorse或由阿里团队研发
2026-04-10 10:00:47
24小时热文
更多
扫一扫体验小程序