1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

SFT别急着接RL!你的多模态大模型可能一直在“带伤训练”

PRISM团队 投稿
量子位 | 公众号 QbitAI

在多模态大模型(MLLM)的后训练中,行业普遍采用“先SFT,再RL”的两步范式。然而,香港科技大学(广州)、南洋理工大学、清华大学等机构的研究发现,SFT不仅未能为RL铺路,反而悄悄挖坑,导致模型性能下降。

研究显示,在7个主流多模态benchmark测试中,SFT后的模型性能显著下降。例如,Qwen3-VL-8B模型在SFT后准确率从63.3%降至58.1%,强化学习(RL)仅能将其恢复到基线水平。这意味着RL可能一直在“还债”,而非真正提升性能。

问题根源在于SFT引入的两类偏差:
1. 表面模仿:SFT优化目标是均匀的token级loss,导致模型学会“长得像”正确答案,而非“想得出”正确答案。
2. 感知与推理漂移:多模态场景下,视觉定位错误和逻辑推导失败被混为一谈,进一步加剧分布偏移。

现有RL算法无法修复这些偏差,因为它们专注于RL阶段内部问题,如采样效率和策略崩溃,而未解决SFT遗留的分布偏差。

PRISM提出了一种三阶段流水线:SFT → 分布对齐 (PRISM) → RLVR。其核心创新是中间的分布对齐阶段,通过混合专家判别器分别处理感知漂移和推理漂移,提供解耦的纠正信号。此外,PRISM采用黑盒蒸馏方法,无需访问教师模型logits,仅需API调用即可完成对齐。

实验表明,PRISM在Qwen3-VL的4B和8B模型上均取得显著提升,尤其在数学推理和通用视觉理解任务中表现优异。消融实验进一步验证了每个组件的重要性。

PRISM的出现揭示了SFT与RL之间的“隐形断层”,为多模态大模型后训练范式提供了关键补丁。让模型在推理任务上更进一步,未必需要更复杂算法或更多数据,只需在SFT和RL之间加入分布对齐步骤。

Arxiv:https://arxiv.org/abs/2604.28123
Github:https://github.com/XIAO4579/PRISM

原文链接
本文链接:https://kx.umi6.com/article/35893.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
GPT-4o能拼好乐高吗?首个多步空间推理评测基准:闭源模型领跑
2025-04-23 11:52:51
重构AI在数字和物理世界的生产力,生数科技完成超6亿元A+轮融资
2026-02-06 03:28:59
生数科技再获数亿元大额融资,Vidu领跑多模态大模型赛道
2025-09-19 11:12:21
紫东太初推出GMC核心集剪枝方法,少80%Token仍满血保真多模态能力
2026-08-12 19:35:43
上海WAIC大会现场“大闹天宫”:模型够猛,产品够酷,公司够强
2024-07-04 23:04:31
大模型首次拥有“脖子”!纽大团队实现360度类人视觉搜索
2025-11-27 16:44:41
CVPR2025视频生成统一评估架构,上交x斯坦福联合提出让MLLM像人类一样打分
2025-06-12 17:39:33
多模态大模型事实正确性评估:o1最强,模型普遍过于自信,最擅长现代建筑/工程技术/科学
2025-02-23 14:57:45
企业级OpenClaw最强拍档来了!万亿参数的国产多模态大模型,刚刚开源发布
2026-03-05 19:45:14
事关下一代大模型!斯坦福顶尖1%科学家许主洪加盟阿里通义
2025-09-30 12:26:16
GPT-4.5 创造力比 GPT-4o 弱,浙大上海 AI Lab 发布全球首个面向真实场景的多模态创造力评测基准
2025-04-04 13:13:45
前微软亚研院视觉专家胡瀚加入腾讯 负责混元多模态大模型
2025-01-08 15:42:57
中国第一,全球第二,视频大模型领军者生数科技完成超 6 亿元A+轮融资
2026-02-06 17:02:51
24小时热文
更多
扫一扫体验小程序