1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

刘壮陈丹琦新作:开源通用视觉推理RL框架,0思考数据刷新SOTA

量子位 | 公众号 QbitAI

普林斯顿刘壮团队联合陈丹琦推出了一款开源强化学习(RL)框架——Vero,专攻通用视觉推理任务。这一框架能够胜任图表、科学、空间理解等多类开放视觉任务,并在30多项测试中达到8B参数规模视觉语言模型的SOTA表现。

以往,GPT、Gemini等顶级模型虽擅长视觉推理,但其背后的强化学习方案多为闭源,而开源方案通常仅适用于特定任务。Vero的出现填补了这一空白,证明学术环境下也能追赶工业界的领先成果。

打造全能型视觉推理模型常面临两大难题:一是开源RL方案训练的模型往往只能胜任单一任务;二是多任务训练容易导致模型混乱或退化。Vero通过三方面创新解决了这些问题。

首先,团队构建了一个名为Vero-600K的多样化数据集,包含来自59个数据集的60万高质量样本,覆盖图表OCR、STEM、空间动作、知识识别等六类任务。实验表明,在广泛均衡的数据集上进行RL训练,可避免单一任务训练导致的能力退化。

其次,Vero提出了“任务路由奖励机制”,设计多路奖励系统,根据任务类型自动将输出路由到相应验证器。例如,选择题评估选项正确性,数学题依赖数学校验,开放描述则引入大模型裁判评分。

最后,Vero采用单阶段强化学习,无需私有“Thinking”数据,仅凭高质量数据过滤、均衡任务混合和精确路由奖励,即可激发基础模型的通用视觉推理能力。实验显示,基于Vero训练的模型在30个基准测试中的23项超越了经过专门微调的Qwen3-VL-8B-Thinking。

研究团队还发现,广泛的数据覆盖是驱动视觉推理强化学习的关键。目前,Vero的所有数据、代码和模型均已开源。

项目由普林斯顿PLI实验室主导,通讯作者为Gabriel Sarch和Linrong Cai,陈丹琦参与其中。刘壮作为项目负责人,曾在清华姚班、加州大学伯克利分校深造,并与Meta FAIR及何恺明、LeCun等深度合作。

项目地址:https://vero-reasoning.github.io/

原文链接
本文链接:https://kx.umi6.com/article/34681.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
马斯克亲自点名Karpathy迎战Grok 5!别神话LLM,AGI还要等十年
2025-10-20 15:08:42
2025年了,AI还看不懂时钟?
2025-09-08 21:03:50
机器人运控训练步入分钟级时代!清华AIR开源UniLab:3分钟训好人形,速度暴涨10倍,Mac上也能跑
2026-06-02 12:26:59
秒级生成百万级token!九章云极发布九章智算云Alaya NeW Cloud 2.0
2025-06-16 19:13:12
大模型刷数学题竟有害?CMU评估20+模型指出训练陷阱
2025-07-08 17:52:09
比NanoBanana更擅长中文和细节控制!兔展&北大Uniworld V2刷新SOTA
2025-11-05 15:09:36
真正的AI竞争力,藏在大模型“后训练”这一步
2025-10-13 16:59:55
无需外部数据!AI自问自答实现推理能力进化
2025-08-08 16:13:47
Meta万引强化学习大佬跑路!用小扎原话作为离别寄语,扎心了
2025-08-26 13:43:07
LLM强化学习新框架!UCSD多智能体训练框架让LLM工具调用能力暴增5.8倍
2025-11-08 13:43:06
41个榜单SOTA!智谱最新开源GLM-4.5V实测:看图猜地址、视频秒变代码
2025-08-12 16:19:29
人类 越来越难理解AI
2026-08-31 16:50:05
字节Seed发布GR-RL 首次实现真机强化学习穿鞋带
2025-12-02 14:21:13
24小时热文
更多
扫一扫体验小程序