标题:用多模态LLM超越YOLOv3!强化学习突破多模态感知极限|开源
华中科技大学、北京邮电大学等多校团队推出首个在COCO2017 val set上突破30AP的纯多模态开源LLM——Perception-R1(PR1),专注于视觉推理的基础感知任务,如计数、目标检测、OCR等。PR1通过基于规则的强化学习提升模型的感知策略,展现潜力并提供强大Baseline。
论文和代码已开源,作者希望促进后续研究。视觉感知是AI理解世界的基石,从自动驾驶到医疗诊断均需其支撑。多模态大语言模型虽在视觉问答上有进展,但在精确物体定位、计数及复杂推理上仍有不足。
Perception-R1基于后训练框架,通过Group Relative Policy Optimization(GRPO)优化感知策略。GRPO通过多次尝试、奖励建模、相对比较和策略更新,逐步提升模型性能。奖励函数结合格式与答案准确性,任务包括视觉定位、计数和OCR。
实验结果显示,PR1在多种任务中表现优异,甚至超越专用模型。此外,消融实验验证了其有效性和扩展性,为未来更大规模应用奠定基础。论文和代码均已公开。
原文链接
本文链接:https://kx.umi6.com/article/18107.html
转载请注明文章出处
相关推荐
换一换
上交博士最新思考:仅用两个问题讲清强化学习
2025-11-10 18:29:12
DeepSeek首登《自然》封面:中国大模型创造新历史,做了OpenAI不敢做的事
2025-09-18 16:58:59
秒级生成百万级token!九章云极发布九章智算云Alaya NeW Cloud 2.0
2025-06-16 19:13:12
为何强化学习火遍硅谷?AGI的关键一步
2025-08-07 15:55:40
全新合成框架SOTA:强化学习当引擎,任务合成当燃料,蚂蚁港大联合出品
2025-10-01 18:47:16
8块钱跑通一次强化学习全流程,潞晨云重塑微调赛道:1名算法工程师=1支Infra团队
2026-01-07 16:15:48
任务级奖励提升App Agent思考力,淘天提出Mobile-R1,3B模型可超32B
2025-07-20 15:05:31
Claude 4如何思考?资深研究员回应:RLVR已在编程/数学得到验证
2025-05-24 15:19:19
机器人运控训练步入分钟级时代!清华AIR开源UniLab:3分钟训好人形,速度暴涨10倍,Mac上也能跑
2026-06-02 12:26:59
奖励模型也能Scaling!上海AI Lab突破强化学习短板,提出策略判别学习新范式
2025-07-11 11:34:40
发自 凹非寺量子位 | 公众号 QbitAI 奥特曼点名表扬了两个波兰人。 没有他们,OpenAI就不是今天的样子。 他们是OpenAI首席科学家Jakub Pachocki以及头衔为“Technical Fellow”的Szymon Sidor。 △左:Jakub Pachocki,右:Szymon Sidor 两人不仅是波兰老乡,而且是高中同学,读博时分别选择了计算机科学和机器人,后来又在OpenAI重聚。 在ChatGPT风靡全球、每天服务数亿用户的今天,奥特曼感慨大多数人永远不会想到背
2025-09-09 18:18:27
QwenLong-L1-32B 模型登场:阿里通义千问首个强化学习训练的长文本推理 AI 模型
2025-05-27 14:51:28
官方揭秘ChatGPT Agent背后原理!通过强化学习让模型自主探索最佳工具组合
2025-07-24 16:09:58
789 文章
860635 浏览
24小时热文
更多
-
2026-07-21 20:22:01 -
2026-07-21 18:21:18 -
2026-07-21 18:19:37