北大等团队发布了首个“慢思考”多模态视觉语言模型LLaVA-o1,基于Llama-3.2-Vision模型,超越传统思维链提示,实现了结构化、多步骤推理。在多模态推理基准测试中,LLaVA-o1比其基础模型提升了8.9%,并在性能上超越了一些开闭源模型。
例如,面对“减去所有小亮球和紫色物体,剩下多少个物体?”的问题,传统模型可能得出错误答案,而LLaVA-o1则采用了结构化的推理过程,分为总结、注释、推理和结论四个阶段,显著提高了系统推理能力。团队通过4个标签帮助模型识别推理阶段,并利用GPT-4生成数据集。
LLaVA-o1通过监督微调和阶段级光束搜索方法进一步提升推理能力。这种方法在每个推理阶段生成多个候选结果,选择最佳结果进入下一阶段,提高了推理质量。研究显示,LLaVA-o1在使用10万个训练样本和简单推理时间扩展方法后,实现了8.9%的性能提升。
研究团队由北京大学、鹏城实验室等机构组成,核心成员包括Guowei Xu、Peng Jin、Hao Li、袁粒、Yibing Song和Lichao Sun。团队计划开源LLaVA-o1的代码、预训练权重和数据集,供更多研究人员参考和使用。
原文链接
本文链接:https://kx.umi6.com/article/8931.html
转载请注明文章出处
相关推荐
换一换
视频版Nano Banana来了!内置Gemini世界知识;原版香蕉出图仅需4秒
2026-07-01 10:00:53
小米的首代机器人VLA大模型来了!丝滑赛德芙,推理延迟仅80ms丨全面开源
2026-02-12 21:45:01
刚刚,Fable-5之下,智谱开源的GLM-5.2拿下AI编程第一!
2026-06-17 11:30:37
Claude封杀龙虾后推自家Agent服务,又被开源平替了
2026-04-09 15:12:47
鏖战2025年,大模型围着开源转
2025-12-25 18:55:44
X 平台正式开源推荐算法,马斯克称没有其他社交媒体公司这样做
2026-01-20 14:10:44
睿尔曼开源全球首个高质量、模态数量最多的真机数据集
2025-11-24 20:12:19
AI 推理性能大提升:华为 UCM 技术开源,系统吞吐猛增 22 倍
2025-11-05 18:16:46
Agent、多模态、应用、算力一天看尽,峰会亮点在此|5.20日,来现场一起AI
2026-05-17 17:46:55
李飞飞团队推出首款商用世界模型Marble
2025-11-13 17:12:35
蚂蚁开源业内首个 100B 扩散语言模型 LLaDA2.0
2025-12-12 15:57:42
商汤开源空间智能大模型SenseNova-SI
2025-11-11 08:59:30
腾讯混元开源翻译模型 1.5:手机 1GB 内存即可运行,效果超越商用 API
2025-12-30 16:27:33
777 文章
821197 浏览
24小时热文
更多
-
2026-07-24 00:15:46 -
2026-07-24 00:14:08 -
2026-07-24 00:12:30