5月28日,Meta公司联合发布Multi-SpatialMLLM模型,旨在突破单帧图像分析的局限,提升AI的空间理解能力。该模型整合深度感知、视觉对应和动态感知三大组件,弥补现有模型在复杂空间推理上的不足,例如难以区分左右。为解决这一问题,Meta与香港中文大学合作推出了MultiSPA数据集,包含超过2700万个多样化3D和4D场景样本,并借助GPT-4o生成任务模板。研究设计了深度感知、相机移动感知等多个训练任务,使模型在多帧空间推理上表现更佳。在MultiSPA基准测试中,Multi-SpatialMLLM相比基础模型平均提升了36%,定性任务准确率达80%-90%,并在BLINK基准测试中接近90%的准确率,超越多个专有系统。此外,模型在视觉问答测试中保持原有性能,展现了较强的通用能力。
原文链接
本文链接:https://kx.umi6.com/article/19443.html
转载请注明文章出处
相关推荐
换一换
大模型呼唤开源多模态 AI加速冲刺物理世界
2025-06-07 14:50:49
多模态=AGI入场券?阶跃星辰姜大昕:死磕基座大模型,探索多模态理解生成一体化
2025-05-10 14:06:22
Gemini负责人爆料!多模态统一token表示,视觉至关重要
2025-07-03 15:27:24
神秘「牛来」模型果然是智谱!GLM首个原生多模态,还用的国产卡
2026-08-27 01:50:21
最强开源大模型除夕登场!397B参数千问3.5超越Gemini 3,百万Tokens低至8毛
2026-02-16 19:34:51
视频理解霸榜!快手Keye-VL旗舰模型重磅开源,多模态视频感知领头羊
2025-11-28 17:39:28
阿里视频模型 HappyHorse 开启灰测,悟空已率先接入
2026-04-28 17:26:42
240元打造擅长数学的多模态版R1,基于DeepSeek核心思想,两阶段训练提升推理能力至工业级应用标准
2025-03-20 16:36:06
「阶跃星辰」的一次豪赌
2025-05-21 08:55:53
匆匆发布的Llama4
2025-04-06 16:09:03
商汤坐上大模型核心牌桌
2025-05-09 11:48:13
520当天400万AI人,都在量子位听这近20场演讲&对谈|第四届中国AIGC产业峰会
2026-05-21 14:43:04
DeepSeek V4 多模态开源,我们把它的视觉链路拆了一遍
2026-09-01 18:52:06
751 文章
958415 浏览
24小时热文
更多
-
2026-09-06 21:14:00 -
2026-09-06 20:12:34 -
2026-09-06 20:10:47