用两个简单模块实现分割理解双重SOTA!华科大白翔团队推出多模态新框架
多模态大模型的能力已从文生图扩展到像素级任务(如图像分割)。然而,现有方法如OMG-LLaVA和LISA(CVPR 2024)仍存在分割不精确和理解幻觉的问题。为解决这些问题,华中科技大学与金山办公团队联合提出了多模态大模型LIRA,包含两个核心模块:语义增强特征提取器(SEFE)和交错局部视觉耦合(ILVC)。
SEFE融合语义特征与像素级特征,提升物体属性推理能力,从而实现更精确的分割;ILVC通过分割掩码提取局部特征并生成描述,为模型提供细粒度监督,有效减少幻觉现象。实验表明,LIRA在分割和理解任务上均达到SOTA性能,相比OMG-LLaVA,其分割精度提升8.5%,在MMBench上提升33.2%。
现有方法在复杂场景中常无法准确分割目标,例如未能正确分割“最靠近白色汽车的红色公交车”。研究发现,这源于多模态模型未能有效编码位置信息,且局部特征与文本描述之间缺乏明确联系。基于此,LIRA通过SEFE和ILVC模块,建立局部图像区域与语义描述的显式映射,显著缓解了分割误差和幻觉问题。
实验结果显示,整合SEFE后,理解任务平均提升5.7%,分割任务提升3.8%;加入ILVC后,幻觉率进一步降低3%-4.8%。此外,LIRA在联合训练理解与分割数据时性能稳定,优于先前方法。研究还发现,token logits能反映分割物体的属性,可能蕴含丰富的语义信息,为未来研究提供了新方向。
LIRA已被ICCV 2025录用,项目代码和论文已开源。
arXiv: https://arxiv.org/abs/2507.06272
GitHub: https://github.com/echo840/LIRA
原文链接
本文链接:https://kx.umi6.com/article/26229.html
转载请注明文章出处
相关推荐
换一换
阶跃星辰两款开源模型均位列 Hugging Face榜单Top 5
2025-02-25 12:57:29
王兴兴透露:宇树机器人已能完成绝大部分工作动作
2025-11-16 15:42:36
当虹科技上半年亏损收窄 研发投入下降
2025-08-23 08:59:00
国际首个,我国团队开发糖尿病诊疗多模态大模型 DeepDR-LLM
2024-07-25 18:37:14
张宏江消除“Scaling Law放缓”恐惧,直言未来将迎来“自主智能”的世界
2024-12-07 17:49:03
独家|商汤联合创始人林达华:开源模型与顶尖闭源模型的差距正在迅速缩小
2025-02-21 15:57:46
我国发布全球首个深海生境智能多模态大模型
2025-11-06 21:14:23
阶跃星辰发布“万亿”和“多模态”大模型 与上海电影“大闹天宫”|2024WAIC
2024-07-06 21:38:20
SuperCLUE多模态视觉评测榜:文心4.5 Turbo总分并列国内第一
2025-08-28 21:28:42
阶跃星辰联合吉利首次开源 Step 系列多模态大模型,包含视频、语音两款模型
2025-02-18 11:13:42
当下,阿里国际某个指标每两个月就翻一倍
2024-07-20 14:13:21
突破不可解释性!视频异常新检测框架精度90.67%拿下SOTA|华科&百度&密歇根大学
2024-07-07 14:30:39
密室逃脱成AI新考场,通关率不足50%,暴露空间推理短板丨清华ICCV25
2025-07-14 14:19:19
755 文章
809985 浏览
24小时热文
更多
-
2026-07-21 20:22:01 -
2026-07-21 18:21:18 -
2026-07-21 18:19:37