标题:突破短视频局限!MMBench 团队构建中长视频开放问答评测基准,全面评估多模态大模型视频理解能力
当前评测基准存在几大缺陷:多注重短视频,难以考察长时序理解能力;评估任务较简单,未涉及细粒度能力;问题与画面时序性关联弱;对开放性问题的评估不够精准。针对这些问题,MMBench-Video应运而生,它是一个全面的开放性视频理解评测基准,涵盖从30秒到6分钟的视频,包含210个镜头,涉及16个领域。
MMBench-Video具有以下特点:视频时长跨度广,镜头数多变;全方位能力大考,包含感知与推理;视频种类丰富,问答语言多样化;时序独立性佳,标注质量高。它通过全人工标注,确保数据集的质量和多样性。
实验选取了11个视频语言模型、6个开源图文多模态大模型及GPT-4o等5个闭源模型进行全面评估。结果显示,GPT-4o和Gemini-Pro-v1.5表现优异。令人意外的是,开源图文多模态大模型在视频理解上优于视频语言模型,这可能归因于它们在静态视觉信息处理上的优势。
视频长度和镜头数量是影响模型性能的关键因素。随着镜头数量增加,模型性能下降明显。此外,引入字幕信息提升了模型的上下文理解能力,但增加了生成幻觉内容的风险。裁判模型方面,GPT-4表现出色,而Qwen2-72B-Instruct也在评估中表现出色。
MMBench-Video支持在VLMEvalKit中一键评测,该工具包简化了评估流程。MMBench-Video为视频语言模型的改进提供了重要工具,推动了开源社区对视频理解能力的深入研究。
原文链接
本文链接:https://kx.umi6.com/article/8083.html
转载请注明文章出处
相关推荐
换一换
当虹科技上半年亏损收窄 研发投入下降
2025-08-23 08:59:00
事关下一代大模型!斯坦福顶尖1%科学家许主洪加盟阿里通义
2025-09-30 12:26:16
视频理解霸榜!快手Keye-VL旗舰模型重磅开源,多模态视频感知领头羊
2025-11-28 17:39:28
我国发布全球首个深海生境智能多模态大模型
2025-11-06 21:14:23
多模态大模型HappyHorse或由阿里团队研发
2026-04-10 10:00:47
「生数科技」完成数亿元Pre-A轮融资,百度投了 | 36氪首发
2024-06-06 16:27:59
多模态大模型事实正确性评估:o1最强,模型普遍过于自信,最擅长现代建筑/工程技术/科学
2025-02-23 14:57:45
中科闻歌:即将发布智川X-Agent智能体平台、优雅多模态大模型产品
2025-02-21 13:57:33
SFT别急着接RL!你的多模态大模型可能一直在“带伤训练”
2026-05-17 12:36:43
用两个简单模块实现分割理解双重SOTA!华科大白翔团队等推出多模态新框架
2025-10-03 13:39:17
李飞飞谢赛宁新作「空间推理」:多模态大模型性能突破关键所在
2024-12-23 12:52:12
王兴兴透露:宇树机器人已能完成绝大部分工作动作
2025-11-16 15:42:36
GPT-4o能拼好乐高吗?首个多步空间推理评测基准:闭源模型领跑
2025-04-23 11:52:51
754 文章
812538 浏览
24小时热文
更多
-
2026-07-24 18:52:34 -
2026-07-24 16:46:46 -
2026-07-24 15:46:50