【新闻速递】近日,由智源、北邮、北大和浙大等高校合作推出的首个多任务长视频理解评测基准MLVU发布,评估模型对长视频的全面掌握。GPT-4o在其中的单选正确率仅约65%,显示现有模型在处理长达数分钟至两小时的视频时面临挑战。研究发现,视频时长增加会导致性能下滑,提升上下文理解和图像解析能力至关重要。MLVU涵盖广泛时长和来源的视频,涉及9类任务,旨在测试模型的全面、单细节和多细节理解能力。实验结果显示,开源与闭源模型间存在显著差距,提示了未来长视频理解模型发展的方向。
原文链接
本文链接:https://kx.umi6.com/article/1894.html
转载请注明文章出处
相关推荐
换一换
百川智能发布全链路领域增强金融大模型 Baichuan4-Finance,测试成绩领先 GPT-4o
2024-12-23 11:53:01
OpenAI 发布最新技术报告,揭秘 GPT-4o 变谄媚的原因
2025-05-03 16:36:59
超越 GPT-4o:开源科研模型 OpenScholar 登场,4500 万篇论文检索增强生成回答
2024-11-26 19:38:14
GPT-4o偷偷升级,变身聊天鬼才!新版STEM智力飙升,生图却惨遭削弱?
2025-05-05 09:41:32
OpenAI发布生图神器狙击Google,一句话精细P图
2025-03-26 08:41:03
因为GPT-5,这群人决定在Reddit上起义
2025-08-11 11:01:24
长视频理解新突破!Mamba混合架构让显存消耗腰斩,处理10万视频token不费力
2025-03-27 13:47:30
GPT-4o一夜被赶超,Anthropic推出Claude 3.5,网友3分钟克隆马里奥游戏
2024-06-21 22:05:07
商汤拟配售16.7亿股股份;GPT-4o劲敌Claude 3.5发布;我国人工智能企业数量已超4500家|AI daily早新闻
2024-06-21 11:20:11
打开必应就能生图,微软 Bing Image Creator 免费接入 GPT-4o
2025-08-07 15:51:50
大模型无法真正理解视频,GPT-4o正确率仅36%,南洋理工大团队提出新基准
2025-08-01 19:06:23
吉卜力风格 AI 图刷屏之际,消息称 OpenAI 正测试 GPT-4o 生图模型水印
2025-04-07 08:45:55
提示词用上“过去式“,秒破GPT4o等六大模型安全限制!中文语境也好使
2024-07-19 15:57:37
732 文章
931188 浏览
24小时热文
更多
-
2026-09-07 10:44:22 -
2026-09-06 21:14:00 -
2026-09-06 20:12:34