标题:空间智能版ImageNet来了!李飞飞吴佳俊团队出品
衡宇 发自 凹非寺
量子位 | 公众号 QbitAI
斯坦福大学李飞飞和吴佳俊团队发布了空间智能版ImageNet,名为HourVideo,用于评估多模态模型对长达一小时视频的理解能力。
HourVideo包含500个来自Ego4D数据集的第一人称视角视频,涉及77种日常活动。评测显示,人类专家水平显著优于当前最先进的模型Gemini Pro 1.5(85.0%对37.3%)。
HourVideo的设计旨在解决现有视频基准测试的局限性,特别是对长视频的理解能力评估不足的问题。数据集包括总结、感知、视觉推理和导航四大类任务,共18个子任务。
HourVideo的数据集生成经过严格的流程,包括视频筛选、候选MCQ生成、LLM优化与人工反馈、盲选和专家优化等步骤。数据集涵盖77种日常生活场景,共有500个视频,总计381小时,每个视频约有26个高质量五选一题,共计12976个问题。
评估结果显示,尽管原生多模态模型在HourVideo上的表现最佳,但也远低于人类专家水平。团队计划未来扩展基准测试,涵盖更多视频类型和模态,同时关注隐私和伦理问题。
HourVideo项目由Keshigeyan Chandrasegaran和Agrim Gupta共同主导,团队成员还包括李飞飞和吴佳俊。李飞飞是斯坦福以人为本人工智能研究院院长,吴佳俊则是斯坦福大学助理教授。
原文链接
本文链接:https://kx.umi6.com/article/8521.html
转载请注明文章出处
相关推荐
.png)
换一换
具身智能实力派!十年多模态打底,世界模型开路,商汤悟能来了
2025-07-28 10:08:25
对话阶跃星辰CEO姜大昕:两年发布16款多模态模型,DeepSeek证明投流模式不成立
2025-05-08 16:31:26
阶跃生态开放日:聚焦智能终端 Agent,率先布局端侧全产业
2025-02-25 17:06:04
全球最大开源视频模型,现在也Created in China了,阶跃出品
2025-02-18 13:15:12
谷歌正式发布 Gemma 3n 小钢炮模型:2GB 内存本地玩转 AI 多模态
2025-06-27 16:11:19
阿里云魔搭社区:首发阶跃星辰最新开源两款多模态模型 已上架超4万个开源模型
2025-02-21 13:58:38
vivo发布端侧多模态模型,只有3B可理解GUI界面,20项评测表现亮眼
2025-07-10 17:25:30
Ilya观点得证!仅靠预测下一个token统一图像文本视频,智源发布原生多模态世界模型Emu3
2024-10-21 13:24:07
苹果新 AI 模型长视频理解夺冠,小至 1B 版本也领先对手
2025-08-23 16:02:10
李飞飞:高校学生应追逐AI“北极星”问题
2025-07-08 16:49:13
阿里AI TO C业务启动近千人招聘,加速多模态模型和前沿AI应用布局
2025-08-13 16:37:08
多模态都是假的:最强模型数不清手指、认不出雷碧
2025-07-22 15:38:55
全球顶级AI科学家许主洪加盟阿里!IEEE Fellow,五万被引论文数,曾任Salesforce集团副总裁
2025-02-08 14:22:14
515 文章
200483 浏览
24小时热文
更多

-
2025-09-06 08:33:16
-
2025-09-06 08:32:00
-
2025-09-06 06:30:37