1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

标题:GVE模型:一次学会9种视频检索技能

正文:
当前视频检索研究陷入瓶颈,主流模型在经典基准(如MSRVTT)上表现优异,但难以应对真实场景中的复杂需求,例如细粒度语义、长上下文或多模态组合查询。为突破这一局限,香港科技大学(广州)与阿里巴巴通义实验室联合提出通用视频检索(Universal Video Retrieval, UVR)概念,并构建了包含16个数据集的综合评测基准UVRB,涵盖多任务与多领域场景。

团队通过V-SynFlow流程合成了155万条高质量视频-语言训练对,覆盖文本、图像、视频等多种模态组合,并设计了“任务金字塔课程”训练策略,基于Qwen2.5-VL模型架构,逐步提升模型从基础感知到高阶推理的能力。由此推出的通用视频嵌入模型GVE(含3B与7B两个版本),在严格零样本设置下全面超越现有14个主流模型,展现出卓越的泛化性能。

实验结果显示,GVE-7B在UVRB基准上的平均Recall@1得分为0.573,显著领先于最强基线Unite-7B(0.538)。即使是参数量较小的GVE-3B(0.544),也超过了参数量翻倍的Unite-7B,证明其优势源于高质量数据与创新训练策略,而非模型规模。

研究还揭示了当前视频检索领域的关键问题:传统基准(如MSRVTT)与真实场景相关性低,时空理解能力解耦,不同架构模型存在系统性差异。尤其值得注意的是,“部分相关视频检索”任务被证明是评估模型通用性的核心指标。

团队已开源GVE模型及UVRB基准,旨在推动视频检索从“窄域专用”迈向“通用智能”,为未来研究提供可诊断、可扩展的方法论基础。

论文链接:https://arxiv.org/abs/2510.27571
项目主页:https://gzn00417.github.io/GVE/
模型和数据:https://huggingface.co/collections/Alibaba-NLP/gve

原文链接
本文链接:https://kx.umi6.com/article/28427.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
DeepSeek同款GRPO训练大提速!魔搭开源全流程方案,支持多模态训练、训练加速和评测全链路
2025-03-09 13:40:19
不甘落后中美 欧洲推出最强AI大模型Quasar:可惜还没资格上桌
2026-09-02 22:54:27
GPT-6曝光 OpenAI总裁说:AGI登场
2026-09-04 17:31:44
LG电子推出虚拟女团AI-DOL:跨界营销只为推销自家洗烘一体机
2026-08-31 12:39:05
Claude开始训练Claude!4美元一小时,跑赢150美元人类研究员
2026-08-29 21:20:43
B站首届AI创造公开赛收官,超八成参赛者为一人团队
2026-09-06 13:57:08
字节跳动将获得296亿美元贷款:完成将成今年亚洲规模第二大
2026-09-03 16:29:04
“没有Token的CS学生,应立即退学”
2026-09-03 20:39:20
马斯克:AI将令全球经济规模增长20%-30% 十年内人形机器人达10亿台
2026-09-02 10:27:24
前字节强化学习专家孙鹏博士加盟星尘智能,完善Physical AI全栈技术布局
2026-09-02 14:32:34
Claude最强Fable 5.1发布!8项屠榜,最高降价45%,反蒸馏机制上线
2026-09-02 11:24:33
世界生成模型来了3D头部玩家,可进入生产管线的场景级生成时代来临!
2026-09-03 18:34:09
严查!网信办处置一大批用AI生成数字泔水、儿童邪典视频账号
2026-09-02 11:27:30
24小时热文
更多
扫一扫体验小程序