英伟达发布 Eagle 2.5 视觉语言 AI 模型：8B 参数媲美 GPT-4o

2025-04-23 14:58:47

蝶舞CyberSwirl

发布在

快讯

阅读：1570

4月22日，英伟达发布了Eagle 2.5视觉语言AI模型，参数规模仅8B却在多项测试中表现优异。该模型专注于长上下文多模态学习，擅长处理高分辨率图像和长视频序列。在Video-MME基准测试中，Eagle 2.5以512帧输入获得72.4%的高分，接近更大规模的Qwen2.5-VL-72B和InternVL2.5-78B。其成功得益于信息优先采样（IAP）与渐进式后训练策略，IAP通过保留60%以上图像区域提升效率，ADS动态平衡视觉与文本输入。模型还采用了定制数据集Eagle-Video-110K，结合自上而下与自下而上标注方法增强数据质量。Eagle 2.5在MVBench、MLVU等视频及DocVQA、ChartQA等图像任务中均取得亮眼成绩，消融研究表明关键策略不可或缺。

原文链接

本文链接：https://kx.umi6.com/article/17631.html

转载请注明文章出处

Eagle2.5