Llama Nemotron Nano VL

综合

7*24 快讯

AI科普

合作

全部

英雄令

项目方

开发者

产品方

投资者

英伟达发布 Llama Nemotron Nano VL AI：高效精准，攻克复杂文档解析难题

6月4日，英伟达发布基于Llama 3.1架构的Llama Nemotron Nano VL视觉-语言模型，专攻文档级理解任务。该模型整合CRadioV2-H视觉编码器与Llama 3.1语言模型，支持长达16K上下文处理，适用于多图像和复杂文本解析。模型分三阶段训练：图文预训练、多模态指令微调及文本指令优化，借助Megatron-LLM框架和A100/H100 GPU集群完成。在OCRBench v2测试中，其在OCR、表格解析及图表推理等任务上表现出色，尤其在结构化数据提取上媲美大规模模型。Llama Nemotron Nano VL支持灵活部署，兼容服务器与边缘设备，并提供4-bit量化版本，显著提升推理效率。此模型为企业文档处理提供高效解决方案。

原文链接