6月4日,英伟达发布基于Llama 3.1架构的Llama Nemotron Nano VL视觉-语言模型,专攻文档级理解任务。该模型整合CRadioV2-H视觉编码器与Llama 3.1语言模型,支持长达16K上下文处理,适用于多图像和复杂文本解析。模型分三阶段训练:图文预训练、多模态指令微调及文本指令优化,借助Megatron-LLM框架和A100/H100 GPU集群完成。在OCRBench v2测试中,其在OCR、表格解析及图表推理等任务上表现出色,尤其在结构化数据提取上媲美大规模模型。Llama Nemotron Nano VL支持灵活部署,兼容服务器与边缘设备,并提供4-bit量化版本,显著提升推理效率。此模型为企业文档处理提供高效解决方案。
原文链接
本文链接:https://kx.umi6.com/article/19739.html
转载请注明文章出处
相关推荐
.png)
换一换
英伟达发布 Eagle 2.5 视觉语言 AI 模型:8B 参数媲美 GPT-4o
2025-04-23 14:58:47
英伟达发布 Llama Nemotron Nano VL AI:高效精准,攻克复杂文档解析难题
2025-06-05 08:46:44
GPT-4o 系列 AI 模型加持,微软 LlamaParse 文档解析能力全面升级
2024-11-28 14:33:00
字节 Seed 开源 UI-TARS-1.5:基于视觉-语言模型构建的多模态智能体
2025-04-18 09:04:49
视频理解新标杆,快手多模态推理模型开源:128k上下文+0.1秒级视频定位+跨模态推理
2025-09-05 22:26:24
巨头抢滩AIGC,美团、百度新AI实测来了
2025-09-05 09:14:51
调整训练数据出场顺序大模型就能变聪明!无需扩大模型/数据规模
2025-09-06 12:36:04
意识智能体:大模型的下一个进化方向?:计算意识理论综述II
2025-09-07 19:49:04
通义千问系列最强大的语言模型:Qwen3-Max-Preview 上线
2025-09-06 00:26:52
华纳兄弟探索起诉 Midjourney,指控其 AI 侵犯蝙蝠侠、超人、兔八哥等角色版权
2025-09-05 10:19:00
估值翻倍用时约 15 个月:法 AI 企业 Mistral 新融资轮中估值达 120 亿欧元
2025-09-05 12:18:29
高盛:人人都在谈论AI 但目前AI仍难与公司利润直接挂钩
2025-09-05 18:25:52
OpenAI杀入招聘市场:打造AI技能认证体系+人才对接平台
2025-09-05 06:12:15
470 文章
162211 浏览
24小时热文
更多

-
2025-09-07 21:49:50
-
2025-09-07 20:50:36
-
2025-09-07 20:49:25