6月4日,英伟达发布基于Llama 3.1架构的Llama Nemotron Nano VL视觉-语言模型,专攻文档级理解任务。该模型整合CRadioV2-H视觉编码器与Llama 3.1语言模型,支持长达16K上下文处理,适用于多图像和复杂文本解析。模型分三阶段训练:图文预训练、多模态指令微调及文本指令优化,借助Megatron-LLM框架和A100/H100 GPU集群完成。在OCRBench v2测试中,其在OCR、表格解析及图表推理等任务上表现出色,尤其在结构化数据提取上媲美大规模模型。Llama Nemotron Nano VL支持灵活部署,兼容服务器与边缘设备,并提供4-bit量化版本,显著提升推理效率。此模型为企业文档处理提供高效解决方案。
原文链接
本文链接:https://kx.umi6.com/article/19739.html
转载请注明文章出处
相关推荐
换一换
两个「卖铲」程序员,不到2年撬动7个亿
2025-12-01 07:53:25
GPT-4o 系列 AI 模型加持,微软 LlamaParse 文档解析能力全面升级
2024-11-28 14:33:00
只有0.9B的PaddleOCR-VL,却是现在最强的OCR模型
2025-10-24 16:47:14
英伟达发布 Llama Nemotron Nano VL AI:高效精准,攻克复杂文档解析难题
2025-06-05 08:46:44
英伟达发布 Eagle 2.5 视觉语言 AI 模型:8B 参数媲美 GPT-4o
2025-04-23 14:58:47
字节 Seed 开源 UI-TARS-1.5:基于视觉-语言模型构建的多模态智能体
2025-04-18 09:04:49
罗永浩谈豆包手机被部分App封杀:事情比想象的要复杂得多
2025-12-08 11:26:56
豆包手机助手:已下线操作银行、互联网支付类APP的能力
2025-12-06 18:44:32
神秘模型 Grok 4.20 AI 炒股夺冠:只有它赚钱,吊打 Gemini 3 和 GPT-5.1
2025-12-07 16:36:04
山东省“十五五”规划建议:大力推进人工智能创新应用 支持创建一批国家人工智能应用中试基地
2025-12-08 09:22:21
苹果陷AI困局 iPhone用户出现倒戈潮
2025-12-07 16:37:13
美的“美罗 U”首曝,行业首创六臂轮足式人形机器人
2025-12-07 15:33:32
广西“十五五”规划建议:全力打造制造业十大现代化支柱产业
2025-12-07 10:27:01
581 文章
342763 浏览
24小时热文
更多
-
2025-12-08 23:53:52 -
2025-12-08 22:52:38 -
2025-12-08 22:51:57