1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

vivo发布端侧多模态模型,仅3B参数实现GUI理解,20项评测表现优异

vivo AI Lab推出了面向端侧设计的多模态模型BlueLM-2.5-3B,具备紧凑高效的特点,并能直接理解GUI界面。该模型融合了文本与图文理解能力,支持长短思考模式切换和思考预算控制机制(thinking token budget),在20余项评测任务中表现出色。

BlueLM-2.5-3B在文本任务中缓解了多模态模型常见的“文本能力遗忘”问题,在thinking模式下,其性能与4B以下规模的文本模型Qwen3-4B相当,且优于同规模及更大规模的多模态模型。在推理类任务(如Math-500、GSM8K)中,其效果甚至超越了更大规模的无thinking模式模型。在non-thinking模式下,它也全面领先于同规模的多模态模型。

在多模态任务中,BlueLM-2.5-3B同样表现突出,尤其在thinking模式下的推理任务中,其效果接近或优于更大规模模型。此外,它在GUI理解能力上也显著领先同规模模型,例如在ScreenSpot等指标上得分超过Qwen2.5-VL-3B和UI-TARS-2B。

为实现这些优势,BlueLM-2.5-3B采用了精巧的模型结构和高效的训练策略。其参数量仅2.9B,比同规模模型小22%,包含ViT、Adapter和LLM组件,支持动态分辨率输入和子图并行推理。预训练分为四个阶段:文本数据预训练、联合预训练、推理增强训练以及长文联合训练,有效避免了文本能力遗忘并提升了推理能力。

后训练阶段包括SFT和RL训练。SFT通过特殊token控制思考模式触发,而RL结合人类反馈和可验证奖励优化模型性能。高质量训练数据和自动化数据pipeline进一步提升了模型效果。

支撑高效训练的是vivo自建的高性能训练平台和框架,实现了千卡级训练场景下95%以上的近线性加速比,并通过模块化设计和稳定性保障确保长时间无中断训练。

技术报告:https://arxiv.org/abs/2507.05934

原文链接
本文链接:https://kx.umi6.com/article/21532.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
谷歌正式发布 Gemma 3n 小钢炮模型:2GB 内存本地玩转 AI 多模态
2025-06-27 16:11:19
DeepSeek 深夜再放大招:7B 参数人人可用的视觉多模态模型 Janus-Pro-7B 开源
2025-01-28 01:38:40
半壁华人!GPT Image 2团队曝光:无锡才俊带队,13人4个月封神
2026-04-23 16:14:21
全球顶级AI科学家许主洪加盟阿里!IEEE Fellow,五万被引论文数,曾任Salesforce集团副总裁
2025-02-08 14:22:14
阿里云魔搭社区:首发阶跃星辰最新开源两款多模态模型 已上架超4万个开源模型
2025-02-21 13:58:38
大模型热度退潮,真正的技术创新者开始被「看见」
2025-06-20 17:06:44
多模态模型学会“按需搜索”,少搜30%还更准!字节&NTU新研究优化多模态模型搜索策略
2025-07-09 14:06:26
上科大何旭明团队新作:克服简单样本偏置,让多模态模型学会「难题优先」
2026-01-16 15:56:29
智谱联合华为开源首个国产芯片训练的多模态SOTA模型
2026-01-14 09:24:34
Nano Banana Pro 新对手,智谱联合华为开源首个国产芯片训练的多模态 SOTA 模型 GLM-Image
2026-01-14 10:24:53
浙大团队破解多模态模型「盲目自信」:先校准置信度,再分配算力丨CVPR’26
2026-03-22 15:55:17
空间智能版ImageNet来了!李飞飞吴佳俊团队出品
2024-11-11 16:11:01
多模态模型免微调接入互联网,即插即用新框架,效果超闭源方案
2024-11-11 16:27:28
24小时热文
更多
扫一扫体验小程序