1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

标题:UniToken:多模态AI的“全能选手”,一次编码搞定图文理解与图像生成!

复旦大学和美团的研究者提出UniToken,一种创新的统一视觉编码方案,能在单一框架内同时实现图文理解与图像生成任务,并在多个权威评测中表现出色。

UniToken通过融合连续和离散视觉表征,解决了以往方法中“任务干扰”和“表示割裂”的问题,为多模态统一建模提供了新范式。研究团队已开源代码与模型,方便社区复现与开发。

传统图文理解或图像生成模型的视觉编码特性差异显著。图文理解模型需提取高层语义,而图像生成模型依赖底层细节。这导致一体化多模态大模型面临视觉编码割裂和任务联合训练干扰两大难题。

UniToken采用统一的双边视觉编码器,结合VQ-GAN的离散编码与SigLIP的连续表征,形成兼容高层语义与底层细节的视觉编码。其训练分三阶段:第一阶段对齐视觉与语言空间;第二阶段联合训练图文理解与图像生成数据;第三阶段强化指令跟随能力。

实验显示,UniToken在图文理解与图像生成任务上均达到或超越现有SOTA水平。未来,通过扩大模型规模、增加训练数据量及拓展任务类型,UniToken有望进一步提升通用多模态大模型的能力。

原文链接
本文链接:https://kx.umi6.com/article/17757.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
截胡 OpenAI,谷歌全模态模型首次解禁!Gemini 2.0 中文唠嗑式 P 图引动漫游戏圈关注
2025-03-13 15:23:45
GitHub一周2000星!国产统一图像生成模型神器升级,理解质量双up,还学会了“反思”
2025-07-03 13:21:28
打开必应就能生图,微软 Bing Image Creator 免费接入 GPT-4o
2025-08-07 15:51:50
联发科新一代天玑旗舰芯片针对谷歌 Gemini Nano 多模态 AI 进行优化,支持图像和音频处理
2024-10-09 11:35:46
“计算机视觉被GPT-4o终结了”(狗头)
2025-03-29 17:49:47
所有顶级AI模型准确率都突破不了70%?Google揭示行业真相
2025-12-12 16:59:23
OpenAI 将 ChatGPT 新图像生成技术引入 API,每张图约 2 美分起
2025-04-24 08:29:07
谷歌发布新一代图像生成模型 Nano Banana Pro:基于 Gemini 3 Pro 打造,支持 4K 分辨率与完美文字渲染
2025-11-20 23:48:33
反超Nano Banana!OpenAI旗舰图像生成模型上线
2025-12-17 10:33:36
NeurIPS 2024最佳论文揭晓!北大字节获最佳论文,清华厦大为亚军
2024-12-04 15:37:50
真如摄影、细至发丝!阿里开源新一代图像生成模型Qwen-Image
2025-12-31 21:40:29
阿里开源图像生成模型 Qwen-Image-Layered:能像 PS 一样分图层编辑
2025-12-22 17:54:03
阿里发布Wan2.7-Image,人类偏好盲测评分国内第一
2026-04-20 17:14:36
24小时热文
更多
扫一扫体验小程序