1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

国产SOTA新模型精准get“画(3+6)条命的动物” | 开源

生成图像这件事,会推理的AI才是好AI。比如,以往给AI这样一句Prompt:“(3+6)条命的动物。”人类一眼知道是猫咪,但AI可能将其理解为单纯的数学题。传统AI生成的猫图虽形象,但未真正理解“九条命=猫”的含义。

为解决这一问题,清华大学、腾讯ARC Lab等联合推出新模型MindOmni,显著提升AI的推理生成能力。它不仅能理解复杂指令,还能基于图文内容生成连贯且可信的“思维链”,输出逻辑性强、语义一致的图像或文本。

MindOmni采用Qwen2.5-VL架构,结合预训练的ViT提取图像特征并编码文本,再通过OmniGen扩散解码器生成图像。连接器负责对齐视觉语言模型与生成模块的特征维度。模型通过三阶段训练逐步提升性能:第一阶段基础预训练,第二阶段CoT监督微调,第三阶段引入RGPO强化学习算法优化推理生成。

实验显示,MindOmni在图像理解与生成任务中表现卓越,尤其在WISE基准测试中,其推理生成能力远超同类模型。无论是生成猫图还是考虑时差的悉尼歌剧院场景,MindOmni均展现出强大的多模态推理能力。

原文链接
本文链接:https://kx.umi6.com/article/20536.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
全球第二!马斯克的xAI发布Grok Imagine Image 2.0模型:AI生图/编辑能力大增
2026-08-08 14:14:39
国内最强生图模型Wan2.7-Image来了
2026-04-01 18:01:59
让AI自发推理!引发热议的“DeepSeek”到底是个啥
2025-02-01 01:08:43
OpenAI 扩展 Responses API:支持 MCP、图像生成等
2025-05-22 11:28:26
DeepSeek们越来越聪明,却也越来越不听话了
2025-05-20 22:46:53
GRPO在《时空谜题》中击败o1、o3-mini和R1
2025-03-27 16:59:27
消息称 OpenAI 计划今夏初发布开源语言模型,力争推理能力超越同类
2025-04-24 08:27:01
RL 是推理神器?清华上交大最新研究指出:RL 让大模型更会“套公式”、却不会真推理
2025-04-23 11:57:26
GPT-4o图像生成架构被“破解”了?自回归主干+扩散解码器
2025-04-09 17:59:20
智谱版o1终于也来了:直接拿下考研数学,一句话就能做小游戏!
2024-12-31 10:37:09
天工大模型 4.0 o1 版 / 4o 版上线,App 及网页可免费使用
2025-01-06 11:23:41
X 平台承诺:Grok AI 不会再将真人的照片改成“比基尼照”
2026-01-15 09:23:06
国产AI搜索接入DeepSeek-R1!我们深度试玩了一下
2025-02-03 10:06:40
24小时热文
更多
扫一扫体验小程序