标题:字节开源GPT-4o级图像生成能力
正文:
字节近期开源了GPT-4o级别的图像生成能力,其最新推出的多模态模型BAGEL主打“大一统”,集成了带图推理、图像编辑、3D生成等功能。尽管活跃参数仅7B(总计14B),但其性能已超越或媲美众多顶级开源(如Stable Diffusion 3、FLUX.1)和闭源(如GPT-4o、Gemini 2.0)模型。模型发布后迅速登上Hugging Face趋势榜并引发热议,甚至有研究者表示字节技术领先行业整整一代。
BAGEL模型通过MoT架构实现多模态功能,由两个Transformer专家负责理解和生成,同时配备两个视觉编码器捕捉图像的像素级和语义级特征。模型采用“下一个token组预测范式”,基于Qwen2.5-7B-Instruct、siglip-so400m-14-384-flash-attn2及FLUX.1-schnell VAE模型微调。训练过程中,团队发现BAGEL展现出一种“涌现能力”,即多模态理解和生成能力较早显现,基础编辑能力随后跟进,复杂编辑能力则在后期形成。
具体应用方面,BAGEL支持带图推理、无缝多轮对话、复杂图像编辑、人物表情转换、凭空造物等技能,还具备多视角合成和导航能力。在图像理解、生成、编辑任务中,BAGEL表现优异,多项基准测试中超越现有模型。目前,该模型已在Hugging Face上架,采用Apache 2.0许可证。
项目主页:https://bagel-ai.org/
论文:https://arxiv.org/abs/2505.14683
开源地址:https://huggingface.co/ByteDance-Seed/BAGEL-7B-MoT
原文链接
本文链接:https://kx.umi6.com/article/19185.html
转载请注明文章出处
相关推荐
换一换
源神启动!一张消费级显卡跑“Opus级”Agent,Qwen3.8-27B多项榜单反超Claude
2026-08-15 15:11:44
「AI掉队者联盟」谋求改命
2025-06-11 16:13:17
中国AI凭什么逆袭美国?
2025-06-26 13:58:23
谷歌Gemma 3n实测
2025-07-07 11:27:31
字节上线AI产品“剪小映
2025-05-28 21:38:18
Llama 4发布:我看到了DeepSeek的影子
2025-04-06 16:06:56
GPT-5来了!人人都能免费用,最强大模型只需最傻瓜式使用
2025-08-08 04:01:37
我们扒完了GPT-5全网爆料,奥特曼和OpenAI 这次的饼真不好画了
2025-08-05 19:18:01
图像编辑开源新SOTA,来自多模态卷王阶跃!大模型行业正步入「多模态时间」
2025-04-28 12:48:54
Qwen3.7-Plus上线!多模态智能体新基座,一键复刻桌面端专业软件
2026-06-02 12:25:02
字节又一新模型Seedream 5.0上线 对标Nano Banana Pro
2026-02-10 14:19:52
全球首个深度推理+多模态大模型“紫东太初”4.0发布
2025-09-19 13:13:31
DeepSeek V4 多模态开源,我们把它的视觉链路拆了一遍
2026-09-01 18:52:06
757 文章
995728 浏览
24小时热文
更多
-
2026-09-06 21:14:00 -
2026-09-06 20:12:34 -
2026-09-06 20:10:47