标题:字节提出视觉生成新方法:让AI像人类一样边画边改
正文:
字节商业化技术团队近期推出了一种全新的视觉生成模型——生成精炼网络(GRN,Generative Refinement Networks)。与主流的扩散模型和自回归模型不同,GRN开创了视觉生成的“第三条路”,能够像人类绘画一样,边画边改,复杂场景多画,简单场景少画。
扩散模型虽能生成逼真的图像,但无论画面复杂与否,都需相同步数完成,效率较低;自回归模型则因离散化处理丢失高频细节,且一旦出错无法修正,导致误差累积。GRN通过引入层次二叉树量化(HBQ)、全局精炼机制和复杂度感知采样,解决了这些问题。
具体来说,HBQ采用近乎无损的离散编码,避免信息损失;全局精炼机制允许模型在生成过程中不断修改错误,逐步优化结果;复杂度感知采样根据画面复杂度动态调整计算步数,简单场景只需20步,复杂场景最多40步,显著提升效率。
实验表明,GRN在多项基准测试中刷新了SOTA记录。例如,在ImageNet 256×256重建任务中,HBQ的rFID值为0.56,远超其他方法;在文生图(T2I)和文生视频(T2V)任务中,GRN以更少参数量超越了CogVideoX、Wan 2.1等大模型。
此外,GRN的设计也为多模态生成提供了新思路。其离散token建模方式不仅适用于图像和视频,还能统一文本生成,未来有望进一步扩展至更大规模模型。
论文链接:https://arxiv.org/abs/2604.13030
代码链接:https://github.com/MGenAI/GRN
HuggingFace体验:https://huggingface.co/spaces/hanjian/GRN
原文链接
本文链接:https://kx.umi6.com/article/35803.html
转载请注明文章出处
相关推荐
换一换
寡姐带货国风 Polo 衫、马斯克穿牛仔走红毯:虚拟试衣新框架,只需两张图 30 秒即生成
2024-07-30 22:12:57
13.8倍吞吐提升!浙大上海AI Lab等提出视觉生成新范式,从“下一个token”到“下一个邻域”
2025-03-30 11:29:15
跳过“逐字生成”!蚂蚁集团赵俊博:扩散模型让我们能直接修改Token | MEET2026
2025-12-12 12:47:17
扩散模型也能搞定社交信息推荐,港大数据智能实验室提出RecDiff
2024-07-29 16:05:53
GAN已死?GAN万岁!布朗康奈尔新作爆火,一夜碾压扩散模型
2025-01-11 17:39:16
何恺明带大二本科生颠覆扩散图像生成:扔掉多步采样和潜空间,一步像素直出
2026-02-02 16:48:05
华人团队终结Token危机:扩散模型数据潜力超自回归三倍
2025-08-13 17:38:29
小众架构赢麻了!通过编辑功能让100B扩散模型飙出892 tokens/秒的速度!
2026-02-11 10:10:31
物理学家靠生物揭开AI创造力来源:起因竟是“技术缺陷”
2025-07-04 18:47:36
ViT一作盛赞:这个中国开源“PS模型”强过Nano Banana
2025-12-29 13:21:05
何恺明团队新作:扩散模型可能被用错了
2025-11-20 11:15:51
智源推出全能视觉生成模型 OmniGen:支持文生图、图像编辑等
2024-10-29 16:33:28
跳过“逐字生成”!蚂蚁集团赵俊博:扩散模型让我们能直接修改Token | MEET2026
2025-12-12 12:47:17
782 文章
1005596 浏览
24小时热文
更多
-
2026-09-06 21:14:00 -
2026-09-06 20:12:34 -
2026-09-06 20:10:47