1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

标题:字节提出视觉生成新方法:让AI像人类一样边画边改

正文:
字节商业化技术团队近期推出了一种全新的视觉生成模型——生成精炼网络(GRN,Generative Refinement Networks)。与主流的扩散模型和自回归模型不同,GRN开创了视觉生成的“第三条路”,能够像人类绘画一样,边画边改,复杂场景多画,简单场景少画。

扩散模型虽能生成逼真的图像,但无论画面复杂与否,都需相同步数完成,效率较低;自回归模型则因离散化处理丢失高频细节,且一旦出错无法修正,导致误差累积。GRN通过引入层次二叉树量化(HBQ)、全局精炼机制和复杂度感知采样,解决了这些问题。

具体来说,HBQ采用近乎无损的离散编码,避免信息损失;全局精炼机制允许模型在生成过程中不断修改错误,逐步优化结果;复杂度感知采样根据画面复杂度动态调整计算步数,简单场景只需20步,复杂场景最多40步,显著提升效率。

实验表明,GRN在多项基准测试中刷新了SOTA记录。例如,在ImageNet 256×256重建任务中,HBQ的rFID值为0.56,远超其他方法;在文生图(T2I)和文生视频(T2V)任务中,GRN以更少参数量超越了CogVideoX、Wan 2.1等大模型。

此外,GRN的设计也为多模态生成提供了新思路。其离散token建模方式不仅适用于图像和视频,还能统一文本生成,未来有望进一步扩展至更大规模模型。

论文链接:https://arxiv.org/abs/2604.13030
代码链接:https://github.com/MGenAI/GRN
HuggingFace体验:https://huggingface.co/spaces/hanjian/GRN

原文链接
本文链接:https://kx.umi6.com/article/35803.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
质量无损,算力砍半!达摩院开源视觉生成新架构,出道即SOTA|ICLR 2025
2025-04-25 15:12:35
OpenAI宋飏被Meta挖跑了!扩散模型崛起关键人物,加入MSL再会师清华校友赵晟佳
2025-09-25 22:11:00
MSRA:视觉生成六大技术问题
2024-07-13 12:09:52
英伟达合作推出 Fast-dLLM 框架,AI 扩散模型推理速度最高飙升 27.6 倍
2025-06-03 12:54:51
谢赛宁新作:VAE退役,RAE当立
2025-10-14 17:20:36
13.8倍吞吐提升!浙大上海AI Lab等提出视觉生成新范式,从“下一个token”到“下一个邻域”
2025-03-30 11:29:15
小众架构赢麻了!通过编辑功能让100B扩散模型飙出892 tokens/秒的速度!
2026-02-11 10:10:31
谷歌 Fluid 颠覆共识:两大因素被发现,AI 文生图领域自回归模型超越扩散模型
2024-10-23 14:39:38
嚯!大语言扩散模型来了,何必只预测下一个token | 人大高瓴&蚂蚁
2025-02-18 13:14:03
何恺明带大二本科生颠覆扩散图像生成:扔掉多步采样和潜空间,一步像素直出
2026-02-02 16:48:05
刚刚,OpenAI发布sCM提升50倍效率,扩散模型重大技术突破!
2024-10-25 10:40:17
何恺明新作:给扩散模型加正则化,无需预训练无需数据增强,超简单实现性能提升
2025-06-12 17:40:43
Llama也能做图像生成!港大字节推出开源自回归文生图模型,在线体验已开放
2024-07-03 16:53:44
24小时热文
更多
扫一扫体验小程序