1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

标题:CVPR 2026 生成式 AI 观察:视觉模型重构底层设定

正文:
近年来,视觉生成与理解领域的技术发展多围绕既有框架优化性能,但今年 CVPR 的一批代表性工作显示,研究重点正从“增量修补”转向对底层假设的重新审视。扩散模型的引导机制、视频生成是否依赖去噪、生成目标是否合理等基础问题被重新提出。这意味着视觉 AI 的竞争正从性能提升转向对默认设定的回溯性重构。

上海交通大学与 vivo BlueImage Lab 提出《C²FG: Control Classifier-Free Guidance via Score Discrepancy Analysis》,挑战扩散模型中常用的 Classifier-Free Guidance(CFG)。传统 CFG 使用固定引导强度,难以适应扩散过程中的动态变化。C²FG 提出基于指数衰减的动态引导机制,在采样前期强化条件约束,后期减弱以避免分布偏移,打破了经验调参的惯性,并具备无需重新训练的工程迁移性。

苹果团队的《STARFlow-V: End-to-End Video Generative Modeling with Autoregressive Normalizing Flows》则重新思考视频生成架构。当前高质量视频生成几乎完全依赖扩散模型的反复去噪,而 STARFlow-V 构建了一种基于 normalizing flow 的端到端生成范式,利用 global-local 自回归结构解决长时序依赖和跨帧一致性问题,同时支持多种任务,开辟了视频生成的新技术路线。

MIT 团队的《Back to Basics: Let Denoising Generative Models Denoise》进一步质疑扩散模型的核心预测目标。主流模型通常预测噪声残差而非干净图像,但研究指出直接回归数据流形可能更自然稳定。JiT 模型使用大 patch Transformer 直接预测干净图像,打破路径依赖,为高分辨率生成提供更自洽的逻辑。

在控制精度方面,德国图宾根大学等提出的《FrankenMotion: Part-level Human Motion Generation and Composition》将人体动作生成推向细粒度编排。通过分解动作单元并引入逐帧标注数据集,FrankenMotion 实现了对局部肢体动作的精确控制,能够组合出未见过的复杂动作。

意大利都灵理工大学等的《MARCO: Navigating the Unseen Space of Semantic Correspondence》则关注语义匹配的泛化能力。现有方法在未见关键点或类别上表现不佳,MARCO 通过 dense self-distillation 机制学习连续语义关联,显著提升了泛化性能和效率。

这些工作虽来自不同领域,但共同指向同一趋势:视觉 AI 正从既定范式的性能竞争,转向对底层设定的重构竞争。这标志着新一波技术革新浪潮的到来。

原文链接
本文链接:https://kx.umi6.com/article/35381.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
冲破 AGI 迷雾,蚂蚁看到了一个新路标
2025-09-29 11:08:37
挑战扩散自回归统治!字节提出视觉生成第三种路线,让模型像人类一样边画边改
2026-05-13 23:00:53
VAE再被补刀!清华快手SVG扩散模型亮相,训练提效6200%,生成提速3500%
2025-10-28 15:54:58
谢赛宁新作:VAE退役,RAE当立
2025-10-14 17:20:36
GAN已死?GAN万岁!布朗康奈尔新作爆火,一夜碾压扩散模型
2025-01-11 17:39:16
13.8倍吞吐提升!浙大上海AI Lab等提出视觉生成新范式,从“下一个token”到“下一个邻域”
2025-03-30 11:29:15
英伟达合作推出 Fast-dLLM 框架,AI 扩散模型推理速度最高飙升 27.6 倍
2025-06-03 12:54:51
突破瓶颈!北航ETH等首次将扩散模型完全量化至1bit,28倍存储节省+52.7倍效率提升
2025-01-11 12:37:26
刚刚,OpenAI发布sCM提升50倍效率,扩散模型重大技术突破!
2024-10-25 10:40:17
挑战扩散自回归统治!字节提出视觉生成第三种路线,让模型像人类一样边画边改
2026-05-13 23:00:53
MSRA:视觉生成六大技术问题
2024-07-13 12:09:52
从不确定到安全:如何安全控制复杂物理系统
2025-07-19 17:56:25
扩散模型成最快深度思考!告别自回归每秒1009个tokens,英伟达微软都投了
2026-02-26 10:41:31
24小时热文
更多
扫一扫体验小程序