标题:CVPR 2026:深度学习的「标准件」,正在被逐个拆掉
正文:
深度学习这座大楼,过去几年越盖越高、越盖越复杂。Transformer 是主楼,扩散模型和归一化流是附楼,浮点精度、归一化层和残差连接等被视为“标准件”。然而,这些标准件正被重新审视——它们真的是承重墙,还是只是装饰?
推理端的革新:精度不是必须的
BinaryAttention 挑战了注意力机制的浮点精度需求,提出仅用 1-bit 表示 Q 和 K 的符号即可完成计算。通过 XNOR 和 popcount 运算,它比传统方法快 2 倍以上,且在部分任务上超越全精度版本。SegQuant 则解决了量化策略需手工调参的问题,通过自动分析计算图分配量化配置,首次实现了跨架构通用的量化框架。
训练目标的翻案:去噪并非最优解
JiT 质疑扩散模型“预测噪声”的训练目标,指出直接预测干净图像更符合几何本质。实验表明,极简设计的 JiT 在高分辨率任务中表现优异,打破了“先压缩再预测噪声”的传统范式。
架构层的松动:归一化与可逆性可以不要
BiFlow 放弃了归一化流的“精确可逆”约束,通过双向独立学习实现并行解码,采样速度提升两个数量级。Derf 则用一个基于误差函数的逐点非线性函数替代归一化层,在多个领域全面超越 LayerNorm 和 RMSNorm,揭示归一化层可能只是提供了一种泛化性尚可的稳定手段。
结语:哪些是承重墙,哪些只是隔断?
这五篇论文从推理端到训练目标,再到架构层,逐一拆解深度学习的“标准件”。结果表明,许多我们认为不可或缺的设计,实际上可以简化甚至移除。房子不仅没塌,反而更加透亮。深度学习的未来或许不再是无止境地堆砌规模,而是回归本质,找到真正必要的核心组件。
原文链接
本文链接:https://kx.umi6.com/article/36314.html
转载请注明文章出处
相关推荐
换一换
谢赛宁盛赞字节Seed新研究!单Transformer搞定任意视图3D重建
2025-11-18 13:17:53
ChatGPT上线“AI教师”模式:你要的是答案,它教你如何思考
2025-07-30 17:51:57
小米首席语音科学家 Daniel Povey:AI 发展的本质就像生物进化,不开源要慢 1000 倍
2025-12-15 16:49:04
初步研究表明 AI 无法准确预测股市
2025-05-17 12:04:05
谷歌全网扒1000亿图像文本对,ViT大佬坐镇:数据Scaling潜力依旧
2025-02-13 18:12:26
Google AI编年史
2025-11-04 16:20:36
彩云科技DCFormer模型架构发布,效率是Transformer的两倍!
2024-06-07 18:02:52
音乐极客的平权实验:他想在写歌上再造一个快手
2025-08-25 11:27:29
132年未解开的李雅普诺夫函数谜题,被AI攻克了?
2024-10-20 20:02:17
谷歌新架构突破Transformer超长上下文瓶颈!Hinton灵魂拷问:后悔Open吗?
2025-12-05 19:46:53
有300亿美元也未必“再造GPT-4”?NUS尤洋最新长文:拆穿AI增长瓶颈的真相
2025-12-31 13:17:46
斯坦福意外用AI生成超强CUDA内核,性能比人类专家优化得还要好!翻倍碾压原生PyTorch,华人主创
2025-05-31 12:04:12
最火AI角色扮演流量已达谷歌搜索20%!每秒处理2万推理请求,Transformer作者公开优化秘诀
2024-06-21 15:42:20
767 文章
944239 浏览
24小时热文
更多
-
2026-09-06 21:14:00 -
2026-09-06 20:12:34 -
2026-09-06 20:10:47