DeepSeek的最新论文《Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention》引起了广泛关注。该论文介绍了一种名为NSA的新型稀疏注意力机制,适用于超快长上下文训练和推理,且具有硬件对齐和本地可训练特性。
NSA旨在解决现有稀疏注意力机制的问题。传统方法虽能提高计算速度,但仍面临巨大运算量。DeepSeek-V2的MLA通过低秩分解KV矩阵,减少了显存占用。然而,这种方法仍会平均降低重要信息的重要性。
NSA采用“三合一”策略,分为压缩、选择性保留和滑动窗口三阶段。首先,压缩阶段保留粗颗粒度的token模块;其次,选择性保留阶段根据相关性选出关键模块;最后,滑动窗口仅获取局部最近的完整token序列。这种机制不仅节省显存,还能恢复压缩丢失的信息。
NSA还引入了硬件对齐系统和训练感知设计,支持高效部署和端到端训练。测试结果显示,NSA在某些基准测试上表现优于完整注意力机制,解码速度提升了11.6倍,正向和反向阶段分别提速9倍和6倍。
NSA有望解决国产大模型在GPU芯片上的瓶颈问题,并可能实现从推理到训练的全链条国产化。尽管论文未披露所有工程细节,但其他公司复现并不难。
原文链接
本文链接:https://kx.umi6.com/article/13797.html
转载请注明文章出处
相关推荐
换一换
六大AI大模型展开美股投资竞赛:重仓英伟达的Deepseek再次领跑
2025-10-28 18:00:23
需求塞爆服务器,OpenAI、谷歌对 Sora 和 Nano Banana Pro 采取“限流”措施
2025-11-29 23:44:54
深度解析:DeepSeek不差钱,为什么还要融500亿?
2026-05-09 19:34:13
DeepSeek陈德里开发自动研究Skill,写一篇论文人类只动脑2小时
2026-05-27 10:20:09
DeepSeek发布新论文提出更为高效的AI开发方法
2026-01-02 18:32:56
DeepSeek组建Harness团队,非「超能力者」不要?中国AI开启「做产品」的关键一跳
2026-05-21 18:58:24
Claude Mythos让梁文锋决定融资
2026-06-29 17:43:26
智谱GLM-5技术全公开!完全适配华为等国产芯片,美国网友酸了
2026-02-23 15:59:51
沐曦敲钟,和暄资本迎来三千亿IPO
2025-12-17 11:38:04
DeepSeek的一次小更新:暴打OpenAI 追上Gemini
2025-12-03 00:44:54
DeepSeek上线专家模式
2026-04-08 08:44:08
Meta也来卖铲子了!小扎:模型可以慢,GPU必须赚
2026-07-05 22:56:44
DeepSeek上线识图模式
2026-04-29 18:38:04
734 文章
831232 浏览
24小时热文
更多
-
2026-07-24 00:15:46 -
2026-07-24 00:14:08 -
2026-07-24 00:12:30