DeepSeek的新注意力机制论文再次引发热议。论文提出了一种名为NSA(Native Sparse Attention)的可原生训练的稀疏注意力机制,旨在解决大模型上下文建模中计算成本高的问题。
实验显示,NSA在64k上下文解码时,前向传播速度提升9倍,反向传播速度提升6倍,解码速度提升11.6倍,且不影响性能。NSA通过动态分层稀疏策略、粗粒度Token压缩和细粒度Token选择来实现这些改进。
NSA的核心方法包括: - 动态分层稀疏策略 - 粗粒度Token压缩 - 细粒度Token选择
这些方法通过压缩、选择和滑动窗口策略优化注意力输出,保持高稀疏率,减少计算量并避免信息丢失。NSA在多项基准测试中表现出色,特别是在推理任务DROP中,性能显著提升。
研究人员使用27B参数规模的模型进行实验,结果表明NSA不仅收敛稳定,而且损失值更低。此外,NSA在8-GPU A100系统上的训练加速效果显著,尤其是在64k上下文长度时。
论文作者为DeepSeek团队,梁文锋亲自提交至arXiv。这一进展引发了关于大模型训练效率的新思考,可能开启一条更高效、更本地化的路径。
原文链接
本文链接:https://kx.umi6.com/article/13799.html
转载请注明文章出处
相关推荐
换一换
曾被扒出换皮DeepSeek 日本企业抱团砸万亿日元押注国产AI
2026-04-13 17:10:16
DeepSeek的一次小更新:暴打OpenAI 追上Gemini
2025-12-03 00:44:54
DeepSeek发布Agent Harness相关岗位 或推智能体产品
2026-05-20 16:47:33
六大AI大模型展开美股投资竞赛:重仓英伟达的Deepseek再次领跑
2025-10-28 18:00:23
Kimi即将完成20亿美元融资 DeepSeek被曝投后估值或达450亿美元
2026-05-06 20:37:20
全球 6 大顶级 AI 实盘厮杀,Deepseek 三天收益爆赚 36% 傲视群雄
2025-10-22 08:40:07
DeepSeek网页版大升级!随后宕机11小时崩上热搜,新模型真的来了
2026-03-30 11:42:07
DeepSeek组建Harness团队,非「超能力者」不要?中国AI开启「做产品」的关键一跳
2026-05-21 18:58:24
DeepSeek更新GitHub仓库 新模型“MODEL1”曝光
2026-01-21 11:03:39
DeepSeek发布新论文提出更为高效的AI开发方法
2026-01-02 18:32:56
DeepSeek:特殊字符引发模型幻觉 不涉及安全问题或隐私泄露
2026-05-19 19:54:37
DeepSeek 声明:防范冒用“深度求索”名义实施诈骗
2025-09-18 12:52:40
单用户提速 60-85% !DeepSeek 联手北大开源 DSpark ,突破推理加速工程问题
2026-06-29 15:45:21
777 文章
821197 浏览
24小时热文
更多
-
2026-07-24 00:15:46 -
2026-07-24 00:14:08 -
2026-07-24 00:12:30