R2还没来，但DeepSeek的秘密武器已经“剧透”了

2025-08-01 09:10:49

电子诗篇

发布在

快讯

阅读：258

2025年7月31日，DeepSeek与北京大学联合发表的论文《Native Sparse Attention》获ACL最佳论文奖。该研究提出一种新方法NSA（原生稀疏注意力），首次将稀疏注意力引入完整训练流程，性能不降反升，推理速度提升11倍。NSA通过“粗读摘要、精读重点、强记最近”三种策略动态分配注意力，在长文本处理中表现优异，如64k长度序列的信息检索准确率达100%。此技术已在27B模型上完成预训练验证，未来或大幅降低AI使用成本，提升效率。搭载NSA的下一代DeepSeek模型备受期待。

原文链接

本文链接：https://kx.umi6.com/article/22791.html

转载请注明文章出处

原生可训练