原生可训练 - AI优秘圈

综合

7*24 快讯

AI科普

合作

全部

英雄令

项目方

开发者

产品方

投资者

R2还没来，但DeepSeek的秘密武器已经“剧透”了

2025年7月31日，DeepSeek与北京大学联合发表的论文《Native Sparse Attention》获ACL最佳论文奖。该研究提出一种新方法NSA（原生稀疏注意力），首次将稀疏注意力引入完整训练流程，性能不降反升，推理速度提升11倍。NSA通过“粗读摘要、精读重点、强记最近”三种策略动态分配注意力，在长文本处理中表现优异，如64k长度序列的信息检索准确率达100%。此技术已在27B模型上完成预训练验证，未来或大幅降低AI使用成本，提升效率。搭载NSA的下一代DeepSeek模型备受期待。

原文链接