在2025年7月31日的ACL 2025颁奖典礼上,DeepSeek与北京大学联合发表的论文荣获*论文奖。其提出的原生稀疏注意力(NSA)机制通过算法与硬件协同优化,将长文本处理速度提升11倍,且性能超越传统全注意力模型。一作袁境阳透露,该技术可扩展上下文至1百万tokens,可能应用于下一代DeepSeek-V4及DeepSeek-R2模型。研究显示,NSA在多项基准测试中表现优异,尤其在复杂推理和长文本任务中显著领先。此外,会议还评选出其他三篇*论文,分别聚焦语言模型对齐弹性、公平性差异感知及大模型采样机制理论,为AI领域带来新洞见。
原文链接
本文链接:https://kx.umi6.com/article/22746.html
转载请注明文章出处
相关推荐
换一换
OpenAI发布GPT-4.1:开发者“特供”,超越4o,但还没遥遥领先
2025-04-15 15:34:47
DeepSeek 下一代技术提前曝光,梁文锋署名论文获 ACL 2025 最佳论文奖
2025-08-01 17:03:23
Qwen开源首个长文本新模型,百万Tokens处理性能超GPT-4o-mini
2025-01-27 14:30:40
摩尔线程完成DeepSeek-V4全链路工程化适配
2026-05-01 11:27:13
百度智能云上线DeepSeek-V4
2026-04-25 16:23:46
超算互联网推出DeepSeek-V4限时免费对话服务
2026-04-26 12:13:53
Deepseek官网公布deepseek-v4接口文档
2026-04-24 11:10:00
字节跳动开源长文本处理模型Seed-OSS-36B
2025-08-21 14:39:00
阿里通义千问发布 Qwen2.5-Turbo 开源 AI 模型:支持 100 万 tokens 上下文,处理时间缩短至 68 秒
2024-11-19 14:52:17
LG 发布 EXAONE 3.5 开源 AI 模型:长文本处理利器、独特技术有效降低“幻觉”
2024-12-11 09:21:31
DeepSeek-V4上线国家超算互联网
2026-04-24 18:30:24
别高估英伟达 别低估DeepSeek
2026-04-24 17:24:15
腾讯云TokenHub上架DeepSeek-V4
2026-04-24 16:22:09
745 文章
958905 浏览
24小时热文
更多
-
2026-09-06 21:14:00 -
2026-09-06 20:12:34 -
2026-09-06 20:10:47