2月18日,DeepSeek团队发布论文介绍新机制NSA(Natively Sparse Attention),专为长文本训练与推理设计。NSA通过动态分层稀疏策略和硬件优化,显著提升AI模型在长上下文推理中的性能,同时降低成本。DeepSeek创始人梁文锋是该论文作者之一。NSA在通用及长文本任务中表现出色,尤其在链式推理等复杂任务中展现潜力,推理速度大幅提升,最高可达11.6倍。此技术有望扩展大语言模型的应用范围。
原文链接
本文链接:https://kx.umi6.com/article/13719.html
转载请注明文章出处
相关推荐
换一换
Meta使用阿里千问优化其最新AI模型
2025-12-11 00:19:01
模型免费、推理翻倍:Gemini 3 Flash 深夜炸场
2025-12-18 12:42:55
马斯克的最快AI模型来了
2025-09-16 12:09:37
严防死守!美国AI三巨头封杀中国模型蒸馏
2026-04-07 18:11:07
AI 模型加速创意呈现 华硕RTX50显卡为创作添彩!
2026-03-25 17:45:59
资金算力决定论下的「1%」例外
2025-12-09 10:28:45
Meta 砸 143 亿美元投资 Scale AI 仅数月,双方合作关系出现裂痕
2025-08-31 10:00:15
OpenAI据悉完成了新AI模型的初步开发
2026-03-25 04:57:32
研究称 AI 模型或将形成自己的“生存驱动力”,避免被人类关闭命运
2025-10-27 08:48:45
马斯克的最强 AI 模型 Grok 4 现已免费开放,非订阅用户每天可限量使用
2025-08-11 10:02:03
小米双模型正式开源!MiMo-V2.5-Pro无中断肝出“macOS”:54个应用全开、浏览器真能冲浪
2026-04-29 09:06:54
OpenAI 想赢的不是下一次发布会,而是下一代入口
2025-12-19 21:10:33
OpenAI 的“iPhone 时刻”:奥尔特曼称 GPT-5 是全球最佳写作、编程 AI 模型,免费 ChatGPT 用户也能体验
2025-08-08 03:00:19
753 文章
836492 浏览
24小时热文
更多
-
2026-07-24 00:15:46 -
2026-07-24 00:14:08 -
2026-07-24 00:12:30