Kimi的新论文再次与DeepSeek的研究“撞车”,两者均探讨了长文注意力机制。这项名为MoBA的新型注意力机制,能将处理1M长文本的速度提升6.5倍,并已在Kimi平台上验证。
MoBA的核心在于: - 将长文本划分为块,使每个查询token自动关注最相关的KV块。 - 引入参数无关的top-k门控机制,确保模型聚焦于有用信息。 - 支持全注意力和稀疏注意力模式切换。
MoBA将MoE应用于注意力机制,遵循“less structure”原则,允许模型自主决定关注区域。结果表明,处理1M和10M长文本的速度分别提升了6.5倍和16倍,且无需高昂训练成本。
论文作者包括杨植麟,同时,DeepSeek也在相近时间公开了类似的注意力机制NSA。MoBA通过仅关注部分键值来提升效率,采用top-k门控机制挑选相关块,并通过细粒度块分割提高性能。实验显示,MoBA在长上下文处理中表现出色,且与全注意力模型性能相当。
原文链接
本文链接:https://kx.umi6.com/article/13778.html
转载请注明文章出处
相关推荐
换一换
Token一词该怎么翻译!清华教授提议中文名为模元
2026-03-20 16:48:30
月之暗面 MoBA 核心作者自述:一个 “新晋大模型训练师” 的三入思过崖
2025-02-21 14:53:27
AI巨头的Token补贴大战 快打完了吗?
2026-06-22 00:15:24
智源发布原生多模态世界模型 Emu3,宣称实现图像、文本、视频大一统
2024-10-22 00:42:45
清程极智:Token成为AI时代的 “水电煤”,中国AI产业从能用迈向好用
2026-05-28 12:21:43
妙啊!无人机直连卫星传Token
2026-07-18 16:31:45
卖Token也不是稳赚不赔!硅基流动招股书来了
2026-07-01 14:08:23
阶跃星辰发布Step-2 mini和Step文学大师模型
2025-01-20 16:28:10
高管一个月烧20亿Token自称惭愧:每月至少花100块给AI“交水电费”
2026-05-10 19:24:32
A社你解释下,啥叫Sonnet 5比Fable 5还贵?
2026-07-01 10:02:34
撞车DeepSeek NSA Kimi杨植麟署名的新注意力架构MoBA发布
2025-02-19 15:57:22
你打折、我免费 怎么AI圈突然打价格战了
2024-05-23 18:28:02
“Token”这个词的搜索量最高一天达到7.7万次 比去年日均搜索量高出1850%
2026-03-28 20:15:44
744 文章
819006 浏览
24小时热文
更多
-
2026-07-24 00:15:46 -
2026-07-24 00:14:08 -
2026-07-24 00:12:30