1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

标题:榨干GPU性能,中兴Mariana突破显存壁垒

正文:
大语言模型(LLM)在各行业的应用日益广泛,但推理效率与显存成本之间的矛盾愈发突出。KV Cache作为提升生成速度的核心技术,却因显存占用过高成为制约模型扩展和并发能力的瓶颈。如何高效扩展KV Cache存储空间,已成为AI领域的关键挑战。

业界已有多种探索:Nvidia的Dynamo项目通过多级缓存算法实现数据自动迁移,但延迟开销较高;微软的LMCache兼容性强但分布式支持不足;阿里巴巴的远端存储方案扩展性好,但读写性能难以满足低延迟需求。CXL(Compute Express Link)作为一种新兴高速互联技术,为解决内存瓶颈带来希望,但相关研究仍处于起步阶段。

在此背景下,中兴通讯与华东师范大学联合提出了一种名为Mariana(马里亚纳)的分布式共享KV存储技术。其论文发表于IEEE TPDS期刊,展示了三大创新点:
1. 细粒度并发控制:将锁粒度从节点级细化到条目级,减少竞争并提高吞吐量。
2. 定制化数据布局:分离Key和Value存储,优化SIMD加速查找路径。
3. 自适应缓存策略:利用Count-Min Sketch算法快速识别热点数据,显著降低加载延迟。

实验表明,Mariana在读写吞吐和延迟性能上均优于现有方案,尤其适合KV Cache“读多写少”的场景。其解耦内存架构支持大容量存储、高吞吐、低延迟读取及水平扩展,可显著提升大模型推理性能。

基于vLLM框架的测试显示,在GPU显存仅能容纳50% KV数据的情况下,Mariana扩展的多级存储显著提升了推理效率。更重要的是,Mariana的设计与CXL生态高度契合,未来可通过简单适配充分利用CXL的低延迟优势,助力构建下一代大模型推理基础设施。

随着CXL技术成熟和Mariana等方案的落地,百亿/千亿参数模型有望在普通硬件上高效运行,AI算力红利将真正惠及各行各业。

原文链接
本文链接:https://kx.umi6.com/article/24182.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
谷歌新论文把内存股价干崩了!KV cache压缩6倍,网友:硅谷成真了 profile-avatar
2026-03-26 11:53:48
Kimi新论文:把KVCache玩成新商业模式了
2026-04-19 19:19:25
小米给KV Cache减负80%!MiMo团队推出混合稀疏注意力架构
2026-02-07 19:19:57
郭明錤:不存在“压缩KV Cache就能消除内存需求”的逻辑
2026-04-13 08:48:12
铠侠将投资360亿日元研发AI用CXL省电存储器
2024-11-07 10:49:53
2.9 Exaflops全液冷巨兽!AMD首套AI机架Helios亮相:向NVIDIA发起全面挑战
2026-07-21 11:04:04
2026世界人工智能大会 | 启鸣达人首发《世界模型驱动的教育AGI白皮书》
2026-07-22 14:02:30
别再写提示词,Claude官方亲自教你用4种循环自动干活
2026-07-20 13:19:34
冷门的哲学,成了“治”AI的热门
2026-07-19 21:35:46
WAIC重磅成果|仪电智算云在国家人工智能应用中试基地建设中展现全栈服务能力
2026-07-21 18:15:46
世界模型迎来「中国引领时刻」,昆仑万维 Matrix-Game 3.5 要迈向真实世界
2026-07-23 12:45:29
姚卯青、张正友、徐丹飞等七位大佬同席,这届 WAIC 把具身未来聊透了
2026-07-20 16:19:36
懂你、能交付、专业操作:金山办公田然给出AI办公助理的三项标准
2026-07-22 11:55:53
24小时热文
更多
扫一扫体验小程序