综合
7*24 快讯
AI科普
合作
全部
英雄令
项目方
开发者
产品方
投资者
11月5日,华为宣布开源其AI推理加速关键技术——UCM(Unified Cache Manager)推理记忆数据管理。该技术通过KV Cache多级缓存与推理记忆管理,结合推理框架、算力和存储的三层协同,解决长序列推理效率低和成本高的问题。UCM架构包含稀疏化模块、稀疏化KV管理器、KV Cache存储组件及UCM连接器等关键模块,具备稀疏注意力、前缀缓存等四大能力,最高可降低首Token时延90%,提升系统吞吐22倍,并扩展上下文窗口达10倍。目前,UCM已在ModelEngine社区开放源代码与技术文档,开发者可通过GitCode或Github获取资源。
原文链接
加载更多
暂无内容