1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

当AI执行写代码等复杂任务时,需要记住大量历史信息,这些“记忆”在技术上叫KV Cache,就像模型的“草稿本”。任务越长,草稿本越厚,昂贵的GPU显存很快就装不下了。

显存告急时,系统只能清掉部分草稿。等AI再次需要这些信息时,GPU就得重算一遍。这不仅让用户等待时间变长,还浪费了宝贵的算力。

破局之道是“以存代算”,把记忆交给CPU管理。系统可将暂时不用的草稿转移到CPU侧的内存或硬盘中,为GPU腾出空间。

为了让存取更高效,英特尔推出了KV Shrink等优化技术。它利用CPU内置的QAT专用硬件加速压缩草稿,能无损节省20%至30%的存储空间,且几乎不增加延迟。测试表明,该技术能让模型的首字响应速度最高提升约5倍。

简而言之,让GPU专心做“新题”,让CPU和存储系统帮忙管理“旧草稿”,避免重复计算。这不仅能让大模型响应更快,还能大幅降低数据中心的运营成本。

原文链接
本文链接:https://kx.umi6.com/article/37883.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
中国企业调用大模型日均达37万亿tokens
2026-02-24 13:54:18
智谱首份业绩报告:商业化全面爆发,Maas平台ARR达17亿元提升60倍
2026-03-31 18:02:15
宇树科技王兴兴:谁能把机器人用的大模型做出来 谁就是全世界最厉害的AI公司和机器人公司
2026-01-30 12:25:48
赛博朋克修车!网友用笔记本跑大模型查故障:不如200元买OBD
2026-09-02 19:47:51
刚刚,港股AGI第一股杀疯了!Agent业务半年进账近5亿,Token收入Q2暴涨500%
2026-08-28 18:21:32
马年4大顶流模型会师阿里云Coding Plan开工!Token量大管饱,自由切换真香
2026-02-26 00:01:12
微博CEO吐槽Manus能力拉跨:后悔买大模型年费包
2026-08-29 00:36:54
「超级周期」,初步验证
2026-01-30 13:32:01
智谱AI今日正式上市,一文讲透你想知道的6件事
2026-01-09 21:35:10
阶跃星辰杀入季后赛,强势跻身AI“新六小虎”第一梯队
2026-02-27 15:48:37
全球开发者狂喜!Codex移除5小时限制,Fable 5订阅再延7天,有人烧token烧到住院
2026-07-13 13:10:48
Kimi即将推出新一代万亿大模型:开源王者刷新 去年已超GPT5
2026-01-20 22:33:50
花旗:将英特尔目标价由48美元升至95美元 评级升至“买入”
2026-04-27 15:22:34
24小时热文
更多
扫一扫体验小程序