1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

DeepSeek开源周第一天,推出了降本利器FlashMLA,突破了H800的性能上限。FlashMLA是专为Hopper GPU设计的高效MLA解码内核,针对可变长度序列进行优化,现已投入生产。

MLA由DeepSeek提出,通过低秩联合压缩技术,将多头注意力的键和值矩阵投影到低维空间,显著减少了KV缓存需求。V2版本使显存占用降至常用MHA架构的5%-13%,V3版本进一步提升了效率。

FlashMLA使用后,H800能达到3000GB/s内存带宽和580TFLOPS计算性能。网友们纷纷点赞,感谢工程团队的努力。

FlashMLA已在GitHub上线,短短一小时Star数超1.2k。该项目支持BF16,采用分页KV缓存,块大小为64。环境要求包括Hopper GPU、CUDA 12.3及以上版本和PyTorch 2.0及以上版本。

FlashMLA受FlashAttention 2&3和英伟达CUTLASS项目启发,后者是用于实现高性能矩阵运算的CUDA抽象集合。

原文链接
本文链接:https://kx.umi6.com/article/14161.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
硅谷巨头集体掉队!DeepSeek登顶全球大模型调用榜:国产AI包揽前五
2026-08-03 18:12:04
出圈一周年,DeepSeek的变与不变
2026-01-16 15:50:22
DeepSeek连更GitHub,华尔街回想起被支配的恐惧:“DeepSeek第二时刻”要来了
2026-02-24 13:45:27
DeepSeek上线识图模式
2026-04-29 18:38:04
六大AI大模型展开美股投资竞赛:重仓英伟达的Deepseek再次领跑
2025-10-28 18:00:23
DeepSeek估值,被一家安徽箱包公司给全部暴露了
2026-07-18 12:24:50
DeepSeek 开年发布新论文:提出全新 mHC 架构,梁文锋现身作者名单
2026-01-01 17:23:53
DeepSeek等开源模型,更“浪费”token吗?
2025-10-11 10:17:13
DeepSeek官方点赞元宝,罕见现身互动
2025-12-24 17:46:41
DeepSeek豪掷1.4亿护航宇树IPO,杭州绝代双骄战略合体
2026-08-07 09:09:17
DeepSeek服务恢复正常 此前崩溃约12小时
2026-03-30 10:43:55
DeepSeek新论文剧透V4新框架!用闲置网卡加速智能体推理性能
2026-02-27 16:53:38
用DeepSeek网页版就能瓜分鹅厂600万??!
2026-08-19 16:41:16
24小时热文
更多
扫一扫体验小程序