DeepSeek于2月24日启动“开源周”,首个开源项目为FlashMLA,这是针对Hopper GPU优化的高效MLA解码内核,适用于处理可变长度序列。FlashMLA灵感源自FlashAttention 2&3和cutlass项目。该项目要求Hopper GPU、CUDA 12.3及以上版本及PyTorch 2.0及以上版本。在CUDA 12.6环境下,H800 SXM5在内存受限配置下能达到3000 GB/s带宽,在计算受限配置下可达580 TFLOPS算力。更多信息可在其GitHub页面获取。
原文链接
本文链接:https://kx.umi6.com/article/14146.html
转载请注明文章出处
相关推荐
换一换
DeepSeek开源的FlashMLA有什么优势?
2025-02-24 18:33:37
斯坦福让“GPU高速运转”的新工具火了,比FlashAttention2更快
2024-06-07 19:50:16
DeepSeek开源FlashMLA Github瞬间破1000颗星
2025-02-24 12:19:23
DeepSeek开源周观察:让所有人都能用起来R1
2025-02-24 20:34:11
一文看懂DeepSeek 刚刚开源的FlashMLA,这些细节值得注意
2025-02-24 14:31:04
一文详解:DeepSeek刚开源的DeepGEMM是怎么回事?
2025-02-26 14:36:20
DeepSeek 代码库开源进度 1/5:为 Hopper GPU 优化的高效 MLA 解码内核 FlashMLA
2025-02-24 10:19:07
DeepSeek突破H800性能上限,FlashMLA重磅开源,算力成本还能降
2025-02-24 12:18:19
DeepSeek开源周Day1:FlashMLA:大家省,才是真的省
2025-02-24 22:35:01
Ubuntu 团队测试 AI 生成代码:总体表现尚可,但一小部分函数“完全错误”
2025-12-07 20:45:46
谷歌憋了十年的大招,让英伟达好日子到头了?
2025-12-08 12:25:18
OpenAI:ChatGPT 目前每周为超过 8 亿用户提供服务
2025-12-08 22:51:33
“微软小冰之父”李笛再创业:押注“认知大模型”,奇绩参与投资
2025-12-08 22:51:57
590 文章
372608 浏览
24小时热文
更多
-
2025-12-08 23:53:52 -
2025-12-08 22:52:38 -
2025-12-08 22:51:57