综合
7*24 快讯
AI科普
合作
全部
英雄令
项目方
开发者
产品方
投资者
最近,Kimi研究员苏剑林复盘了Kimi K3模型的核心技术。K3拥有2.8万亿参数,其核心秘诀在于“扩容不增本”。
首先是“专家分工”。K3内置896个专家,每次仅激活16个。为降低通信成本,K3采用LatentMoE技术,将信息压缩后再发给专家。这让专家分工更细,并保留2个共享专家处理基础任务。...
原文链接
DeepSeek开源周启动,首个项目FlashMLA聚焦于优化可变长度序列的推理服务,特别针对英伟达Hopper GPU设计。FlashMLA在H800 SXM5平台上,内存带宽可达3000GB/s,计算性能达580TFLOPS,已获全球开发者广泛关注,GitHub Star数突破5000。
Fla...
原文链接
今天,DeepSeek开源项目FlashMLA迅速走红网络,仅数小时便收获超过3.5K Star。FlashMLA是针对Hopper GPU优化的高效MLA(多头潜在注意力)解码内核,支持变长序列处理,现已投入生产。
FlashMLA通过优化MLA解码和分页KV缓存,提高了大语言模型的推理效率,尤其...
原文链接
DeepSeek近日因其突破性进展引发关注。该公司投入超5亿美元,拥有约5万块Hopper GPU,招募150多名顶尖人才,年薪高达934万人民币。DeepSeek的多头潜注意力机制(MLA)将查询KV量减少93.3%,显著降低推理成本。其模型R1在性能上与o1相当,但成本更低。DeepSeek的成功挑战了OpenAI的市场地位,推动了AI领域的竞争。
原文链接
加载更多
暂无内容