标题:DeepSeek公布545%成本利润率
DeepSeek最新发布的DeepSeek-V3/R1推理系统揭示了优化吞吐量和延迟的方法,包括跨节点EP驱动的批量扩展、计算与通信重叠及负载均衡。该系统每个H800节点每秒处理73.7k/14.8k个输入/输出token,成本利润率高达545%。
通过大规模跨节点专家并行(EP),DeepSeek提高了吞吐量并降低了延迟。EP使批处理大小增加,减少了延迟,但也引入了跨节点传输和负载均衡的问题。系统采用双batch重叠技术来掩盖通信开销,提高整体吞吐量。此外,还实现了Prefill和Decode阶段的负载均衡,确保每个GPU的计算和通信负载均衡。
DeepSeekV3和R1服务使用H800 GPU,24小时内峰值占用278个节点,平均226.75个节点。系统在高峰时段全节点运行,在低谷时段减少节点用于研究和训练。24小时内,系统处理了608B输入token,其中56.3%命中KVCache,输出168B token,平均输出速率为20~22tps。平均每台H800的吞吐量为73.7k输入token/s(含缓存命中)和14.8k输出token/s。若按DeepSeek R1的定价计算,理论日收入为$562,027,实际成本利润率为545%。
原文链接
本文链接:https://kx.umi6.com/article/14580.html
转载请注明文章出处
相关推荐
换一换
华为:让DeepSeek的“专家们”动起来,推理延迟降10%!
2025-05-20 14:38:41
官方详解 DeepSeek-V3 / R1 推理系统:优化目标是更大吞吐、更低延迟
2025-03-01 13:58:32
官方详解 DeepSeek-V3 / R1 推理系统:优化目标是更大吞吐、更低延迟
2025-03-01 13:58:32
西部数据WAIC 2026媒体资料包
2026-07-19 20:36:58
WAIC 2026 | 摩尔线程首次公开多项训练推理实践成果,三大“AI工厂”持续释放算力价值
2026-07-19 15:15:47
超越π0,中国团队用1B参数模型登顶具身智能榜单
2026-07-23 14:49:03
世界模型迎来「中国引领时刻」,昆仑万维 Matrix-Game 3.5 要迈向真实世界
2026-07-23 12:45:29
Windows真不差:实测AI性能3.4倍碾压Linux!
2026-07-20 18:30:38
美图拿出1亿元,面向全行业寻找AI影像Builder
2026-07-23 02:22:56
当AI进入最依赖“人”的行业:一家四线城市康复机构利润增长40%
2026-07-20 18:28:44
对话商汤林达华:多模态是 Coding 之后的下一个战场
2026-07-19 21:38:24
上海这场大赛有点“野”:让AI自主科研、控核聚变、认甲骨文
2026-07-23 09:36:06
芯片卖了56万片之后,阿里平头哥把最值钱的东西开源了
2026-07-23 10:41:31
825 文章
873779 浏览
24小时热文
更多
-
2026-07-24 00:15:46 -
2026-07-24 00:14:08 -
2026-07-24 00:12:30