近日,是石科技发布自研Meta-Infer高效推理引擎,通过纯软件优化大幅释放PCIe显卡及国产GPU算力潜力。针对大模型推理中硬件与框架的性能鸿沟,该引擎通过内核补齐、通信重构、并行调优及缓存复用等技术,在不改动模型的前提下实现性能飞跃。测试显示,在8卡PCIe环境下运行DeepSeek-V4.1-Flash,输入吞吐从1932 tok/s升至13274 tok/s,提升近7倍并支持百万级上下文,且在国产GPU上同样成效显著。在算力成本攀升的当下,此举为行业提供了“以软补硬”的新思路,让低成本硬件逼近高端GPU服务能力。
原文链接
本文链接:https://kx.umi6.com/article/38045.html
转载请注明文章出处
相关推荐
换一换
xLLM社区重磅首秀,揭秘大模型推理全景图与开源AI Infra生态
2025-11-24 21:15:56
算苗3D TokenPU正式流片 引领国产AI云端大算力芯片再升级
2026-06-17 18:50:47
计算所严明玉团队新作: Attention 并非永远是瓶颈,多 GPU 并不一定更快
2025-12-22 11:41:00
我读了读苹果的AI大模型论文,发现这几个秘密
2024-06-26 22:45:35
趋境开源框架 KTransformers 成主流大模型首选,Qwen、Kimi、智谱 AI 推荐,单卡跑万亿模型
2025-11-20 22:47:09
让用户无痛开发AI应用,袁进辉新公司获近亿元天使+轮融资 | 36氪首发
2024-07-04 12:29:16
Deepseek大模型推理算法其实很简单
2025-02-09 16:51:53
不同模型厂同一家Agentic Infra,AGI时代的地基终于浮出水面
2026-07-20 19:27:19
AI SSD:大模型推理的存储范式转移
2026-08-07 11:17:17
纯靠“脑补”图像,大模型推理准确率狂飙80%丨剑桥谷歌新研究
2025-05-21 17:08:17
“接力跑”盘活全国算力,PD分离终于破局:延迟砍半、成本直降近40%!
2026-07-30 14:44:14
斯坦福大模型推理课免费了,谷歌推理团队创始人主讲
2025-07-25 17:26:56
Apple的AI奠基性论文解读
2024-06-26 18:43:28
763 文章
973541 浏览
24小时热文
更多
-
2026-09-24 22:46:00 -
2026-09-24 19:41:17 -
2026-09-24 16:34:35