综合
7*24 快讯
AI科普
合作
全部
英雄令
项目方
开发者
产品方
投资者
大模型推理不仅拼GPU算力,更拼数据的传输效率。AI基础设施正从单纯“堆算力”转向计算、网络与存储的深度协同。
如今,存储已成为AI推理的核心资源。月之暗面的Mooncake系统将上下文缓存(KV Cache)独立调度,“以存储换计算”大幅提升系统承载力;NVIDIA的CMX平台则在显存和传统存储间...
原文链接
在2026 WAIC世界人工智能大会上,无问芯穹首次公布大模型推理系统新突破——跨集群异构推理架构PDD,并发布完整技术报告。该架构将传统PD分离解构为“P-RLD-MD”三级架构,通过广域网串联多地数据中心。其创新引入“中继站”RLD实例进行“接力跑”,成功攻克跨集群KV Cache传输延迟痛点。实测显示,该架构使首Token延迟降低51.5%,单Token成本直降37.5%,有效吞吐提升27.8%。此突破不仅显著提升用户体验,更盘活了全国分散的存量算力,实现全域异构资源最大化调度,为下一代大模型MaaS基础设施勾勒出极具弹性和经济性的新蓝图。
原文链接
#WAIC2026# 四大国产头部大模型集齐!在近日WAIC论坛上,MiniMax与阶跃星辰双双携手AI Infra企业“无问芯穹”,加上此前的智谱与Kimi,四家均与其达成深度合作。面对算力供需缺口,无问芯穹凭三大硬核实力破局:严格准入测试保模型精度;首创跨集群异构PDD架构,单Token成本降37.5%;发布运维智能体系统保集群稳定。目前,其“前店后厂一中心”Agentic Infra战略已落地,日均Token调用量较去年12月暴涨40倍,正筑牢AGI时代国产异构算力地基!
原文链接
【算苗3D TokenPU正式流片,国产AI大算力芯片再升级】2026年6月15日,算苗科技宣布其面向大模型推理的3D TokenPU芯片A4E正式流片。这标志着我国在高端AI算力领域,成功实现依托国产供应链的3D混合堆叠架构大模型专用处理器落地。该芯片首创3D TokenPU架构,通过8层存储晶圆垂直堆叠实现16TB/s超大访存带宽,有效突破推理“内存墙、算力墙、通信墙”瓶颈。A4E基于自研RISC-V架构,实现设计到制造全链路自主可控。目前,算苗科技正联手头部客户深耕千亿级推理市场,并获多家知名资本青睐,将为国内大模型产业提供自主、高性能的算力支撑。
原文链接
标题:计算所严明玉团队新作:Attention 并非永远是瓶颈,多 GPU 并不一定更快
随着大语言模型逐步应用于实际场景,推理性能成为落地的关键挑战。模型规模扩大、上下文增长以及 RAG、MoE 等新方法的引入,使得延迟、吞吐和能耗问题更加复杂。中国科学院计算所严明玉团队联合中国电信云计算研究...
原文链接
12月6日,xLLM社区将在北京举办主题为“共建开源 AI Infra 生态”的线下Meetup。作为成立仅三个月的新兴社区,xLLM首次全面展示其技术愿景、核心规划及生态全景,定位为下一代大模型推理引擎框架,支持多元化AI场景,如大语言模型、多模态生成、文生图和文生视频等。活动将揭秘其创新架构及未来演进方向,并分享与京东11.11大促合作提升业务效率5倍的成果。清华大学副教授章明星将解读Mooncake存储方案,北京智源人工智能研究院门春雷探讨硬件优化实践。xLLM已开源,适配国产算力,与昇腾合作探索高性能推理方案,未来还将联合清华、北大等产学研伙伴推动AI生态协同创新。诚邀开发者、研究者及行业伙伴参与交流。
原文链接
标题:KTransformers 成主流大模型推理引擎,单卡跑万亿模型
正文:
趋境科技与清华联合开源的高性能异构推理框架 KTransformers,已成为 Qwen、Kimi、智谱 AI 等主流大模型的推荐推理引擎,并被多家硬件厂商采纳。其技术实力获国际认可,论文入选“计算机系统领域奥斯卡”...
原文链接
斯坦福大模型推理课免费开放,谷歌推理团队创始人主讲
量子位 | 公众号 QbitAI
干货来了!谷歌DeepMind推理负责人Denny Zhou在斯坦福大学CS25课程上分享了关于大模型推理的精彩内容。这位Google Brain推理团队的创建者曾与清华姚班马腾宇等人证明:只要思维链足够长,T...
原文链接
标题:纯靠“脑补”图像,大模型推理准确率提升80%!剑桥谷歌新研究
正文:
不再依赖语言,仅凭图像就能完成模型推理?大模型再创SOTA!
当你玩超级玛丽时,会根据画面自动规划步骤,但传统语言模型还需先转成文字指令,效率低且易丢信息。有方法能跳过“语言中介”吗?
剑桥、伦敦大学学院与谷歌团...
原文链接
标题:Deepseek大模型推理算法其实很简单
性能顶级的Deepseek大模型开源后,人们轻松地将其部署使用。在配置一般的联想PC上,安装7B参数版本的Deepseek R1已成功。最强的671B版本需要更高配置,但也完全可行。
大模型开发包括训练和推理两部分,推理是较易的部分。有了权重文件,大模...
原文链接
加载更多
暂无内容