综合
7*24 快讯
AI科普
合作
全部
英雄令
项目方
开发者
产品方
投资者
近日,vLLM原班人马创立的推理公司Inferact公布最新测试:用16块谷歌TPU v7运行Kimi K3模型,每秒生成709个Token,比同等数量的英伟达GB200 GPU快57%!该突破源于其自研的megakernel推理内核,将数百个小调度程序合并为一个大程序,消除带宽浪费,并深度融合DeepSeek的DSpark推测解码框架。在Qwen模型测试中,TPU优势更显著。Inferact今年初成立,已获a16z领投1.5亿美元融资,估值8亿美元。目前该TPU优化代码已全面开源,团队计划未来扩展至更多模型架构。
原文链接
斯坦福 Hazy Research 团队近期发布了一项重大优化成果:他们将开源模型 Llama-3.2-1B 的前向推理整合为一个名为“Megakernel”的单一 CUDA kernel,极大提升了推理速度。这项技术对于实时性强的应用场景尤为重要,例如对话式 AI 和交互式工作流。
团队发现,现有...
原文链接
加载更多
暂无内容