1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议
综合
7*24 快讯
AI科普
合作
全部
英雄令
项目方
开发者
产品方
投资者
谷歌TPU跑Kimi比英伟达GPU快57%!用的还是DeepSeek推理框架
近日,vLLM原班人马创立的推理公司Inferact公布最新测试:用16块谷歌TPU v7运行Kimi K3模型,每秒生成709个Token,比同等数量的英伟达GB200 GPU快57%!该突破源于其自研的megakernel推理内核,将数百个小调度程序合并为一个大程序,消除带宽浪费,并深度融合DeepSeek的DSpark推测解码框架。在Qwen模型测试中,TPU优势更显著。Inferact今年初成立,已获a16z领投1.5亿美元融资,估值8亿美元。目前该TPU优化代码已全面开源,团队计划未来扩展至更多模型架构。
智慧轨迹
09-26 16:15:37
分享至
打开微信扫一扫
内容投诉
生成图片
Andrej Karpathy 盛赞!斯坦福团队新作,让Llama-1B 实现毫秒级推理
斯坦福 Hazy Research 团队近期发布了一项重大优化成果:他们将开源模型 Llama-3.2-1B 的前向推理整合为一个名为“Megakernel”的单一 CUDA kernel,极大提升了推理速度。这项技术对于实时性强的应用场景尤为重要,例如对话式 AI 和交互式工作流。 团队发现,现有...
小阳哥
06-03 12:57:05
分享至
打开微信扫一扫
内容投诉
生成图片
加载更多
暂无内容
AI热搜
更多
扫一扫体验小程序