1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

标题:4090单卡跑满血版DeepSeek-R1,清华团队开源项目再破大模型推理门槛

DeepSeek-R1广受关注,但推理服务器常宕机,专享版高昂成本让中小团队望而却步。市面上的“本地部署”方案多为参数量缩水90%的蒸馏版,因671B参数的MoE架构对显存要求极高,即便用8卡A100也难负荷。近期,清华大学KVCache.AI团队与趋境科技发布的KTransformers开源项目更新,支持在24GB显存的本地硬件上运行DeepSeek-R1和V3的671B满血版,预处理速度达286 tokens/s,推理生成速度达14 tokens/s。

该项目早在DeepSeek-V2时代便因“专家卸载”技术备受关注,支持236B模型在24GB显存的消费级显卡上流畅运行,显存需求降至1/10。新版发布后,开发者实测显示,借助Unsloth优化,Q2_K_XL模型的推理速度达9.1 tokens/s,实现千亿级模型“家庭化”。KTransformers团队还公布了v0.3预览版性能指标,CPU预填充速度最高达286 tokens/s,比llama.cpp快28倍,适用于长序列任务如大规模代码库分析。

KTransformers提供兼容HuggingFace Transformers的API及ChatGPT式Web界面,降低上手难度。其“模板注入框架”支持灵活切换量化策略、内核替换等优化。项目在localLLaMa社区热度高居不下,吸引上百名开发者参与讨论。团队详细介绍了技术细节,采用GPU/CPU异构计算划分策略,结合offload策略、高性能算子及CUDA Graph加速,大幅提升推理性能。KTransformers兼容多种MoE模型和算子,支持Windows和Linux平台,为科研工作者提供低成本的推理路径。

原文链接
本文链接:https://kx.umi6.com/article/13199.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
Llama 4发布:我看到了DeepSeek的影子
2025-04-06 16:06:56
网易有道全面拥抱DeepSeek-R1,推理大模型加速个性化教学升级
2025-02-06 18:36:42
百度文小言(原文心一言)App 接入 DeepSeek-R1 模型
2025-02-11 08:44:03
AI界“拼多多”DeepSeek国内外刷屏!龙头20CM一字板,受益上市公司梳理
2025-02-01 16:25:38
上海AI公司开源模型登上全球第二
2025-07-03 07:50:43
服务器总是繁忙 DeepSeek-R1本地部署图文版教程来了
2025-02-14 17:41:59
Kimi 16B胜GPT-4o!开源视觉推理模型:MoE架构,推理时仅激活2.8B
2025-04-10 13:47:48
清库存!DeepSeek突然补全R1技术报告,训练路径首次详细公开
2026-01-08 20:30:33
多模态版DeepSeek-R1:评测表现超GPT-4o,模态穿透反哺文本推理能力!北大港科大出品,已开源
2025-02-06 09:24:07
DeepSeek全尺寸模型上线阿里云百炼
2025-02-09 14:48:13
vivo 正式上线满血版 DeepSeek-R1
2025-02-25 17:01:36
趋境开源框架 KTransformers 成主流大模型首选,Qwen、Kimi、智谱 AI 推荐,单卡跑万亿模型
2025-11-20 22:47:09
百度搜索 PC 端上线 DeepSeek-R1 满血版,提供联网服务
2025-02-21 15:53:26
24小时热文
更多
扫一扫体验小程序