1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

标题:国产之光DeepSeek惊艳亮相,671B大模型训练仅需此前算力1/10,细节全公开

DeepSeek V3正式发布,延续“便宜大碗”的特点且完全开源。该模型参数量达671B,激活37B,在14.8T高质量token上预训练。在多项测评中,DeepSeek V3超越Llama 3.1 405B,与GPT-4o、Claude 3.5 Sonnet等模型匹敌,价格仅为Claude 3.5 Sonnet的9%。

DeepSeek V3训练耗时不到280万个GPU小时,而Llama 3 405B需3080万GPU小时。训练671B的DeepSeek V3成本为557.6万美元,而7B的Llama 2需76万美元。OpenAI创始成员Karpathy称赞其在有限算力下训练效率高,Meta科学家田渊栋惊叹其为“黑科技”。

新模型生成速度提升3倍,API价格大幅降低。DeepSeek V3在实测中表现优异,准确回答了关于自身版本的问题,超越其他模型。此外,DeepSeek V3支持FP8权重和BF16推理,现已开放使用。

贾扬清透露,DeepSeek团队早在2019年就具备相关技术,成就源于多年专业知识。

原文链接
本文链接:https://kx.umi6.com/article/10847.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
马斯克xAI新模型上线,通过“50米外洗车店”测试,回答偏好高度贴合老马本人
2026-02-18 16:31:22
DeepSeek急招Agent方向!一口气放17个岗位,重度Vibe Coding优先
2026-03-25 15:37:07
DeepSeek回应聊天记录搜索:正在灰度测试 并非全量推送
2026-05-12 15:16:09
Claude Mythos让梁文锋决定融资
2026-06-29 17:43:26
DeepSeek专家模式上线!深度思考+极速Token 复杂难题一键搞定
2026-04-08 10:49:12
微软研报称 DeepSeek 在中国 AI 市场份额达 89%,在白俄罗斯达 56%
2026-01-13 16:44:20
DeepSeek 为什么把缓存涨了 11 倍?长上下文需求暴涨,得交点「存储税」了
2026-08-18 10:40:58
阿里达摩院推出肝癌AI模型,精准识别1厘米微小肿瘤
2026-08-24 16:48:06
DeepSeek发布Agent Harness相关岗位 或推智能体产品
2026-05-20 16:47:33
最高涨价11倍后 DeepSeek再调价!周六日不设高峰期 全部按低谷期计费
2026-08-23 07:44:48
DeepSeek发布梁文锋署名新论文 开源相关记忆模块Engram
2026-01-13 09:25:44
DeepSeek招聘被「华为天才少年」公开吐槽,“面到最不专业的”
2026-07-07 20:37:24
特朗普政府据悉拟利用AI模型 为全球关键矿产贸易制定参考价格
2026-02-24 22:16:28
24小时热文
更多
扫一扫体验小程序