华为推出盘古 Ultra,一款参数量135B的密集模型,性能媲美DeepSeek-R1,且训练全程无英伟达硬件参与。该模型在数学、编程等推理任务中表现出色,尤其在MMLU、TriviaQA等数据集上超越Llama 405B、DeepSeek-V3等模型。盘古 Ultra 采用创新的“三明治”层归一化架构及TinyInit初始化策略,解决了深层网络训练中的稳定性问题,实现了52%以上的算力利用率。模型训练依托8192张昇腾NPU组成的集群,结合多种并行策略与系统优化,确保高效运行。
原文链接
本文链接:https://kx.umi6.com/article/17191.html
转载请注明文章出处
相关推荐
换一换
神级项目训练GPT-2仅需5分钟,Andrej Karpathy都点赞
2024-11-22 14:02:04
58同城姚劲波:AI转型不能假手他人 企业家必须亲自驾驭AI
2026-09-06 13:58:43
陶哲轩吐槽GPT-6孪生素数新突破:令人无语的一幕
2026-09-05 13:13:13
把AI塞满Windows!微软高管终于反思了
2026-09-02 10:28:48
企业级Agent落地样板间!百融硅基员工批量上岗,按结果领工资
2026-09-02 11:26:07
黄仁勋140亿美元豪赌一只鸭
2026-09-04 17:33:09
模型公司每赚100美元 云厂商拿走近40美元
2026-08-30 14:53:25
B站首届AI创造公开赛收官,超八成参赛者为一人团队
2026-09-06 13:57:08
具身ICL来了创业玩家!上下文成Scaling新赛道
2026-09-06 20:10:47
GitHub最热架构图Agent,开发者故事看哭了
2026-09-01 16:48:05
千问办公上线首月用户数突破 3000万,企业用户占比过半
2026-09-04 14:20:03
DeepSeek V4 多模态开源,我们把它的视觉链路拆了一遍
2026-09-01 18:52:06
腾讯WorkBuddy联名硬件来了!首批100多家伙伴入场
2026-09-03 19:35:43
789 文章
1035817 浏览
24小时热文
更多
-
2026-09-06 21:14:00 -
2026-09-06 20:12:34 -
2026-09-06 20:10:47