正文:近日,GitHub 上出现了一个名为“Modded-NanoGPT”的新项目,大幅提升了GPT-2模型的训练速度。该项目由Keller Jordan开发,仅需5分钟即可在8块H100 GPU上完成GPT-2的训练,相比Andrej Karpathy的“llm.c”项目,训练时间从45分钟缩短至5分钟。该项目采用了FlexAttention和大序列长度等新技术,使得训练过程更加高效。尽管准确率略有下降,但Modded-NanoGPT在10亿Fineweb tokens上训练了1875步,验证损失为3.278,而默认的llm.c PyTorch训练器在100亿tokens上训练了19560步后,验证损失大于3.28。此外,Modded-NanoGPT还引入了自研的Muon优化器,该优化器在内存使用、采样效率及挂钟开销方面表现优异。 摘要保留了关键的时间、地点、事件等信息,并符合新闻三要素。
原文链接
本文链接:https://kx.umi6.com/article/9132.html
转载请注明文章出处
相关推荐
换一换
OpenAI AI 安全策略遭质疑,前高管批评其“篡改公司历史”
2025-03-07 18:01:46
月之暗面开源改进版Muon优化器,算力需求比AdamW锐减48%,DeepSeek也适用
2025-02-23 18:01:37
英伟达含量为零:华为密集模型盘古 Ultra 性能比肩 DeepSeek-R1,纯昇腾集群训练
2025-04-15 12:30:55
Karpathy 4小时AI大课上线,小白看了都会从零构建GPT-2
2024-06-12 15:04:23
没有全科优秀,具身模型别想进入百万小时
2026-08-31 17:52:44
机器人不能停下来等模型:星尘发布 SmoothRL,让在线强化学习跟上大模型的异步推理
2026-09-04 18:32:46
A社化身A割!Claude官宣永久提额25%,结果到手反而少17%
2026-09-01 16:44:57
AQuA:让量化研究 Agent 持续进化,也让回测结果经得起检验
2026-08-31 11:34:56
微软发布全新版本Windows 11!64GB内存、250GB/s带宽起步
2026-09-06 20:12:34
20ms把PDF变成Markdown!开源OCR神器快了近300倍
2026-08-29 21:19:09
去年归国的徐梦迪,成了清华姚班班主任
2026-08-29 21:22:18
GPT-6曝光 OpenAI总裁说:AGI登场
2026-09-04 17:31:44
中美AI竞赛白热化!黄仁勋、马斯克罕见同声:过度监管AI就是在帮中国赢
2026-09-04 19:37:22
708 文章
891486 浏览
24小时热文
更多
-
2026-09-06 21:14:00 -
2026-09-06 20:12:34 -
2026-09-06 20:10:47