1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议
综合
7*24 快讯
AI科普
合作
全部
英雄令
项目方
开发者
产品方
投资者
103μs 降到 18μs 背后,Cursor 为何剑指英伟达,重写 GPU?
英伟达最新GPU算力逆天,但在训练MoE(混合专家)大模型时,GPU间传数据仍会“堵车”。MoE模型像个大餐厅,数据需动态分配给不同GPU上的“专家”。传统的“主动推送”方式需要复杂的协调与同步等待,导致GPU经常闲置。 为此,Cursor开源了MoK技术,重写GPU底层工作流。首先,改“推”为“拉(Pull)”,让目标GPU主动去取数据,省去繁琐协调,将同步延迟从103微秒暴降至18微秒。其次,MoK把“传数据”和“算数据”塞进同一个内核,精准分配资源,让通信和计算无缝重叠、同时干活。此外,它还引入环形缓冲区等机制,优化显存与计算节奏。 这套“微操”效果显著:在英伟达GB300集群上,MoK让端到端单卡训练吞吐量大幅提升约41%。 这揭示了一个真相:硬件再快,也救不了低效的软件调度。如今的AI竞争已卷到底层,未来决定AI公司实力的,不仅是拥有多少数据,更是其代码能多深地扎进硬件底层。
心智奇点
08-28 15:16:59
分享至
打开微信扫一扫
内容投诉
生成图片
加载更多
暂无内容
AI热搜
更多
扫一扫体验小程序