1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议
综合
7*24 快讯
AI科普
合作
全部
英雄令
项目方
开发者
产品方
投资者
刚刚,全球首个具身专属的MoE视频模型,开源了!
7月9日,蚂蚁灵波正式开源全球首个面向具身智能的大规模MoE视频基础模型及物理引擎LingBot-Video。与侧重画质的通用模型不同,它专为机器人打造,核心聚焦物理规律。其采用MoE架构,30B参数推理仅激活3B,大幅降低成本;引入超7万小时具身视频数据,并加入多维强化学习奖励系统,确保生成内容符合物理逻辑。目前,该模型已在RBench评测中超越业内通用标杆。LingBot-Video不仅能生成视频,更可作为机器人的数据引擎、策略评估器与动作规划器,标志着AI视频模型正从内容创作工具向物理世界模拟器迈进,为下一代机器人大脑奠定基础。
虚拟微光
07-09 14:03:20
分享至
打开微信扫一扫
内容投诉
生成图片
英伟达MoE新开源:一行import,微调加速3.7倍
【英伟达开源新工具:一行代码让大模型微调提速3.7倍】2026年6月,英伟达最新开源了专为生成式人工智能打造的NeMo AutoModel工具。在现有主流框架基础上,开发者无需修改接口,仅需添加一行导入代码,即可让混合专家模型微调提速3.4至3.7倍,并减少约三成的显卡显存占用。该方案引入专家并行等三大核心技术,大幅降低内存压力并加速运算。实测在八张H100显卡上微调Qwen3模型,吞吐量提升达3.69倍。目前相关代码与配置已在GitHub全面开源,为开发者提供极简的升级方案。
智能涌动
06-26 12:03:37
分享至
打开微信扫一扫
内容投诉
生成图片
Mythos架构被22岁小伙“逆推”开源了!MoE和注意力借鉴DeepSeek
Mythos架构被22岁小伙“逆推”开源!MoE与注意力借鉴DeepSeek 听说Mythos因“太危险”被封印?一位22岁的开发者Kye Gomez反手将其“重建”并开源,命名为OpenMythos。这一项目整合了公开研究和对Claude Mythos架构的主流推测,实现了一种带有混合专家(MoE...
AI创意引擎
04-20 16:12:29
分享至
打开微信扫一扫
内容投诉
生成图片
OpenAI突然开源新模型!99.9%的权重是0,新稀疏性方法代替MoE
正文:2025年12月,OpenAI开源新模型,采用Circuit Sparsity技术,99.9%权重为零,仅保留关键连接,提升模型可解释性。该方法通过稀疏性约束,将模型计算过程可视化为电路图,避免传统稠密Transformer的黑箱问题,解决AI决策不透明难题。相比主流MoE模型,Circuit Sparsity追求原生稀疏性,减少信息干扰,但算力成本高,训练和推理效率低。团队提出两种优化方向:从密集模型提取稀疏电路或改进训练机制。未来计划扩展至更大模型,探索复杂推理电路。此研究为AI可解释性迈出重要一步。参考链接:[1] [2]
跨界思维
12-14 14:46:00
分享至
打开微信扫一扫
内容投诉
生成图片
MoE那么大,几段代码就能稳稳推理 | 开源
MoE模型推理,几段代码就能稳稳搞定 | 开源 混合专家网络(MoE)已成为当前大模型主流架构之一。以盘古Pro MoE为例,其基于MoGE架构构建,总参数量达720亿,激活参数量160亿,专为昇腾硬件优化,在性能与效率上表现优异。 华为最新开源项目Omni-Infer,实现了对超大规模MoE模型推...
LunarCoder
07-02 18:09:04
分享至
打开微信扫一扫
内容投诉
生成图片
训练MoE足足提速70%!华为只用了3招
标题:训练MoE提速70%!华为的三大优化策略 正文: Scaling Law推动下,MoE成为各大模型厂商扩展能力的关键工具。然而,MoE在提升参数规模的同时,也带来了训练效率低下的问题,甚至一半以上的时间浪费在“等待”上。 华为推出了名为Adaptive Pipe & EDPB的...
智慧轨迹
06-03 15:58:16
分享至
打开微信扫一扫
内容投诉
生成图片
每2秒吃透一道高数大题!华为终于揭秘准万亿MoE昇腾训练系统全流程
标题:每2秒破解一道高数难题!华为揭秘准万亿MoE昇腾训练系统全流程 正文: 现在,请大家数一下“1”、“2”。 短短2秒,一个准万亿MoE大模型已经学会解答一道高等数学难题! 更令人惊叹的是,这套系统全流程基于国产技术,不依赖GPU。 这就是华为通过“昇腾+Pangu Ultra Mo...
智能视野
05-30 16:54:34
分享至
打开微信扫一扫
内容投诉
生成图片
一个「always」站在大模型技术C位的传奇男子
标题:一个「always」站在大模型技术C位的传奇男子 正文: 怎么老是你??? 这是最近网友不断对着Transformer八子之一的Noam Shazeer(我们称他为沙哥)发出的灵魂疑问。尤其是在Meta FAIR研究员朱泽园分享《Physics of Language Models》项...
量子思考者
05-10 12:04:35
分享至
打开微信扫一扫
内容投诉
生成图片
已节省数百万GPU小时!字节再砍MoE训练成本,核心代码全开源
标题:字节开源COMET,大幅降低MoE训练成本 正文: 字节开源了名为COMET的MoE优化技术,已应用于其万卡训练集群,累计节省数百万GPU小时。COMET可将MoE模型训练成本降低40%。 COMET针对MoE模型在分布式训练中的通信开销问题,通过细粒度计算-通信折叠技术和动态资源分配,提升了训练效率。在大规模MoE模型的单个执行层上,COMET可提速1.96倍,端到端平均提速1.71倍。 COMET通过共享张量依赖解析和自适应负载分配,解决了计算与通信的粒度不匹配问题。它还支持业界主流大模型,无需复杂改动即可部署。COMET在多个大规模MoE模型中表现出色,端到端性能提升31.8%-44.4%。 目前,COMET核心代码已开源,包括约1.2万行C++和CUDA代码,以及2千行Python代码,并提供Python API。
WisdomTrail
03-11 16:36:46
分享至
打开微信扫一扫
内容投诉
生成图片
DeepSeek前实习生魔改MoE,用迭代机制把内存需求砍了42%,团队:“免费午餐”优化方法
标题:DeepSeek前实习生优化MoE,迭代机制减少42%内存需求 DeepSeek前实习生优化MoE,迭代机制减少42%内存需求 西风 发自 凹非寺 量子位 | 公众号 QbitAI DeepSeek推出名为CoE(Chain-of-Experts)的新方法,内存需求减少17.6%-42...
量子思考者
03-08 11:43:54
分享至
打开微信扫一扫
内容投诉
生成图片
加载更多
暂无内容
AI热搜
更多
扫一扫体验小程序