9月23日,小米正式发布并开源MiMo-V2.6大模型,包含Pro和Flash两款版本,支持1M上下文及多模态输入。此次升级核心聚焦后训练,将代码、Agent、视觉与安全任务纳入同一套强化学习系统。为应对长轨迹计算压力,模型采用滑动窗口注意力、稀疏MoE及推测解码架构,并引入全异步GRPO训练机制。此外,小米创新设计了GRS、GAR奖励机制与MOPD2蒸馏技术,打破传统二元奖励,实现过程质量比较与轨迹复用。这标志着Agent RL正从算法向系统工程演进,大幅提升训练反馈质量。
原文链接
本文链接:https://kx.umi6.com/article/38007.html
转载请注明文章出处
相关推荐
换一换
秒级生成百万级token!九章云极发布九章智算云Alaya NeW Cloud 2.0
2025-06-16 19:13:12
英伟达发布新 RL 范式:受 DeepSeek-R1 启发,重塑 AI 模型外部工具能力
2025-05-14 15:16:49
深夜突袭,DeepSeek-Prover-V2加冕数学王者!671B数学推理逆天狂飙
2025-05-05 09:43:44
蚂蚁集团开源 Awex 框架,秒级完成 TB 级参数交换
2025-11-20 10:17:17
发自 凹非寺量子位 | 公众号 QbitAI 奥特曼点名表扬了两个波兰人。 没有他们,OpenAI就不是今天的样子。 他们是OpenAI首席科学家Jakub Pachocki以及头衔为“Technical Fellow”的Szymon Sidor。 △左:Jakub Pachocki,右:Szymon Sidor 两人不仅是波兰老乡,而且是高中同学,读博时分别选择了计算机科学和机器人,后来又在OpenAI重聚。 在ChatGPT风靡全球、每天服务数亿用户的今天,奥特曼感慨大多数人永远不会想到背
2025-09-09 18:18:27
最新 AGI 暴论:强化学习的「GPT-3 时刻」实现,还需要 1 万年?
2025-07-14 17:29:16
Meta万引强化学习大佬跑路!用小扎原话作为离别寄语,扎心了
2025-08-26 13:43:07
汪军对话 Rich Sutton:大模型在一定程度上分散了我们对智能理解的注意力
2025-09-28 11:53:51
清华刘知远团队论文:在严格可控环境下重新回答「强化学习能否教会大模型新能力」丨ICLR 2026
2026-02-09 19:27:01
翁荔最新万字长文:Why We Think
2025-05-18 14:20:10
攻克强化学习「最慢一环」!交大字节联手,RL训练速度飙升2.6倍
2025-09-13 17:30:05
不更新参数就能强化学习!OpenAI翁家翌提出新范式:决策只需AI手搓一个.py 文件
2026-05-09 17:26:04
无需外部数据!AI自问自答实现推理能力进化
2025-08-08 16:13:47
721 文章
907359 浏览
24小时热文
更多
-
2026-09-23 13:41:46 -
2026-09-23 13:40:17 -
2026-09-23 13:38:54