标题:复刻DeepSeek-R1-Zero,沈向洋、姜大昕、张祥雨等开源RL训练方法
DeepSeek虽开源,但未公开训练代码和数据。近日,开源项目ORZ仅需1/30的训练步骤便能赶上DeepSeek-R1-Zero的蒸馏Qwen。该项目由国内大模型“六小强”之一的阶跃星辰联与清华联合发布,团队成员包括沈向洋、姜大昕及张祥雨。
ORZ在响应长度上,用约17%的训练步骤赶上DeepSeek-R1-Zero 671B。研究发现,在训练步骤约680步时,模型的训练奖励值、反思能力和回答长度显著提升,疑似出现“顿悟时刻”。
目前,所有训练数据、代码、论文及模型均已100%开源,采用MIT License。项目开源48小时内,已获700+星标。
团队证明,一种极简主义的方法——带有GAE的原版PPO,加上基于规则的奖励函数,足以在推理任务上扩大响应长度和基准性能。此外,稳定训练不依赖任何基于KL的正则化技术,这为强化学习规模扩展提供希望。
数据多样性和数量对ORZ训练至关重要。在Qwen2.5-Base-7B基础上,所有基准测试均经历奖励和响应长度的突然增加,类似涌现行为。最终,ORZ在MMLU和MMLU_PRO基准测试中,无需额外指令调整,即超越Qwen2.5 Instruct。
项目地址:https://github.com/Open-Reasoner-Zero/Open-Reasoner-Zero/
原文链接
本文链接:https://kx.umi6.com/article/14065.html
转载请注明文章出处
相关推荐
换一换
黄仁勋率先开源量子AI大模型
2026-04-15 12:57:46
蚂蚁开源业内首个 100B 扩散语言模型 LLaDA2.0
2025-12-12 15:57:42
通义万相全新动作生成模型开源
2025-09-19 15:17:03
美团视频生成模型正式发布并开源
2025-10-27 11:00:45
第 21 届开源中国开源世界高峰论坛圆满收官!
2026-06-30 16:26:15
美国《连线》杂志:再见,GPT5;你好,千问!
2025-12-29 15:27:00
阿里新一代模型Qwen3.5曝光
2026-02-09 13:10:49
腾讯混元OCR模型宣布开源
2025-11-25 15:00:37
美团发布开源 LongCat-Video 视频生成模型,可稳定输出 5 分钟级内容
2025-10-27 11:55:56
月之暗面新模型Kimi K2.6发布并开源
2026-04-21 09:55:37
蚂蚁集团、阿里云等正式加入PyTorch基金会,携手全球开源力量推动AI普惠
2026-07-20 13:09:45
阿里发布三款中型千问3.5新模型,每百万Token低至0.2元
2026-02-25 15:25:53
商汤开源空间智能大模型SenseNova-SI
2025-11-11 08:59:30
825 文章
873779 浏览
24小时热文
更多
-
2026-07-24 00:15:46 -
2026-07-24 00:14:08 -
2026-07-24 00:12:30