标题:复刻DeepSeek-R1-Zero,沈向洋、姜大昕、张祥雨等开源RL训练方法
DeepSeek虽开源,但未公开训练代码和数据。近日,开源项目ORZ仅需1/30的训练步骤便能赶上DeepSeek-R1-Zero的蒸馏Qwen。该项目由国内大模型“六小强”之一的阶跃星辰联与清华联合发布,团队成员包括沈向洋、姜大昕及张祥雨。
ORZ在响应长度上,用约17%的训练步骤赶上DeepSeek-R1-Zero 671B。研究发现,在训练步骤约680步时,模型的训练奖励值、反思能力和回答长度显著提升,疑似出现“顿悟时刻”。
目前,所有训练数据、代码、论文及模型均已100%开源,采用MIT License。项目开源48小时内,已获700+星标。
团队证明,一种极简主义的方法——带有GAE的原版PPO,加上基于规则的奖励函数,足以在推理任务上扩大响应长度和基准性能。此外,稳定训练不依赖任何基于KL的正则化技术,这为强化学习规模扩展提供希望。
数据多样性和数量对ORZ训练至关重要。在Qwen2.5-Base-7B基础上,所有基准测试均经历奖励和响应长度的突然增加,类似涌现行为。最终,ORZ在MMLU和MMLU_PRO基准测试中,无需额外指令调整,即超越Qwen2.5 Instruct。
项目地址:https://github.com/Open-Reasoner-Zero/Open-Reasoner-Zero/
原文链接
本文链接:https://kx.umi6.com/article/14065.html
转载请注明文章出处
相关推荐
换一换
腾讯混元3D-Omni、混元3D-Part发布并开源
2025-09-26 18:33:53
智谱上线并开源文本转语音模型 GLM-TTS:只需 3 秒语音样本即可克隆声音
2025-12-11 10:42:18
荣耀推出智能体基础模型MagicAgent 面向全球开源
2026-03-03 16:20:21
腾讯混元开源全新翻译模型Hy-MT2 ,上线小程序「腾讯Hy翻译」
2026-05-21 18:54:02
Anthropic最先进模型Claude 5遭美国管制!智谱一句话太提气:股价暴涨32%
2026-06-15 18:06:28
AI助手OpenClaw爆火:一个24小时不休息的数字管家
2026-02-01 00:05:18
真如摄影、细至发丝!阿里开源新一代图像生成模型Qwen-Image
2025-12-31 21:40:29
网易有道发布TTS语音合成引擎Confucius4-TTS:3秒音频素材即可语音克隆
2026-06-23 17:48:26
对话Kimi付强:别把模型当宠物圈养,追逐AGI就要让模型与人类共同演化
2025-10-04 10:57:38
2700GB高质量数据,训出空间智能SOTA,背后秘诀全栈开源
2026-03-31 14:51:34
全球首个医疗视频理解大模型开源!6k+组精标测试集与英雄榜同步上线,开发者速来!
2026-04-26 14:16:11
小米全面开源具身大模型MiMo-Embodied
2025-11-21 21:43:50
Claude封杀龙虾后推自家Agent服务,又被开源平替了
2026-04-09 15:12:47
842 文章
1015803 浏览
24小时热文
更多
-
2026-09-07 10:44:22 -
2026-09-06 21:14:00 -
2026-09-06 20:12:34