标题:01年实习生被曝负责字节RL核心算法!系字节LLM攻坚小组成员
衡宇 发自 凹非寺
量子位 | 公众号 QbitAI
一个超越DeepSeek GRPO的关键RL算法出现了!用上该算法后,Qwen2.5-32B模型仅靠RL训练,在AIME 2024基准上拿下50分,优于使用GRPO算法的DeepSeek-R1-Zero-Qwen,且训练步数减少50%。该算法名为DAPO,由字节、清华AIR联合实验室SIA Lab出品,现已开源。
论文通讯作者和开源项目负责人是01年出生的清华博士生禹棋赢。他本科毕业于哈工大,直博进入清华AIR,目前博士三年级在读。去年加入字节「Top Seed人才计划」,成为攻坚小组唯一的实习生,负责RL方向研究。
禹棋赢去年锁定大语言模型推理方向,与导师王明轩确定目标:打造强推理能力模型。基于观察到“采样更多,弱模型准确率也可提升”,他坚定选择RL路径。9月,RL与CoT结合大幅提升逻辑准确性,验证了方向正确。
10月,团队在字节内部跑通DeepSeek-R1的Aha Moment,发现模型能反思并换思维。禹棋赢判断这是outcome-based RL的潜力,随后迭代出DAPO算法。加入LLM攻坚小组后,他每天和导师讨论到深夜,甚至在公司打地铺。
禹棋赢的新目标是研究RL的scaling规律。他的成功案例体现了大模型行业对实际解决问题能力的重视,而非资历。学界和工业界均认可这种趋势,认为谁靠近前沿,谁就能定义规则。
量子位独家获悉,字节今年将继续Top Seed项目,由吴永辉亲自带队。
原文链接
本文链接:https://kx.umi6.com/article/15852.html
转载请注明文章出处
相关推荐
换一换
混元OCR模型核心技术揭秘:统一框架、真端到端
2025-11-30 11:05:21
DeepSeekV3.2技术报告还是老外看得细
2025-12-04 09:09:55
字节跳动将对Seed部门大模型技术人员增发期权
2025-09-03 12:45:43
字节跳动发布Seedream 4.0图像创作模型
2025-09-09 13:15:57
字节跳动扣子 Coze 宣布开源:采用 Apache 2.0 许可证,支持商用
2025-07-26 15:40:54
腾讯混元再引强将,庞天宇即将入职多模态模型团队负责强化学习前沿算法探索
2026-01-30 15:35:19
字节跳动正在研发人工智能芯片 并与三星就芯片制造事宜进行谈判
2026-02-11 13:22:46
GPT-5≈o3.1!OpenAI首次详解思考机制:RL+预训练才是AGI正道
2025-10-20 16:09:01
真正的AI竞争力,藏在大模型“后训练”这一步
2025-10-13 16:59:55
波士顿动力 Spot 四足机器人学会连续后空翻,意外让行走姿态更像真实动物
2025-08-28 10:20:06
4o-mini华人领队也离职了,这次不怪小扎
2025-08-19 16:01:05
字节正研发新一代豆包AI耳机 由歌尔股份代工
2026-01-14 17:50:20
字节跳动发布通用机器人模型GR-3
2025-07-22 12:32:35
667 文章
467655 浏览
24小时热文
更多
-
2026-03-10 10:03:26 -
2026-03-10 10:02:35 -
2026-03-10 09:02:22