1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

1.5B小模型刷新数学代码SOTA!快手&清华推出Archer方法,精细化Token管理大幅提升LLM推理能力

快手与清华大学团队提出了一种名为Archer的新方法,用仅1.5B参数的小模型在多个数学和代码推理基准上超越同量级SOTA模型。其核心在于对模型学习过程的精细化管理:稳定知识记忆,释放推理灵活性。

传统强化学习(RLVR)方法常导致模型在“知识型”内容(如公式、事实)和“推理型”内容(如逻辑规划)之间难以平衡。要么知识被遗忘,要么推理受限。Archer通过“双Token约束”解决了这一问题:
1. Token分类:根据熵值区分低熵Token(知识型)和高熵Token(推理型)。例如,“3.14”是低熵,而“接下来”是高熵。
2. 差异化训练:对低熵Token施加紧约束,确保知识准确;对高熵Token放松约束,鼓励多样化推理尝试。

实验结果显示,Archer在数学和代码任务中表现卓越:
- 数学推理:在AIME 2024/2025等硬核基准上,正确率提升10%-18%,超越FastCuRL、Nemotron等同量级模型。
- 代码生成:在LiveCodeBench v5/v6上,正确率较DAPO提升2.6%-3.4%,成为同量级最佳模型之一。

更令人印象深刻的是,Archer仅需单阶段训练和1900 H800 GPU小时,远低于Nemotron的16000 H100小时,效率显著提高。

Archer的成功揭示了大模型推理能力的关键——知识稳定性与推理探索性的平衡。精细化Token管理让小模型也能高效利用参数,实现性能逆袭。

论文链接:http://arxiv.org/abs/2507.15778
GitHub:https://github.com/wizard-III/ArcherCodeR

原文链接
本文链接:https://kx.umi6.com/article/22765.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
国产AI搜索接入DeepSeek-R1!我们深度试玩了一下
2025-02-03 10:06:40
谷歌 DeepMind 优化 AI 模型新思路,计算效率与推理能力兼得
2024-12-28 10:24:13
智能驾驶水面之下,“AI推理之争”暗流涌动
2025-04-01 11:20:56
截胡 OpenAI:谷歌率先公测“奥数金牌级”推理 AI 模型 Gemini 3 Deep Think
2025-12-05 14:33:37
蚂蚁开源 Ring-1T,成就推理、编程、通用智能三冠王
2025-10-24 11:36:00
上海AI实验室版o1已上线!数学题、Leetcode全拿下,还会玩24点
2024-11-28 15:29:46
实测o3/o4-mini:3分钟解决欧拉问题,OpenAI最强模型名副其实!
2025-04-17 16:41:08
Nature封面文章: DeepSeek-R1通过强化学习激励的LLM推理
2025-09-18 08:48:39
天工大模型 4.0 o1 版 / 4o 版上线,App 及网页可免费使用
2025-01-06 11:23:41
上海财经大学联合财跃星辰开源首个金融领域R1类推理大模型Fin-R1:仅7B参数,逼近DeepSeek满血版效果
2025-03-21 10:16:47
地球上最聪明的AI!马斯克发布Grok 3:秒杀GPT 超越DeepSeek
2025-02-18 13:21:40
谷歌 Gemini 2.0 Flash 系列 AI 模型登场,编程和推理性能迈上新台阶
2025-02-06 07:23:35
OpenAI 联合创始人 Ilya Sutskever 谈“超智能 AI”:将具备推理能力,会更加不可预测
2024-12-14 10:44:54
24小时热文
更多
扫一扫体验小程序