标题:7B的DeepSeek反超R1满血版,上海AI Lab新成果
新方法使DeepSeek的Qwen数学能力超越R1满血版,7B模型反超671B。
上海AI Lab/清华哈工大/北邮团队的研究由齐弼卿和周伯文领导,探讨了Test-Time Scaling (TTS)在不同策略模型、过程奖励模型及问题难度下的影响。
研究聚焦两大核心问题: 1. 最优TTS方式如何受策略模型、PRM及问题难度影响? 2. TTS在复杂任务上的表现提升幅度及小模型能否超越大模型?
团队在MATH-500和AIME24数据集上实验,使用多个策略模型和PRM进行评估。他们定义了推理问题为马尔可夫决策过程,并测试了Best-of-N、Beam Search和Diverse Verifier Tree Search三种TTS方法。
实验显示,最优TTS方法依赖具体条件。小型策略模型中,搜索方法优于BoN;大型策略模型反之。PRM的选择也显著影响性能。问题难度方面,不同规模模型适用不同的TTS方法。
团队提出奖励感知型最优TTS框架,使计算适应特定模型和提示。3B Llama3.2在MATH-500和AIME24上超越135倍大的Llama3.1-405B,DeepSeek-R1-Distill-Qwen-7B也表现出色。
研究显示TTS在简单任务上优于多数长CoT方法,但在复杂任务上仍有改进空间。未来工作将探索TTS在更多任务上的应用及更高效方法。
原文链接
本文链接:https://kx.umi6.com/article/13194.html
转载请注明文章出处
相关推荐
换一换
DeepSeek估值,被一家安徽箱包公司给全部暴露了
2026-07-18 12:24:50
DeepSeek 新模型曝光:MODEL1 代码预示新架构,最快有望 2 月发布
2026-01-21 09:02:53
DeepSeek 声明:防范冒用“深度求索”名义实施诈骗
2025-09-18 12:52:40
梁文锋,Nature全球年度十大科学人物!
2025-12-09 10:25:17
DeepSeek突然拥抱国产GPU语言!对标CUDA替代Triton,华为Day0适配
2025-09-30 10:23:35
DeepSeek又崩了
2026-03-31 18:01:07
黄仁勋新年第一场演讲提了DeepSeek 推动了整个行业变革
2026-01-06 08:54:05
DeepSeek母公司去年进账50亿,够烧2380个R1
2026-01-13 16:43:30
DeepSeek更新GitHub仓库 新模型“MODEL1”曝光
2026-01-21 11:03:39
出圈一周年,DeepSeek的变与不变
2026-01-16 15:50:22
不是接入DeepSeek,就叫AI制药
2026-01-17 16:35:32
美国AI巨头炮轰DeepSeek 只为给五角大楼递投名状
2026-02-26 07:32:42
DeepSeek发布两款新模型
2025-12-01 19:31:03
833 文章
888237 浏览
24小时热文
更多
-
2026-07-24 00:15:46 -
2026-07-24 00:14:08 -
2026-07-24 00:12:30