1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

微软亚洲研究院发布创新算法rStar-Math,通过代码增强CoT和蒙特卡洛树搜索,使小参数模型无需依赖大型模型蒸馏即可实现自我进化。在美国数学竞赛AIME 2024中,rStar-Math平均解决了53.3%的难题,超过OpenAI o1-preview的44.6%。在MATH基准测试中,rStar-Math显著提高了阿里开源模型Qwen2.5-Math的准确率。该算法通过四轮自我进化,结合PPM、MCTS和代码增强CoT,大幅提升了模型的数学推理能力。这表明小模型在创新算法和高质量数据支持下,可媲美甚至超越大型模型。

原文链接
本文链接:https://kx.umi6.com/article/11567.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
北交开源 o1 代码版:强化学习 + 蒙特卡洛树搜索,放出源代码、精选数据集以及衍生模型
2024-12-09 13:27:10
图灵奖得主加持,蒙特卡洛树搜索×扩散模型杀回规划赛道|ICML 2025 Spotlight
2025-08-01 14:00:21
让Qwen2.5 7B超越o1,微软干的!MSRA推出小模型数学推理自我进化新方法
2025-01-10 12:15:13
微软 rStar-Math 技术登场:小语言 AI 模型数学推理从“不及格”一跃成为“优等生”
2025-01-11 12:39:34
微软 rStar-Math 技术登场:小语言 AI 模型数学推理从“不及格”一跃成为“优等生”
2025-01-11 12:39:34
Llama版o1来了,来自上海AI Lab,强化学习代码已开源,基于AlphaGo Zero范式
2024-11-05 16:03:16
半壁华人!GPT Image 2团队曝光:无锡才俊带队,13人4个月封神
2026-04-23 16:14:21
在人工智能芯片股助推下 纳斯达克综合指数涨1%再创历史新高
2026-04-24 23:42:26
中信证券:预计二季度AI行情开始发散 建议关注被动元件、消费电子等细分板块
2026-04-24 09:04:28
昆仑万维2025年营收同比增长44.78%至81.98亿 “4+3”战略构建AI Native平台经济新范式
2026-04-23 21:31:07
阶跃与腾讯云合作打造新一代 AI 座舱解决方案
2026-04-23 19:26:30
打击P图恶意骗退款!淘宝天猫上线售后AI假图识别模型
2026-04-23 19:25:25
中紫星NEU智能原生芯片将于今年四季度流片
2026-04-25 10:07:42
24小时热文
更多
扫一扫体验小程序