标题:TeleAI“复杂推理大模型”达竞赛级数学表现,评分超o1-preview
近日,中国电信人工智能研究院(TeleAI)发布“复杂推理大模型”TeleAI-t1-preview,即将上线天翼AI开放平台。该模型采用强化学习训练,通过引入探索和反思等思考范式,显著提升了其在数学推导和逻辑推理等方面的准确性。
早在1500多年前,数学家祖冲之指出复杂事物可通过实际观测和数据推理求得。TeleAI-t1-preview在多项权威数学评测中表现优异,如AIME 2024和MATH500竞赛,分别获得60和93.8分,超越OpenAI o1-preview和GPT-4o等标杆模型。
模型不仅给出正确答案,还展示了完整的思考和分析过程,有助于学生深入理解题目背后的逻辑。例如,在解答涉及“泊松分布”的概率论考研试题时,TeleAI-t1-preview不仅介绍了概念,还提供了详细解题思路和答案。
TeleAI-t1-preview还能处理古代数学难题,如《九章算术》中的题目。它能理解并简化文言文,转换成现代汉语,进行数学推导并给出答案。此外,它在策略推理问题上表现出色,能快速理解游戏规则并提出有效的解题策略。
为了保障推理的有效性,TeleAI引入了创新的训练策略,包括构建高质量推理数据集、训练评估模型(Judge Model)、监督微调(SFT)阶段的MCTS构造数据,以及强化学习阶段的Rule-based Reward Model。这些措施使得模型的推理过程更加准确和透明。
原文链接
本文链接:https://kx.umi6.com/article/12206.html
转载请注明文章出处
相关推荐
换一换
刘壮陈丹琦新作:开源通用视觉推理RL框架,0思考数据刷新SOTA
2026-04-11 09:51:56
性能提升84%-166%!L-Zero仅靠强化学习解锁大模型探索世界的能力 | 已开源
2025-07-01 15:26:33
Dwarkesh最新播客:AI 进展年终总结
2025-12-25 18:54:19
全新合成框架SOTA:强化学习当引擎,任务合成当燃料,蚂蚁港大联合出品
2025-10-01 18:47:16
训练时间减半,性能不降反升!腾讯混元开源图像生成高效强化方案MixGRPO
2025-08-02 18:22:54
QwenLong-L1-32B 模型登场:阿里通义千问首个强化学习训练的长文本推理 AI 模型
2025-05-27 14:51:28
混元OCR模型核心技术揭秘:统一框架、真端到端
2025-11-30 11:05:21
DeepSeek登《Nature》封面,梁文锋带队,首次回应争议
2025-09-18 13:54:10
我们让GPT玩狼人杀,它特别喜欢杀0号和1号,为什么?
2025-05-23 13:51:09
有道14B低成本轻量模型“子曰3”开源,数学推理性能超越大模型
2025-06-23 17:25:48
Cursor发布首个编程大模型!代码生成250tokens/秒,强化学习+MoE架构
2025-10-30 10:33:49
RLinf v0.3来了!从模型生态到真机部署五大能力跃升,无问芯穹与清华大学联合打造
2026-07-16 17:52:14
首次解释LLM如何推理反思!西北大学谷歌新框架:引入贝叶斯自适应强化学习,数学推理全面提升
2025-06-02 14:38:11
720 文章
778887 浏览
24小时热文
更多
-
2026-07-24 13:47:18 -
2026-07-24 13:45:42 -
2026-07-24 13:44:02