中国电信于1月25日发布“复杂推理大模型”TeleAI-t1-preview,该模型在美国数学竞赛AIME 2024及MATH500评测中分别取得60和93.8分,大幅超越OpenAI o1-preview、GPT-4o等标杆模型。在GPQA Diamond测试中,TeleAI-t1-preview得分超过GPT-4o,接近Claude 3.5 Sonnet的表现。TeleAI-t1-preview不仅能解决《九章算术》中的题目,还能进行古今单位换算,并结合形象思维与抽象思维进行推理。该模型采用了创新的训练策略,包括高质量推理数据集构建、Judge Model评估、SFT阶段的高质量长推理数据生成及强化学习阶段的Rule-based Reward Model应用。
原文链接
本文链接:https://kx.umi6.com/article/12183.html
转载请注明文章出处
相关推荐
换一换
TeleAI “复杂推理大模型” 达竞赛级数学表现,评分超 o1-preview
2025-01-26 17:15:51
国产大模型首发中文逻辑推理,「天工大模型4.0」o1版来了
2024-11-28 10:23:25
MIT 新研究指出 AI 不懂“no”,逻辑推理缺陷导致否定词成“盲区”
2025-05-22 09:22:19
两句话,让LLM逻辑推理瞬间崩溃!最新「爱丽丝梦游仙境」曝出GPT、Claude等重大缺陷
2024-06-10 21:37:45
两句话,让 LLM 逻辑推理瞬间崩溃!最新「爱丽丝梦游仙境」曝出 GPT、Claude 等重大缺陷
2024-06-10 18:37:26
大语言模型会推理吗?
2024-11-13 11:33:40
吴恩达开源的OpenWorker,为什么「不 Work」了?
2026-09-01 16:49:39
滴滴自动驾驶新一代车型开启载客测试服务
2026-08-31 16:48:14
AI本地部署不如官方版的元凶找到了:734个依赖包,每一个都可能坑
2026-08-29 22:20:53
AI 读过一切,却没经历过任何事:Ropedia 发布 HOMIE Gen2,给具身智能补「经验」这一课
2026-09-01 13:39:02
DeepSeek V4 多模态开源,我们把它的视觉链路拆了一遍
2026-09-01 18:52:06
谁在为人形机器人铺「全开源生态」?
2026-09-04 19:38:53
磁带没死还活得好好的!AI催生160EB出货量:2026Q1同比暴增57%
2026-09-03 15:28:35
876 文章
1065388 浏览
24小时热文
更多
-
2026-09-07 12:47:55 -
2026-09-07 10:44:22 -
2026-09-06 21:14:00