1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

昆仑万维「天工大模型4.0」o1版(Skywork o1)正式启动邀请测试

今天,昆仑万维推出了具有复杂推理能力的系列模型——「天工大模型4.0」o1版(Skywork o1),这是国内首款具备中文逻辑推理能力的o1模型。

不同于现有复现OpenAI o1模型的工作,Skywork o1不仅在模型输出上内生了思考、计划、反思等能力,还在标准评测集中大幅提升了推理能力。团队采用的复现o1的技术路线,使初始推理能力较差的基座模型在基准测试中成为生态位SOTA。

此次发布的Skywork o1包括三款模型:

  • Skywork o1 Open:基于Llama 3.1 8B的开源模型,评测指标大幅提升,解锁了复杂数学任务。
  • Skywork o1 Lite:具备完整思考能力,中文支持更好,推理和思考速度快,在数学、中文逻辑和推理问题上表现突出。
  • Skywork o1 Preview:完整版推理模型,搭配自研线上推理算法,思考过程多样且深入,推理质量更高。

开源的Skywork o1 Open在数学和代码指标上大幅提升,解锁了GPT 4o无法完成的数学推理任务。此外,还开源了两个推理任务的Process Reward Model(PRM):Skywork o1 Open-PRM-1.5B 和Skywork o1 Open-PRM-7B,能够对模型回答中的每个步骤进行评分。

Skywork o1的推理能力显著提升,得益于天工三阶段自研训练方案:

  • 推理反思能力训练:通过多智能体体系构造高质量的分步思考、反思和验证数据。
  • 推理能力强化学习:利用Skywork o1 Process Reward Model(PRM)捕捉复杂推理任务中间步骤对最终答案的影响。
  • 推理planning:基于天工自研Q*算法进行在线推理,提升推理能力。

Skywork o1模型具备模型思考和规划能力、自我反思能力和自我验证能力。在多种复杂任务中表现出色,如考研数学、比大小、中文逻辑推理、24点计算、竞赛数学、密码解密和智力问答等。此外,它还能处理有趣的“弱智”问题,分析头头是道。

未来,Skywork o1将在中英文逻辑推理、复杂任务、高质量内容生成和深度搜索等领域发挥重要作用。昆仑万维将继续致力于通用人工智能的发展,推动AI技术的全面进步。

测试地址: - 尝鲜地址:www.tiangong.cn - 阅读原文:点击下方链接直接进入网址

(注:原文中的图片和链接未包含在内)

原文链接
本文链接:https://kx.umi6.com/article/9346.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
大模型年终观察,如何定义2025年的「好模型」?
2025-12-22 21:00:44
1.5B刷新数学代码SOTA!快手&清华精细化Token管理,LLM推理能力飙升
2025-08-01 08:51:42
腾讯混元 0.5B、1.8B、4B、7B模型发布
2025-08-04 16:02:12
群核科技升级空间智能战略,发布两款空间开源模型
2025-08-25 17:31:32
英伟达发布“行业最高效”Nemotron 3 开源 AI 模型系列,吞吐量达上一代 4 倍
2025-12-15 23:04:58
开源新标杆!商汤 SenseNova-MARS超 Gemini-3-Pro,模型代码数据全开放
2026-01-30 11:22:29
字节跳动开源长文本处理模型Seed-OSS-36B
2025-08-21 14:39:00
OpenAI 推出两款开源模型 gpt-oss-120b / 20b,性能逼近 o4-mini/o3-mini
2025-08-06 08:23:05
手机也能跑大模型,腾讯混元推出多款小尺寸开源模型
2025-08-04 17:00:39
开源 AI 模型 TOP5,被中国厂商包圆
2025-10-15 18:39:57
抢跑GPT-5,智谱开源新SOTA模型,一句话搞出能看视频、发弹幕的B站!
2025-07-29 00:21:11
小米网页 AI 聊天服务惊喜亮相,MiMo-V2-Flash 模型发布、代码能力开源最强
2025-12-17 00:07:31
华为盘古718B模型最新成绩:开源第二
2025-09-29 13:08:42
24小时热文
更多
扫一扫体验小程序