今天,月之暗面创始人杨植麟在京东科技大厦宣布,Kimi 数学模型 k0-math 正式发布,对标 OpenAI 的 o1 系列,并公布截至2024年10月,Kimi 月活跃用户已超3600万。
杨植麟表示,未来将更注重强化学习方法,以实现更复杂的任务。传统的Next-Token预测仅基于静态数据集,难以实现深度思考。强化学习则能部分模拟思考过程,例如解题时的步骤推理。
数学是宇宙的语言,是训练AI思考能力的理想场景。k0-math从数学开始,逐步扩展到更多任务,如物理、化学等。在基准测试中,k0-math在多项数学测试中表现优于OpenAI的o1-mini和o1-preview。
k0-math的强化模型将在未来一到两周内集成到Kimi探索版中,具备意图增强、信源分析和链式思考的特点。强化学习的关键问题是生成数据的有效性和准确性,需要优化奖励模型。
k0-math有时会过度思考,例如计算1+1的过程。杨植麟表示,可以通过调整奖励模型减少这种情况。此外,Kimi探索版将让用户自行选择是否启用强化模型,以适应不同需求。
月之暗面的产品策略较为克制,专注于少数关键任务。尽管面临行业竞争,月之暗面团队人数较少,不超过200人。杨植麟认为,保持小规模团队有助于创新,聚焦单一产品的极致发展。
杨植麟指出,预训练仍有发展空间,预计明年会有重大突破。强化学习将成为未来的技术趋势,而AI与人类合作将推动技术进步。
原文链接
本文链接:https://kx.umi6.com/article/9543.html
转载请注明文章出处
相关推荐
换一换
强化学习之于 AI Agent,是灵魂、还是包袱?
2025-04-23 11:56:20
2025上半年,AI Agent领域有什么变化和机会?
2025-07-11 08:33:06
Cursor发布首个编程大模型!代码生成250tokens/秒,强化学习+MoE架构
2025-10-30 10:33:49
机器人运控训练步入分钟级时代!清华AIR开源UniLab:3分钟训好人形,速度暴涨10倍,Mac上也能跑
2026-06-02 12:26:59
QwenLong-L1-32B 模型登场:阿里通义千问首个强化学习训练的长文本推理 AI 模型
2025-05-27 14:51:28
让Agent越用越强:AReaL 2.0开源,打造面向自演进智能体的RL基础设施
2026-07-02 20:17:31
又一篇“苦涩的教训”,让AI觉得人间有不值,发现无穷尽
2025-04-22 08:10:09
Cursor自研模型反超Opus 4.6!价格脚踝斩,氛围编程沸腾了
2026-03-20 12:25:37
OpenAI路线遭质疑,Meta研究员:根本无法构建超级智能
2025-06-20 21:05:08
字节Seed发布GR-RL 首次实现真机强化学习穿鞋带
2025-12-02 14:21:13
姚班学霸、OpenAI姚顺雨:大模型下半场是产品的游戏
2025-04-17 17:47:23
Pokee.ai 朱哲清:用 RL 搭建智能体的「骨骼与神经」| AI 产品十人谈
2025-05-08 11:29:43
OpenAI:GPT-5 模型正开始减轻科学家日常工作量
2025-11-22 00:51:13
737 文章
855139 浏览
24小时热文
更多
-
2026-07-24 00:15:46 -
2026-07-24 00:14:08 -
2026-07-24 00:12:30