AI趋势正在“中场休息”,之前是训练>评估,未来将是评估>训练。这是OpenAI员工、姚班校友姚顺雨的观点。
AI发展分上下两阶段,上半场以模型和方法为中心,下半场重在定义有意义的任务及有效评估AI表现。这要求研究者转向更接近产品经理的方向。
转变的关键在于强化学习终于能泛化。姚顺雨在博客中详细阐述了这一观点,获得业内认可。
AI下半场是产品的游戏,重点从解决问题转向定义问题,评估比训练更重要。我们需要思考“AI该做什么”及“如何衡量进步”。
AI上半场,方法创新是主导,如Transformer、AlexNet等。那时,任务设定的技术含量较低,而方法更具通用价值。
强化学习的三大核心是算法、环境和先验知识。环境和先验对实际效果影响巨大,OpenAI最初试图将数字世界作为环境。
GPT-2/3时期,OpenAI意识到缺少先验知识,引入语言先验后,AI在聊天和网页任务中表现提升。
推理能力是影响泛化的关键,加入推理到动作空间,并结合语言预训练模型的先验,可大幅提升泛化能力。
当前评估方式有局限,需重新设计评估以贴近现实世界任务,形成正向循环。姚顺雨认为下半场将诞生价值巨大的产品和公司。
姚顺雨去年加入OpenAI,负责智能体研究。他曾提出思维树、SWE-bench、SWE-agent等成果。
原文链接
本文链接:https://kx.umi6.com/article/17349.html
转载请注明文章出处
相关推荐
换一换
为何强化学习火遍硅谷?AGI的关键一步
2025-08-07 15:55:40
4o-mini华人领队也离职了,这次不怪小扎
2025-08-19 16:01:05
大模型推理学习新范式!ExGRPO框架:从盲目刷题到聪明复盘
2025-10-23 17:10:54
2025上半年,AI Agent领域有什么变化和机会?
2025-07-11 08:33:06
Cursor自研模型反超Opus 4.6!价格脚踝斩,氛围编程沸腾了
2026-03-20 12:25:37
性能超OpenAI、Gemini!月之暗面发布首个自主强化学习Agent
2025-06-23 09:22:20
于骞出席德国慕尼黑汽车论坛:世界模型+强化学习是通向物理AI的必经之路
2026-03-19 19:23:06
马斯克悄然发布Grok 4.1,霸榜大模型竞技场所有排行榜
2025-11-18 15:24:50
清华刘洋团队论文:揭示为何 70B 的医疗模型,反而不如 8B 会问诊丨ILCR 2026
2026-02-24 14:48:42
Meta 推 LlamaRL 强化学习框架:全异步分布设计,训练 AI 模型提速 10.7 倍
2025-06-11 16:14:21
秒级生成百万级token!九章云极发布九章智算云Alaya NeW Cloud 2.0
2025-06-16 19:13:12
LLM强化学习新框架!UCSD多智能体训练框架让LLM工具调用能力暴增5.8倍
2025-11-08 13:43:06
RLinf v0.3来了!从模型生态到真机部署五大能力跃升,无问芯穹与清华大学联合打造
2026-07-16 17:52:14
780 文章
847444 浏览
24小时热文
更多
-
2026-07-24 00:15:46 -
2026-07-24 00:14:08 -
2026-07-24 00:12:30