2026年5月,OpenAI核心研究员翁家翌提出强化学习新范式——启发式学习(HL),无需神经网络训练和梯度更新,仅靠GPT-5.4驱动的Codex自主迭代代码。该方法在经典游戏Breakout中达到864分满分,并在Atari 57测试集中表现媲美主流算法PPO,部分成绩超越人类玩家。HL通过显式代码规则实现状态-动作映射,解决了传统深度强化学习的灾难性遗忘、黑箱决策和样本效率低下等问题。此外,在MuJoCo机器人仿真任务中,HL表现出色,四足机器人Ant评分突破6000分。翁家翌指出,HL适合策略持续迭代场景,但暂无法解决如ImageNet等复杂识别任务,未来需探索与神经网络融合的可能性。
原文链接
本文链接:https://kx.umi6.com/article/35627.html
转载请注明文章出处
相关推荐
换一换
OpenAI买几万台Mac搞强化训练!英伟达的活被苹果抢了
2026-08-31 11:38:31
Meta万引强化学习大佬跑路!用小扎原话作为离别寄语,扎心了
2025-08-26 13:43:07
深夜突袭,DeepSeek-Prover-V2加冕数学王者!671B数学推理逆天狂飙
2025-05-05 09:43:44
AI仅凭“自信”学会推理,浙大校友复刻DeepSeek长思维链涌现
2025-05-29 14:32:01
字节&MAP重塑大模型推理算法优化重点,强化学习重在高效探索助力LLM提升上限
2025-08-11 10:59:04
DeepSeek-R1 论文登上《自然》封面,通讯作者为梁文锋
2025-09-18 09:48:42
强化学习之父:LLM主导只是暂时,扩展计算才是正解
2025-06-10 18:52:34
翁荔最新万字长文:Why We Think
2025-05-18 14:20:10
英伟达发布新 RL 范式:受 DeepSeek-R1 启发,重塑 AI 模型外部工具能力
2025-05-14 15:16:49
真正的AI竞争力,藏在大模型“后训练”这一步
2025-10-13 16:59:55
OpenAI总裁透露GPT-5改了推理范式,AGI实现要靠现实反馈
2025-08-18 17:48:45
大模型刷数学题竟有害?CMU评估20+模型指出训练陷阱
2025-07-08 17:52:09
无需外部数据!AI自问自答实现推理能力进化
2025-08-08 16:13:47
778 文章
957127 浏览
24小时热文
更多
-
2026-09-06 21:14:00 -
2026-09-06 20:12:34 -
2026-09-06 20:10:47