标题:翁荔最新万字长文:Why We Think
正文:
北大校友、前OpenAI华人VP翁荔发布了一篇关于“测试时计算”(Test-time Compute)和“思维链”(Chain-of-Thought,CoT)的万字长文《Why We Think》。
文章探讨了如何通过这些技术显著提升模型性能。翁荔指出,让模型在输出答案前多思考一会儿(如通过智能解码、思维链推理、潜在思考等方法),能显著提升其智能水平,突破当前的能力瓶颈。
网友们评价此篇文章“精彩”,认为它打开了人工智能理解的新维度。
文章首先介绍了动机,即通过几种方式激发模型思考更长时间。接着,文章将核心思想与人类思考方式联系起来,引用了Daniel Kahneman的双系统理论:快速思考(系统1)和慢速思考(系统2)。系统1快速但易出错,而系统2需更多认知资源但更理性。
从资源角度看,深度学习中神经网络通过计算量和存储量解决问题。优化架构或系统以在测试时进行更多计算,能让模型更高效。
潜变量建模方面,通过观察数学题目、正确答案及推导过程的分布,优化边缘概率有助于理解多并行CoT采样或搜索算法。
基于Token的思考方法也得到了探索,包括监督学习生成器和验证器,以及强化学习在自动验证答案数据集上的应用。
测试时计算旨在自适应修改模型推理时的输出分布,主要方法包括并行采样(如N选1、束搜索)和顺序修订。并行采样简单直观,但受限于模型一次性获取正确解的能力;顺序修订则需依赖微调模型,否则可能性能下降。
强化学习与外部工具整合也是重点,如代码执行、知识搜索等。此外,文章还讨论了思维忠实性验证、奖励破解风险以及未来挑战,如如何设计无监督场景下的自我修正机制等。
原文链接
本文链接:https://kx.umi6.com/article/18769.html
转载请注明文章出处
相关推荐
换一换
深夜突袭,DeepSeek-Prover-V2加冕数学王者!671B数学推理逆天狂飙
2025-05-05 09:43:44
Pokee.ai 朱哲清:用 RL 搭建智能体的「骨骼与神经」| AI 产品十人谈
2025-05-08 11:29:43
机器狗能打羽毛球:仅靠强化学习从 0 自学,还会自己移步
2025-05-30 17:53:28
8块钱跑通一次强化学习全流程,潞晨云重塑微调赛道:1名算法工程师=1支Infra团队
2026-01-07 16:15:48
让Agent越用越强:AReaL 2.0开源,打造面向自演进智能体的RL基础设施
2026-07-02 20:17:31
训练时间减半,性能不降反升!腾讯混元开源图像生成高效强化方案MixGRPO
2025-08-02 18:22:54
任务级奖励提升App Agent思考力,淘天提出Mobile-R1,3B模型可超32B
2025-07-20 15:05:31
通义实验室新研究:大模型自己「扮演」搜索引擎,提升推理能力无需搜索API
2025-05-17 13:07:29
一只猫就能让最强AI 答错题,Deepseek 也翻车,猫怎么成了大模型“天敌”?
2025-07-07 21:39:02
真正的AI竞争力,藏在大模型“后训练”这一步
2025-10-13 16:59:55
字节&MAP重塑大模型推理算法优化重点,强化学习重在高效探索助力LLM提升上限
2025-08-11 10:59:04
Cursor自研模型反超Opus 4.6!价格脚踝斩,氛围编程沸腾了
2026-03-20 12:25:37
机器人运控训练步入分钟级时代!清华AIR开源UniLab:3分钟训好人形,速度暴涨10倍,Mac上也能跑
2026-06-02 12:26:59
767 文章
846071 浏览
24小时热文
更多
-
2026-07-24 00:15:46 -
2026-07-24 00:14:08 -
2026-07-24 00:12:30