标题:翁荔最新万字长文:Why We Think
正文:
北大校友、前OpenAI华人VP翁荔发布了一篇关于“测试时计算”(Test-time Compute)和“思维链”(Chain-of-Thought,CoT)的万字长文《Why We Think》。
文章探讨了如何通过这些技术显著提升模型性能。翁荔指出,让模型在输出答案前多思考一会儿(如通过智能解码、思维链推理、潜在思考等方法),能显著提升其智能水平,突破当前的能力瓶颈。
网友们评价此篇文章“精彩”,认为它打开了人工智能理解的新维度。
文章首先介绍了动机,即通过几种方式激发模型思考更长时间。接着,文章将核心思想与人类思考方式联系起来,引用了Daniel Kahneman的双系统理论:快速思考(系统1)和慢速思考(系统2)。系统1快速但易出错,而系统2需更多认知资源但更理性。
从资源角度看,深度学习中神经网络通过计算量和存储量解决问题。优化架构或系统以在测试时进行更多计算,能让模型更高效。
潜变量建模方面,通过观察数学题目、正确答案及推导过程的分布,优化边缘概率有助于理解多并行CoT采样或搜索算法。
基于Token的思考方法也得到了探索,包括监督学习生成器和验证器,以及强化学习在自动验证答案数据集上的应用。
测试时计算旨在自适应修改模型推理时的输出分布,主要方法包括并行采样(如N选1、束搜索)和顺序修订。并行采样简单直观,但受限于模型一次性获取正确解的能力;顺序修订则需依赖微调模型,否则可能性能下降。
强化学习与外部工具整合也是重点,如代码执行、知识搜索等。此外,文章还讨论了思维忠实性验证、奖励破解风险以及未来挑战,如如何设计无监督场景下的自我修正机制等。
原文链接
本文链接:https://kx.umi6.com/article/18769.html
转载请注明文章出处
相关推荐
换一换
前字节强化学习专家孙鹏博士加盟星尘智能,完善Physical AI全栈技术布局
2026-09-02 14:32:34
OpenAI总裁透露GPT-5改了推理范式,AGI实现要靠现实反馈
2025-08-18 17:48:45
全球闲置算力训个模型,性能媲美R1,老黄“天塌了”
2025-05-16 14:29:01
打破代码大模型训练瓶颈:MicroCoder将算法数据框架训练经验升级
2026-03-30 01:19:37
人类 越来越难理解AI
2026-08-31 16:50:05
Anthropic 研究揭示:AI 推理的思维链解释不可全信
2025-05-20 12:40:05
以GLM-5为例,探究九章智算云强化学习系统如何落地“训推一致”
2026-08-18 17:54:02
波士顿动力 Spot 四足机器人学会连续后空翻,意外让行走姿态更像真实动物
2025-08-28 10:20:06
亚马逊开建AGI实验室,一号位也是华人
2025-09-22 09:54:37
发自 凹非寺量子位 | 公众号 QbitAI 奥特曼点名表扬了两个波兰人。 没有他们,OpenAI就不是今天的样子。 他们是OpenAI首席科学家Jakub Pachocki以及头衔为“Technical Fellow”的Szymon Sidor。 △左:Jakub Pachocki,右:Szymon Sidor 两人不仅是波兰老乡,而且是高中同学,读博时分别选择了计算机科学和机器人,后来又在OpenAI重聚。 在ChatGPT风靡全球、每天服务数亿用户的今天,奥特曼感慨大多数人永远不会想到背
2025-09-09 18:18:27
清华刘洋团队论文:揭示为何 70B 的医疗模型,反而不如 8B 会问诊丨ILCR 2026
2026-02-24 14:48:42
一只猫就能让最强AI 答错题,Deepseek 也翻车,猫怎么成了大模型“天敌”?
2025-07-07 21:39:02
全新合成框架SOTA:强化学习当引擎,任务合成当燃料,蚂蚁港大联合出品
2025-10-01 18:47:16
775 文章
971928 浏览
24小时热文
更多
-
2026-09-06 21:14:00 -
2026-09-06 20:12:34 -
2026-09-06 20:10:47