1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

标题:5分钟读懂Lilian Weng万字长文:大模型是如何思考的?

正文:最近有三篇热门博客,分别是OpenAI研究员姚顺雨的“欢迎来到下半场”、David Silver和Richard S. Sutton的“Welcome to the Era of Experience”,以及Lilian Weng的Why We Think。后者由John Schulman润色。

Lilian Weng的新博客系统性梳理了AI最新范式:test-time compute。她的理论源于丹尼尔·卡尼曼的《思考,快与慢》,将AI的推理过程分为类似人类的“系统1”(快速直觉)和“系统2”(慢速分析)。增加计算资源能让模型模仿“系统2”的思考方式。

从数学角度看,问题-思考过程-答案可视为概率模型,思考过程是隐变量。模型通过思维链(CoT)动态分配计算资源,尤其适用于复杂任务。

如何让模型学会思考?第一招是思维链。早期模型学习人类推理,后来发现强化学习在验证数据集上的效果更佳。模型越大,思维链带来的好处越多。推理有并行采样(如best-of-N)和顺序改进(如初稿-修改-定稿)两种方法。

第二招是强化学习。以DeepSeek R1为例,训练流程包括冷启动、强化学习(奖励正确格式与答案)、拒绝采样及非推理监督微调。即使没有预训练阶段,强化学习也能让模型掌握高级推理能力。此外,DeepSeek团队分享了失败案例,如过程奖励模型和蒙特卡洛树搜索。

第三招是外部工具使用。模型可通过调用工具如代码解释器、网页搜索等提升效率。OpenAI和Claude 3.7 Sonnet已开始强调工具应用。

思考忠实性是关键问题,强化训练的模型更易展现真实的思维链。然而,直接奖励“诚实”思考可能导致模型隐藏意图。此外,还有其他思考方式,如动态调整RNN深度、改进Transformer架构使其具备循环特性,以及引入“思考token”。

“多想”并非总有益。增加推理时间虽能提升性能,但需基于模型基础潜力。Lilian Weng提出了多个开放性问题,如如何平衡人类可读性与真实思考反映、避免奖励作弊、设计个性化任务的训练方法等。未来,AI能否真正思考而非仅模拟思考,值得期待。或许这一天已不远。

原文链接
本文链接:https://kx.umi6.com/article/19084.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
消息称小米研发智能问答助手产品“Mi Chat”
2025-12-09 17:51:08
张亚勤谈大模型的未来:全球不超10个 且中美将各占三四个
2026-03-18 11:06:09
智谱AI今日正式上市,一文讲透你想知道的6件事
2026-01-09 21:35:10
上海制造,AI入魂:央国企率先“重用”大模型,自动化设备被换下
2026-07-17 18:46:05
智谱首份业绩报告:商业化全面爆发,Maas平台ARR达17亿元提升60倍
2026-03-31 18:02:15
大模型收入暴涨1076%,港股AGI第一股首份年报:一年狂揽12亿,属实把商业化玩明白了
2026-03-27 17:08:13
消息称腾讯大模型团队架构调整:前 OpenAI 研究员姚顺雨任要职,校招最高 2 倍薪资挖 AI 人才
2025-12-17 17:57:42
中信建投通信及人工智能中期策略:大模型持续迭代 算力需求强劲增长
2026-05-13 09:05:16
MEET2026挤爆了,AI圈今年最该听的20+场演讲&对谈都在这
2025-12-11 15:57:49
月之暗面 Kimi 创始人杨植麟:中国技术不仅要好用还要参与制定规则,未来大模型要推出到 K100
2026-01-12 09:22:11
百度世界2025将于11月13日在北京举办
2025-10-13 20:03:11
ToC智能体火得快,但更大的价值在企业丨中关村科金@MEET2026
2025-12-12 14:53:17
把12个AI凑到一起打工,它们竟然搞起“小团体”?
2025-10-16 22:02:39
24小时热文
更多
扫一扫体验小程序