1950年左右,信息论鼻祖香农和妻子贝蒂玩了一个“猜字母”游戏:香农给前文,贝蒂猜下一个字母。猜对画短横,猜错写原字母。这其实是人类最早的“预测下一个词”实验,贝蒂堪称世界上第一个“大语言模型”。
这个游戏揭示了信息论的核心:语言可预测,而可预测就意味着可压缩。被短横替代的文本变短了,但信息没丢。香农借此指出,预测和压缩是一体两面。越容易预测的内容信息量越小;完全猜不到的“意外”才是真正的信息。衡量这种不确定性的指标即为“熵”。
今天的大语言模型(如GPT)本质上也在做同样的事。它们吸收海量数据,努力预测下一个词。模型预测得越准,交叉熵损失(Loss)就越低,这就相当于当年贝蒂画下的一个个短横。
虽然单纯的压缩不等于智能,但智能的核心能力之一,正是捕捉世界运行的可预测规律。七十多年过去,当年贝蒂猜对字母时画下的短横,如今已化作大模型不断降低的Loss,成为了AI进化的基石。
原文链接
本文链接:https://kx.umi6.com/article/36837.html
转载请注明文章出处
相关推荐
换一换
图灵奖得主杨立昆:大语言模型发展已接近瓶颈,AI 仅靠文本训练无法实现人类级智能
2025-03-23 23:28:58
嚯!大语言扩散模型来了,何必只预测下一个token | 人大高瓴&蚂蚁
2025-02-18 13:14:03
挑战强化学习后训练霸权!全新无监督方法仅需1条数据+10步优化
2025-06-01 13:22:14
当 AI 下场炒 A 股,「推理」成了新的直觉
2025-10-28 12:51:59
预测这件事,人类越犹豫,这个大模型越有优势
2026-03-30 16:56:49
Meta人事巨震、AI教母站台 通往AGI之路遇上分岔路口
2025-11-15 10:46:28
小红书怎么一夜成为全世界网友都爱的翻译软件?
2025-01-20 21:24:11
研究揭示:大语言模型无法真正理解双关语
2025-11-24 18:08:37
自诩无所不知的大模型,能否拯救笨手笨脚的机器人?
2025-05-06 09:49:31
“Prompt之神”李继刚:我想用20年时间,给世界留一句话
2024-11-05 14:59:25
中国科学院科学家首次证实:大语言模型能像人类一样“理解”事物
2025-06-11 10:10:26
清华刘知远团队论文:最小化结构改动,短文本到长文本丝滑升级 | ICLR 2026
2026-02-06 20:12:11
AI无处不在的小应用,与行业发展的大困局
2025-09-22 16:01:16
738 文章
853831 浏览
24小时热文
更多
-
2026-08-07 17:32:20 -
2026-08-07 16:32:14 -
2026-08-07 16:30:45