1950年左右,信息论鼻祖香农和妻子贝蒂玩了一个“猜字母”游戏:香农给前文,贝蒂猜下一个字母。猜对画短横,猜错写原字母。这其实是人类最早的“预测下一个词”实验,贝蒂堪称世界上第一个“大语言模型”。
这个游戏揭示了信息论的核心:语言可预测,而可预测就意味着可压缩。被短横替代的文本变短了,但信息没丢。香农借此指出,预测和压缩是一体两面。越容易预测的内容信息量越小;完全猜不到的“意外”才是真正的信息。衡量这种不确定性的指标即为“熵”。
今天的大语言模型(如GPT)本质上也在做同样的事。它们吸收海量数据,努力预测下一个词。模型预测得越准,交叉熵损失(Loss)就越低,这就相当于当年贝蒂画下的一个个短横。
虽然单纯的压缩不等于智能,但智能的核心能力之一,正是捕捉世界运行的可预测规律。七十多年过去,当年贝蒂猜对字母时画下的短横,如今已化作大模型不断降低的Loss,成为了AI进化的基石。
原文链接
本文链接:https://kx.umi6.com/article/36837.html
转载请注明文章出处
相关推荐
换一换
中国科大新成果入选 ICLR 2025:特定领域仅用 5% 训练数据,知识准确率提升 14%
2025-04-07 13:58:54
全球AI顶会 NeurIPS 2024温哥华开幕,中国校企上百篇论文被收录
2024-12-11 16:36:37
大语言模型火爆的今天,我们为什么还要拥抱世界模型?
2025-04-09 10:42:08
科学家发现多数大语言模型测试标准存在缺陷,无法客观给出评分
2025-11-08 21:59:46
小红书怎么一夜成为全世界网友都爱的翻译软件?
2025-01-20 21:24:11
AI 意识更进一步!谷歌 DeepMind 等:LLM 不仅能感受痛苦还能趋利避害
2025-02-10 13:12:02
苹果创新“清单法”:用 AI 大模型当“老师”,教小模型更精准执行复杂指令
2025-08-26 07:38:55
“Prompt之神”李继刚:我想用20年时间,给世界留一句话
2024-11-05 14:59:25
清华刘知远团队论文:最小化结构改动,短文本到长文本丝滑升级 | ICLR 2026
2026-02-06 20:12:11
专家:会聊天≠会思考,大语言模型造不出通用人工智能
2025-11-30 11:06:37
新研究:人工智能可提前两周预测严重心律失常风险
2025-04-03 13:20:59
对话宇树科技创始人王兴兴:人形机器人大模型,还没走到“大力出奇迹”阶段
2024-08-22 09:27:42
“学术剽窃”定义正被AI模糊,我们该如何应对?
2024-08-01 21:09:52
752 文章
940140 浏览
24小时热文
更多
-
2026-09-06 21:14:00 -
2026-09-06 20:12:34 -
2026-09-06 20:10:47