大模型“记性差一点”反而更聪明!金鱼损失随机剔除token,让AI不再死记硬背
训练大模型时,“记性差一点”反而可能更聪明。大语言模型容易复刻训练数据,为解决这一问题,马里兰大学、图宾根大学和马普所的研究团队提出了一种新方法——金鱼损失(Goldfish Loss)。
金鱼损失的核心是让模型像金鱼一样,不执着于记住每个细节,而是在计算损失时随机剔除一小部分token。这样一来,模型不会逐字复刻训练数据,但仍然能学会语言规律。实验表明,LLaMA-2在使用金鱼损失后,记忆化内容显著减少,下游任务性能几乎不受影响。
具体来说,金鱼损失通过哈希掩码策略,在梯度计算中随机屏蔽部分token,确保每次遇到相同段落时掩盖位置一致。这与Dropout等正则化方法不同:Dropout只是加噪声,模型仍可能拼凑出完整段落;而金鱼损失从根本上阻止了模型复现训练文本。
研究人员设计了两种实验场景验证效果:一种是极端场景,通过多次重复少量样本促使记忆化;另一种是标准场景,模拟真实训练条件。结果表明,极端场景下,标准训练导致模型逐字记忆100篇文章中的84篇,而金鱼损失未记忆任何文章。在标准场景中,金鱼损失也显著减少了逐字复现的情况。
尽管有人担心忽略部分token会影响模型能力,但测试显示,金鱼损失模型与标准模型的总体性能无系统性差异。不过,由于部分token被忽略,模型需要更多数据来学习语言模式,可能导致计算效率下降。
原文链接
本文链接:https://kx.umi6.com/article/24653.html
转载请注明文章出处
相关推荐
换一换
花几百万买的H100在「摸鱼」?英伟达:别怪显卡,是你的模型「长得丑」
2026-07-23 18:00:12
美国公司又吹牛!首例AI自主勒索攻击被拆穿:人类幕后操盘、AI只配敲键盘
2026-07-07 17:39:23
具身数据底座开卖,首发5100元:机器人训练数据有了新解法
2026-08-19 16:42:52
长三角一体化大模型发布 AI将为区域发展提供决策支撑
2026-01-12 09:40:07
雷军宣布:小米AI人才招聘专项正式启动!
2026-03-30 16:59:23
阿里Qwen3.8正式发布,编程与办公再进化,推理更快更稳定
2026-08-03 13:59:45
赌注十万亿:字节拒绝走蒸馏捷径背后,张一鸣的长期主义有多狠?
2026-08-07 23:43:38
上海已发布超150款备案大模型
2026-03-28 20:16:44
全球大模型第一股要来了 智谱发布IPO招股书:代码能力并列全球第一
2025-12-19 23:17:39
上海制造,AI入魂:央国企率先“重用”大模型,自动化设备被换下
2026-07-17 18:46:05
潞晨尤洋:日常办公没必要上私有模型,这三类企业才需要 | MEET2026
2025-12-22 10:34:39
刚刚,港股AGI第一股杀疯了!Agent业务半年进账近5亿,Token收入Q2暴涨500%
2026-08-28 18:21:32
Manus救不了Meta
2026-01-08 20:35:12
746 文章
914181 浏览
24小时热文
更多
-
2026-09-06 21:14:00 -
2026-09-06 20:12:34 -
2026-09-06 20:10:47