标题:Anthropic AI 揭示大模型中的注意力回路
近日,Anthropic 发布了一种新的研究方法,用于揭示语言模型内部的底层工作机制。该方法通过构建归因图谱,解析模型如何处理特定输入。例如,在面对“Fact: Michael Jordan plays the sport of __”时,模型首先激活与“plays”“sport”相关的特征,提升篮球、足球等运动项目的输出值;接着,基于“Michael Jordan”与篮球的正相关性,模型最终填入“basketball”。
Anthropic 的方法分两步:首先,以稀疏编码特征为基础构建回路;其次,通过追踪“替换模型”中的计算步骤生成图谱。与以往直接使用神经元作为基础单元的研究不同,Anthropic 方法强调特征间的相互作用,提高了模型输出的可解释性。
研究团队开发了配套工具,成功解析了18层语言模型的行为,并验证了其在 Claude 3.5 Haiku 模型上的适用性。归因图谱显示,模型生成“DAG”时,通过三条主要路径激活相关特征,并结合注意力机制完成输出。此外,Anthropic 提出了“目标加权预期残差归因”(TWERA),用以消除虚拟权重中的干扰因素。
尽管取得进展,该方法仍面临挑战,包括归因图复杂度高、特征吸收与分割问题,以及未能解释注意力模式的形成机制。此外,跨层转码器的忠实度和假设限制也限制了其适用范围。Anthropic 表示,未来研究将聚焦于无监督方法识别关键抑制特征,以进一步完善模型行为的理解。
原文链接
本文链接:https://kx.umi6.com/article/17039.html
转载请注明文章出处
相关推荐
换一换
硅谷大佬发出Anthropic垄断预警:4个月ARR翻了4倍,18个月后或将营收破万亿独霸全球
2026-05-29 15:14:40
独家解读|Anthropic 估值再翻倍逼近万亿,登顶全球 AI 第一的“秘密”是什么?
2026-05-29 17:21:38
马斯克态度大变 公开承认看错Anthropic:不会因竞争拔对方服务器
2026-07-10 11:48:12
Anthropic计划在伦敦进行大规模扩张
2026-04-17 01:34:08
诺奖得主、AlphaFold之父投奔Anthropic!谷歌48小时连跑俩大将
2026-06-20 18:18:58
死敌爆料是狠!OpenAI内部信阴阳Claude营收注水80亿,然后泄露了…
2026-04-15 11:54:00
AI 终于学会 「自我坦白」!Anthropic最新论文震撼来袭,「内省适配器」让黑盒模型自己说出隐藏行为
2026-04-30 20:46:08
半价干翻Fable 5?Opus 5实测炸场,网友:差点从椅子上摔下来
2026-07-25 20:41:43
美国AI巨头赤裸裸双标 指控中国企业蒸馏后坦承自己蒸馏其他模型
2026-04-17 18:15:38
Anthropic在源代码泄露数日后推出网络安全AI模型
2026-04-08 16:59:39
太讽刺了 号称最注重AI安全的Anthropic曝出用户隐私泄露问题
2026-06-07 14:42:06
给「对手」的钱比给「盟友」多,亚马逊疯了吗?
2026-04-30 12:20:19
Anthropic考虑以近万亿美元估值达成融资交易
2026-05-08 13:20:46
701 文章
869642 浏览
24小时热文
更多
-
2026-09-06 21:14:00 -
2026-09-06 20:12:34 -
2026-09-06 20:10:47