1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

标题:揭开大模型“伪遗忘”,港理工等团队:结构不变就是没忘

近年来,大语言模型(LLMs)能力迅猛发展,但随之而来的隐私风险也日益凸显。训练中暴露的敏感信息常被模型“记住”,引发广泛关注。为此,机器遗忘(Machine Unlearning)技术应运而生,旨在不影响整体能力的前提下,有选择性地抹除特定知识。

香港理工大学、卡内基梅隆大学和加州大学圣克鲁兹分校的研究团队开发了一套表示空间诊断工具,区分了“可逆性遗忘”与“灾难性不可逆遗忘”。研究表明,真正的遗忘需多个网络层协同大幅扰动,而在高敏感区域的轻微更新虽会降低准确率或增加困惑度,但模型内部表示结构仍保持完整。

该团队构建了一个统一的表示层分析工具箱,用于诊断LLM在遗忘、再学习和微调过程中的变化。研究发现,真正的遗忘表现为结构性的抹除,而非行为上的抑制。例如,在可逆遗忘中,模型可通过再学习恢复原状,而在不可逆遗忘中,即使行为表现下降,结构也会严重扰动,难以恢复。

研究者通过PCA Similarity/Shift、CKA相似性分析和Fisher信息矩阵(FIM),揭示了遗忘的可逆边界。实验表明,单次遗忘大多可恢复,但持续性遗忘易导致彻底崩溃。此外,某些遗忘方法可能导致隐式增强效果,提示Unlearning可能具备对比式正则化或课程学习的效果。

研究团队还验证了这些结论在复杂任务中的适用性,并提供了一系列结构诊断工具,以支持实现“可控、局部、不可逆”的安全遗忘机制。这项工作由Xiaoyu Xu、Xiang Yue、Yang Liu、Qingqing Ye、Haibo Hu和Minxin Du共同完成。

论文地址:https://arxiv.org/abs/2505.16831
GitHub地址:https://github.com/XiaoyuXU1/Representational_Analysis_Tools.git

— 完 —

原文链接
本文链接:https://kx.umi6.com/article/19569.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
SU 哈佛亚马逊最新研究:量化能让大模型“恢复记忆”,删掉的隐私版权内容全回来了
2024-11-16 16:31:57
20ms把PDF变成Markdown!开源OCR神器快了近300倍
2026-08-29 21:19:09
机器人不能停下来等模型:星尘发布 SmoothRL,让在线强化学习跟上大模型的异步推理
2026-09-04 18:32:46
刚刚,GPT-6正式发布!OpenAI:欢迎来到AGI时代
2026-09-04 06:01:21
SkyProduction天工工作台:从剧本到成片,一套工作台把精品短剧创作真正跑起来
2026-09-02 17:38:53
李飞飞发布:全球首个多模态世界模型
2026-09-02 10:22:51
人类 越来越难理解AI
2026-08-31 16:50:05
一个模型场景通吃!它石智航AWE3.7的泛化能力有点狠
2026-09-03 11:17:59
在接下来70%的人生里 我可能都要问“是AI做的吗?”
2026-09-03 01:00:11
自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning
2026-09-01 13:36:24
不甘落后中美 欧洲推出最强AI大模型Quasar:可惜还没资格上桌
2026-09-02 22:54:27
AQuA:让量化研究 Agent 持续进化,也让回测结果经得起检验
2026-08-31 11:34:56
去年归国的徐梦迪,成了清华姚班班主任
2026-08-29 21:22:18
24小时热文
更多
扫一扫体验小程序