GPT-4o 见AV 女优的次数比“您好”还多2.6倍，AI 正在被中文互联网疯狂污染

2025-09-06 12:37:21

元界筑梦师

发布在

快讯

阅读：1721

2025年9月6日，一项由清华、蚂蚁和南洋理工联合发布的研究揭示，大语言模型如GPT-4o存在严重的中文数据污染问题。研究发现，AI对“波多野结衣”等成人内容的熟悉度比日常用语“您好”高出2.6倍，超过23%的长中文词元与色情或网络赌博相关。这些“污染词元”源于高频垃圾信息，虽被算法收录，却因缺乏有效训练导致语义理解缺失。研究团队开发了POCDETECT和POCTRACE工具检测污染程度，结果显示GPT系列污染率高达46.6%，而其他模型如GLM4和DeepSeek-V3表现较好。论文指出，互联网语料中的灰色内容难以彻底清理，AI的智能仍基于统计概率，而非真正认知。这提醒我们，AI的缺陷映射了数字环境的现状。

原文链接

本文链接：https://kx.umi6.com/article/24795.html

转载请注明文章出处

大语言模型