污染词元 - AI优秘圈

综合

7*24 快讯

AI科普

合作

全部

英雄令

项目方

开发者

产品方

投资者

GPT-4o 见AV 女优的次数比“您好”还多2.6倍，AI 正在被中文互联网疯狂污染

2025年9月6日，一项由清华、蚂蚁和南洋理工联合发布的研究揭示，大语言模型如GPT-4o存在严重的中文数据污染问题。研究发现，AI对“波多野结衣”等成人内容的熟悉度比日常用语“您好”高出2.6倍，超过23%的长中文词元与色情或网络赌博相关。这些“污染词元”源于高频垃圾信息，虽被算法收录，却因缺乏有效训练导致语义理解缺失。研究团队开发了POCDETECT和POCTRACE工具检测污染程度，结果显示GPT系列污染率高达46.6%，而其他模型如GLM4和DeepSeek-V3表现较好。论文指出，互联网语料中的灰色内容难以彻底清理，AI的智能仍基于统计概率，而非真正认知。这提醒我们，AI的缺陷映射了数字环境的现状。

原文链接