1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

2025年9月6日,一项由清华、蚂蚁和南洋理工联合发布的研究揭示,大语言模型如GPT-4o存在严重的中文数据污染问题。研究发现,AI对“波多野结衣”等成人内容的熟悉度比日常用语“您好”高出2.6倍,超过23%的长中文词元与色情或网络赌博相关。这些“污染词元”源于高频垃圾信息,虽被算法收录,却因缺乏有效训练导致语义理解缺失。研究团队开发了POCDETECT和POCTRACE工具检测污染程度,结果显示GPT系列污染率高达46.6%,而其他模型如GLM4和DeepSeek-V3表现较好。论文指出,互联网语料中的灰色内容难以彻底清理,AI的智能仍基于统计概率,而非真正认知。这提醒我们,AI的缺陷映射了数字环境的现状。

原文链接
本文链接:https://kx.umi6.com/article/24795.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
DeepSeek之后,每一家公司都是Agent
2025-04-02 21:46:19
2000美元一只“草莓”,OpenAI 新模型价格挑战用户底线?
2024-09-06 21:00:01
清华刘知远团队论文:最小化结构改动,短文本到长文本丝滑升级 | ICLR 2026
2026-02-06 20:12:11
警惕AI大模型的“共情鸿沟”,剑桥团队呼吁:我们需要“儿童安全人工智能”框架
2024-07-11 15:47:39
对21种大语言模型研究表明:AI尚不具备独立临床诊疗的能力
2026-04-14 07:46:29
顶级AI认知能力输给老年人,大模型集体翻车
2025-01-13 09:55:05
李飞飞一年前究竟说了啥?怎么又火了
2025-09-11 14:55:23
原微软WizardLM项目团队加入腾讯混元
2025-05-14 15:18:55
清华刘知远团队论文:在严格可控环境下重新回答「强化学习能否教会大模型新能力」丨ICLR 2026
2026-02-09 19:27:01
压缩算法为大语言模型“瘦身”
2024-11-22 08:57:50
“学术剽窃”定义正被AI模糊,我们该如何应对?
2024-08-01 21:09:52
诚恳认错坚决不改 为什么AI总扯谎:原因揭开
2026-02-24 13:46:39
DeepSeek使用技巧,你收藏这一篇就够了
2025-02-07 21:09:11
24小时热文
更多
扫一扫体验小程序