2025年11月,意大利罗马大学与DEXAI实验室研究发现,将恶意指令写成诗歌可轻松突破大语言模型的安全限制。研究人员测试了25个主流模型,包括谷歌Gemini、OpenAI GPT-5等,结果显示‘诗歌攻击’使防御成功率大幅下降,部分模型如Gemini 2.5 Pro的防御率直接归零。研究指出,大模型因过度解读隐喻而易受攻击,小模型却因‘读不懂’幸免于难。论文强调,现有安全机制过于依赖关键词匹配,忽视了风格伪装的风险,呼吁重新审视AI安全评估方法。相关研究已发布在arXiv平台。
原文链接
本文链接:https://kx.umi6.com/article/29101.html
转载请注明文章出处
相关推荐
换一换
警惕AI大模型的“共情鸿沟”,剑桥团队呼吁:我们需要“儿童安全人工智能”框架
2024-07-11 15:47:39
ChatGPT 被指导致美国一名 16 岁少年自杀:未有效干预且起到“教学”作用
2025-08-27 08:58:25
研究:用诗歌就能让 AI 说违禁内容,成功率达 62%
2025-12-01 08:55:57
小红书怎么一夜成为全世界网友都爱的翻译软件?
2025-01-20 21:24:11
deepseek关联公司公布大语言模型部署方法专利
2025-08-01 14:04:10
Meta人事巨震、AI教母站台 通往AGI之路遇上分岔路口
2025-11-15 10:46:28
苹果创新“清单法”:用 AI 大模型当“老师”,教小模型更精准执行复杂指令
2025-08-26 07:38:55
对话宇树科技创始人王兴兴:人形机器人大模型,还没走到“大力出奇迹”阶段
2024-08-22 09:27:42
大语言模型会推理吗?
2024-11-13 11:33:40
DeepSeek并非完美,训练过程存在“深度诅咒”
2025-02-12 14:30:22
古农文垂直领域大语言模型“齐民”发布,基于我国大量农业古籍文本训练
2024-09-20 23:13:38
B站亮相 2024 世界人工智能大会,首次展出自研大语言模型
2024-07-05 20:57:56
我被AI骗了
2025-02-27 14:24:34
772 文章
962759 浏览
24小时热文
更多
-
2026-09-06 21:14:00 -
2026-09-06 20:12:34 -
2026-09-06 20:10:47