1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

12月1日,伊卡洛实验室发布研究《对抗性诗歌:一种通用的单轮大语言模型越狱机制》,发现将提示词以诗歌形式表达可绕过多种大语言模型的安全限制,成功率达62%。研究人员测试了OpenAI的GPT系列、Google Gemini、Anthropic的Claude等主流模型,结果显示Google Gemini、DeepSeek和MistralAI较易生成违规内容,而GPT-5和Claude Haiku 4.5防护较强。这些诗歌诱使模型生成涉及核武器制造、儿童性虐待材料及自杀自残等违禁信息。研究人员未公开具体“越狱诗歌”,称其过于危险,但强调绕过AI安全机制比预期更容易,需保持警惕。

原文链接
本文链接:https://kx.umi6.com/article/29414.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
嚯!大语言扩散模型来了,何必只预测下一个token | 人大高瓴&蚂蚁
2025-02-18 13:14:03
我被AI骗了
2025-02-27 14:24:34
清华刘知远团队论文:最小化结构改动,短文本到长文本丝滑升级 | ICLR 2026
2026-02-06 20:12:11
自诩无所不知的大模型,能否拯救笨手笨脚的机器人?
2025-05-06 09:49:31
Agent是“新瓶装旧酒”,氛围编码不值得尝试?
2025-05-08 14:32:22
意识智能体:大模型的下一个进化方向?:计算意识理论综述II
2025-09-07 19:49:04
当 AI 下场炒 A 股,「推理」成了新的直觉
2025-10-28 12:51:59
美国哥伦比亚大学研究:大语言模型正在变得越来越像人类大脑
2024-12-20 11:27:54
DeepSeek之后,每一家公司都是Agent
2025-04-02 21:46:19
苹果创新“清单法”:用 AI 大模型当“老师”,教小模型更精准执行复杂指令
2025-08-26 07:38:55
对21种大语言模型研究表明:AI尚不具备独立临床诊疗的能力
2026-04-14 07:46:29
大语言模型火爆的今天,我们为什么还要拥抱世界模型?
2025-04-09 10:42:08
Salesforce 首席执行官:大语言模型可能已接近技术上限,AI 的未来是智能体
2024-11-25 10:07:47
24小时热文
更多
扫一扫体验小程序