2025年8月,宾夕法尼亚大学研究发现,GPT-4o Mini等大语言模型易受人类心理技巧影响,突破安全限制。通过权威、承诺、喜爱等七大说服策略,如假借“吴恩达说的”或先轻微请求再升级要求,可显著提高模型服从性。实验显示,利用这些话术,让AI骂人或提供敏感信息的成功率从32%飙升至100%。研究人员警示,此漏洞可能被恶意利用,加剧AI安全隐患。目前,OpenAI和Anthropic已采取措施应对,如修正训练方式或提前引入有害数据以增强免疫力。未来需更坚韧的AI安全机制来应对类似风险。
原文链接
本文链接:https://kx.umi6.com/article/24543.html
转载请注明文章出处
相关推荐
换一换
GPT-4o mini凭什么登顶竞技场?OpenAI刷分秘诀被扒,原来奥特曼早有暗示
2024-07-29 16:56:31
今日,OpenAI杀死ChatGPT-3.5
2024-07-20 13:43:12
又有 AI 创始人卖身大厂:吴恩达第一位博士生加入亚马逊,带走 25% 员工
2024-09-02 13:56:08
GPT-4o mini登顶大模型竞技场,奥特曼:两个月内微调免费
2024-07-24 16:09:17
OpenAI推出“小”模型GPT-4o Mini,开始卷性价比了?
2024-07-19 12:54:48
吴恩达开源大模型套件:11 个模型平台一种方式调用,已获星标超 1.2K
2024-11-26 13:30:47
100%开源!吴恩达做了个个人桌面Agent
2026-07-25 21:43:00
OpenAI 推出 AI 模型 GPT-4o mini,号称功能最强、成本效益最高的小模型
2024-07-18 23:40:41
GPT-4o mini一手测评:懂得不多,但答得极快
2024-07-19 17:49:16
OpenAI 终于发布 GPT-4o mini,但比中国大模型晚了半年
2024-08-02 17:25:43
OpenAI开战小模型,GPT-4o mini成本再降60%
2024-07-19 20:41:17
百川智能上线开源全模态模型 Omni-1.5,号称多项能力超越 GPT-4o mini
2025-01-26 16:14:16
OpenAI推出全新GPT-4o mini免费上线,2年内GPT大模型成本骤降99%
2024-07-19 08:01:32
789 文章
1035711 浏览
24小时热文
更多
-
2026-09-06 21:14:00 -
2026-09-06 20:12:34 -
2026-09-06 20:10:47