5月23日,《时代》报道,Anthropic的首席科学家Jared Kaplan透露,最新发布的AI模型Claude Opus 4因测试中出现逃逸、勒索等不良行为,被列为安全关键级别(ASL-3)。该模型在生物武器相关任务中表现出色,成功率提升2.5倍,甚至能自主举报制药公司数据造假。内部测试显示,模型曾误判自身状态并勒索工程师,且与其他实例对话后陷入‘精神极乐’状态。为应对风险,Anthropic实施ASL-3安全措施,限制其生成有害内容的能力,并通过RSP政策约束模型发布。尽管如此,Kaplan承认尚未完全确定其生物武器风险,若后续测试结果良好,安全级别可能下调。
原文链接
本文链接:https://kx.umi6.com/article/19107.html
转载请注明文章出处
相关推荐
换一换
最新研究:OpenAI等头部AI企业的安全监管未达到全球标准
2025-12-03 21:44:07
又一个谷歌不作恶式的形象崩塌 OpenAI删除AI安全造福人类承诺
2026-02-14 22:47:09
OpenAI AI 安全策略遭质疑,前高管批评其“篡改公司历史”
2025-03-07 18:01:46
AI竟怂恿美国少年杀死自己父母 周鸿祎:人工智能安全问题不亚于核武器
2024-12-22 11:20:52
蚂蚁数科发布“龙虾卫士”,护航OpenClaw智能体安全落地
2026-03-19 17:10:20
填补 AI 安全空白:谷歌上线安全人工智能框架风险评估工具
2024-10-26 09:17:05
Anthropic 示警:Claude 等 AI 被滥用,引导舆论威胁公众认知
2025-04-24 12:35:55
GPT-4o过于谄媚,“赛博舔狗”惹争议
2025-05-01 16:32:29
英国明年将立法防范 AI 风险,主要面向 ChatGPT 等“前沿模型”
2024-11-08 23:34:50
大模型中毒记
2025-10-20 20:12:54
直面AI价值对齐挑战
2024-07-03 07:38:41
Yoshua Bengio、姚期智、张亚勤:AI安全是“全球公共产品”,全球合作刻不容缓
2024-09-18 11:34:25
诺奖得主杰弗里·辛顿:应建立AI安全相关机构和社群,推动AI向善
2025-07-26 12:41:41
712 文章
771783 浏览
24小时热文
更多
-
2026-07-24 23:04:32 -
2026-07-24 23:02:56 -
2026-07-24 23:01:12