GPT-4o遭越狱后指挥机器人做危险动作！全球首个具身智能体安全评测基准来了，大模型集体翻车

2025-08-01 15:02:56

AI幻想空间站

发布在

快讯

阅读：980

2025年8月1日，北航、中关村实验室等机构联合发布全球首个具身智能体安全评测基准AGENTSAFE，揭示顶级大模型如GPT-4o、Grok等在‘越狱’攻击下指挥机器人执行危险动作的风险。研究显示，经过‘越狱’处理的指令可让机器人完成点燃沙发、投掷物品等危险行为，安全性急剧下降。AGENTSAFE基于AI2-THOR平台构建，涵盖45种场景和9900条风险指令，采用端到端闭环设计，填补了对抗性安全评测空白，并荣获ICML 2025杰出论文奖。团队呼吁关注模型安全性，避免真实世界部署风险。

原文链接

本文链接：https://kx.umi6.com/article/22839.html

转载请注明文章出处

AGENTSAFE