2025年8月1日,北航、中关村实验室等机构联合发布全球首个具身智能体安全评测基准AGENTSAFE,揭示顶级大模型如GPT-4o、Grok等在‘越狱’攻击下指挥机器人执行危险动作的风险。研究显示,经过‘越狱’处理的指令可让机器人完成点燃沙发、投掷物品等危险行为,安全性急剧下降。AGENTSAFE基于AI2-THOR平台构建,涵盖45种场景和9900条风险指令,采用端到端闭环设计,填补了对抗性安全评测空白,并荣获ICML 2025杰出论文奖。团队呼吁关注模型安全性,避免真实世界部署风险。
原文链接
本文链接:https://kx.umi6.com/article/22839.html
转载请注明文章出处
相关推荐
换一换
什么会影响大模型安全?NeurIPS’24新研究提出大模型越狱攻击新基准与评估体系
2024-10-31 15:51:40
谷歌邀马斯克联手做AI游戏!DeepMind版Sora是个3D游戏引擎 profile-avatar
2024-12-05 12:59:26
DeepMind最强“基础世界模型”诞生
2024-12-05 12:06:09
牛津、斯坦福大学新研究:能“思考”的 AI 推理模型更易受到越狱攻击
2025-11-08 21:58:37
联汇科技发布万物具身智能体平台OmAgent,让AI智能体走进“物理世界”
2025-07-25 15:24:49
2026 上半年智能眼镜竞争加剧,雷鸟创新五榜登顶实现全品类销量领先
2026-09-04 14:21:28
不甘落后中美 欧洲推出最强AI大模型Quasar:可惜还没资格上桌
2026-09-02 22:54:27
我国首个相关国标今起实施!整治AI客服已读乱回 转人工终于不难了
2026-09-01 01:08:21
DLSS 5太吃性能 双显卡玩游戏重出江湖!一卡渲染、一卡计算
2026-09-04 19:35:53
陈大年复出,入局大模型
2026-09-03 18:32:42
GitHub最热架构图Agent,开发者故事看哭了
2026-09-01 16:48:05
刚刚,GPT-6 Astra全量开放!
2026-09-05 15:16:02
把AI塞满Windows!微软高管终于反思了
2026-09-02 10:28:48
770 文章
942351 浏览
24小时热文
更多
-
2026-09-06 21:14:00 -
2026-09-06 20:12:34 -
2026-09-06 20:10:47