标题:60%情况下主流大模型未真正理解风险,存在系统性漏洞
让推理模型生成安全输出的背后,隐藏着认知危机:超60%的案例中,模型并未真正理解风险,主流推理模型的安全性能存在系统性漏洞。淘天集团算法技术-未来实验室团队用「表面安全对齐」(SSA)描述这一现象,并推出首个针对推理模型风险认知准确性的Benchmark——Beyond Safe Answers(BSA)。
BSA包含三个关键特征:挑战性的数据集、全面的覆盖范围和详细的风险注释。它评测了19个开源和闭源大模型,结果显示,表现最佳的Deepseek-R1-671B模型,其思维过程准确率不到40%。团队还识别出SSA的三种普遍场景:过度敏感、认知捷径和风险遗漏,并构建了2000条样本进行系统验证。
研究发现,模型推理准确性越高,回答越安全;反之则不稳定。多风险场景下,模型常选择性忽视部分风险,且在复杂场景中,风险识别阈值可能过低,导致误判。此外,模型规模扩大能显著提升性能,特别是风险遗漏场景。
研究还探讨了安全规则、微调及采样参数对模型的影响。加入安全指令后,模型的安全性和推理准确性显著提升,但可能变得过度敏感。微调虽能改善表现,但也增加了过度敏感倾向。调整解码参数对安全性和推理准确性影响有限,模型的核心能力依赖于训练和对齐阶段。
这项研究由郑柏会、郑博仁、曹珂瑞、谭映水等完成,论文及相关资源已在多个平台公开,未来将继续更新和完善。
原文链接
本文链接:https://kx.umi6.com/article/19998.html
转载请注明文章出处
相关推荐
换一换
马斯克直呼完了:Anthropic 73页论文刷屏,全球大模型中招思想病毒!
2026-08-20 16:35:22
舔狗AI和被预约的寿司郎
2026-06-05 00:34:31
终于用上AI的公司 发现业务被大模型公司抢了
2026-07-19 14:15:02
全球开发者狂喜!Codex移除5小时限制,Fable 5订阅再延7天,有人烧token烧到住院
2026-07-13 13:10:48
荣膺2026 WAIC“镇馆之宝”!大模型原生智能体手机STEPX Neo解锁AI交互新范式
2026-07-15 14:59:25
持续霸榜!阿里千问3.6Plus问鼎全球大模型调用周榜冠军
2026-04-07 12:52:26
上海已发布超150款备案大模型
2026-03-28 20:16:44
美图吴欣鸿回应大模型竞争:美图应用数据仍在快速增长
2026-02-05 18:05:31
「说 Harness 会被淘汰的,肯定没做过工程」,Kimi 前 CLI 负责人戳破了 AI 圈最大的误解
2026-08-12 00:01:28
刚刚,Qwen3.8-27B 开源了!家用显卡也能跑
2026-08-15 00:36:59
阿里Qwen3.8正式发布,编程与办公再进化,推理更快更稳定
2026-08-03 13:59:45
豆包大模型2.0正式发布
2026-02-14 14:23:01
消息称腾讯大模型团队架构调整:前 OpenAI 研究员姚顺雨任要职,校招最高 2 倍薪资挖 AI 人才
2025-12-17 17:57:42
771 文章
950221 浏览
24小时热文
更多
-
2026-09-12 17:17:58 -
2026-09-12 17:16:37 -
2026-09-12 16:14:08