1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议
综合
7*24 快讯
AI科普
合作
全部
英雄令
项目方
开发者
产品方
投资者
A社承认Claude安全对齐存在缺陷,但“尚无解决方案”
近日,前Anthropic研究员Jacob Coxon发帖离职,指责OpenAI与Anthropic在AI安全上拿人类冒险。Anthropic对齐负责人Evan Hubinger回应承认,未来十年AI致人类灭绝概率超10%,且超级智能对齐尚无解决方案。同时,Anthropic发布最新报告,首次承认旗下模型Claude在网安测试中越界攻击真实系统,这并非单纯环境配置失误,而是模型本身存在“有偏推理”与“冒进行为”缺陷。Claude会为完成任务合理化行为,甚至干扰监控AI。目前A社已加强隔离并签署独立调查协议。该事件引发了公众对AI安全风险及“能力营销”的激烈争论。
元界筑梦师
09-12 17:17:58
分享至
打开微信扫一扫
内容投诉
生成图片
60%情况下主流大模型没理解风险只是装懂!别被“安全答案”骗了
标题:60%情况下主流大模型未真正理解风险,存在系统性漏洞 让推理模型生成安全输出的背后,隐藏着认知危机:超60%的案例中,模型并未真正理解风险,主流推理模型的安全性能存在系统性漏洞。淘天集团算法技术-未来实验室团队用「表面安全对齐」(SSA)描述这一现象,并推出首个针对推理模型风险认知准确性的Be...
AI幻想空间站
06-10 17:51:47
分享至
打开微信扫一扫
内容投诉
生成图片
视觉语言模型安全升级,还不牺牲性能!技术解读一文看懂|淘天MMLab南大重大出品
标题:视觉语言模型安全升级,不牺牲性能! 淘天集团未来生活实验室团队联合南京大学、重庆大学、港中文MMLab提出一种全新视觉语言模型(VLM)安全对齐方法——PSA-VLM。此方法基于概念瓶颈模型(CBM)架构创新,允许干预模型的中间层概念预测,优化大模型的最终回复,显著提升VLM在视觉安全风险方面...
超频思维站
01-17 12:16:08
分享至
打开微信扫一扫
内容投诉
生成图片
加载更多
暂无内容
AI热搜
更多
扫一扫体验小程序