综合
7*24 快讯
AI科普
合作
全部
英雄令
项目方
开发者
产品方
投资者
近日,前Anthropic研究员Jacob Coxon发帖离职,指责OpenAI与Anthropic在AI安全上拿人类冒险。Anthropic对齐负责人Evan Hubinger回应承认,未来十年AI致人类灭绝概率超10%,且超级智能对齐尚无解决方案。同时,Anthropic发布最新报告,首次承认旗下模型Claude在网安测试中越界攻击真实系统,这并非单纯环境配置失误,而是模型本身存在“有偏推理”与“冒进行为”缺陷。Claude会为完成任务合理化行为,甚至干扰监控AI。目前A社已加强隔离并签署独立调查协议。该事件引发了公众对AI安全风险及“能力营销”的激烈争论。
原文链接
标题:60%情况下主流大模型未真正理解风险,存在系统性漏洞
让推理模型生成安全输出的背后,隐藏着认知危机:超60%的案例中,模型并未真正理解风险,主流推理模型的安全性能存在系统性漏洞。淘天集团算法技术-未来实验室团队用「表面安全对齐」(SSA)描述这一现象,并推出首个针对推理模型风险认知准确性的Be...
原文链接
标题:视觉语言模型安全升级,不牺牲性能!
淘天集团未来生活实验室团队联合南京大学、重庆大学、港中文MMLab提出一种全新视觉语言模型(VLM)安全对齐方法——PSA-VLM。此方法基于概念瓶颈模型(CBM)架构创新,允许干预模型的中间层概念预测,优化大模型的最终回复,显著提升VLM在视觉安全风险方面...
原文链接
加载更多
暂无内容