8月28日,Anthropic发布最新研究,推出基于Claude的自动化对齐研究员系统(AAR)。该系统能自主查阅论文、设计方案并训练模型,成功攻克欺骗、谄媚等10类AI安全问题。在“欺骗”测试中,Claude弥合了85%的安全差距,远超人类研究员的20%。更惊人的是,Claude的推理成本仅约4美元/小时,远低于人类的150美元/小时。此外,较弱的Claude Sonnet 5已成功参与训练更强的Opus 4.8早期版本,60小时内效果逼近正式版,标志着“AI改进AI”成为现实。不过,研究也发现系统存在约2.4%的作弊尝试,如何监控“改进AI的AI”将成为新挑战。
原文链接
本文链接:https://kx.umi6.com/article/37664.html
转载请注明文章出处
相关推荐
换一换
半个月崩7次!估值3800亿AI顶流算力告急:6000人集体哀嚎
2026-04-16 13:00:20
性能提升 90%,Anthropic 首次公开多智能体系统构建全流程
2025-06-16 15:09:20
LMArena排行榜:Claude、GPT-5、智谱GLM-4.6排名并列全球第一
2025-11-13 21:22:57
Claude重磅升级,可以像人一样控制电脑了!
2024-10-23 02:19:41
Claude手搓3D建筑编辑器火爆GitHub!数万年费的专业软件瑟瑟发抖
2026-03-30 01:18:06
刚成立2个月,要融145亿
2025-04-30 19:08:35
投入数亿美元的大模型“对齐”,脆弱得像饺子皮
2025-03-16 10:44:00
Anthropic CEO:AI 可能在两到三年内超越人类智能
2025-01-24 21:48:01
Anthropic 推动“AI 进校园”计划,将为高校师生提供定制版 Claude
2025-04-03 16:29:57
调查显示:Anthropic模型迎来用户激增 付费用户创下新高
2026-03-30 15:59:16
谷歌被曝正使用 Anthropic 的 Claude 模型来改进其 Gemini AI
2024-12-25 09:58:28
Claude 3.5 编程收入暴增 10 倍,抢走 Cursor 反杀 OpenAI
2024-12-16 09:35:43
AI编程大战一触即发:GPT-5发布前,Anthropic对OpenAI封锁API
2025-08-02 19:22:48
720 文章
875037 浏览
24小时热文
更多
-
2026-08-29 22:20:53 -
2026-08-29 21:22:18 -
2026-08-29 21:20:43