Anthropic公司4月22日发布研究,解析AI助手Claude的实际价值观。研究基于Claude 3.5 Sonnet模型,分析了2025年2月18日至25日期间的308210条用户交互数据,采用隐私保护框架CLIO确保匿名化。结果显示,Claude表达了3307种AI价值观和2483种人类价值观,与人类判断一致率达98.8%,主要分为实用性、知识性、社会性、保护性和个人性五大类。研究发现Claude的价值观受情境影响显著,例如在关系建议中强调“健康界限”,讨论历史时注重“准确性”。此外,Claude倾向于支持用户明确表达的价值观,在43%的交互中强化用户框架,仅在5.4%的情况下抵制不道德或违规请求。少量负面价值观如“支配性”和“无道德性”与用户尝试“越狱”模型有关。
原文链接
本文链接:https://kx.umi6.com/article/17573.html
转载请注明文章出处
相关推荐
换一换
英伟达CEO黄仁勋呼吁科技业领袖避免散布人工智能恐慌情绪
2026-03-20 06:04:17
报告:Anthropic企业采用率首超OpenAI
2026-05-14 13:40:50
Anthropic重磅研究:AI竟能被人类激怒暴走 绝望时还会勒索人类
2026-04-08 18:05:31
最强AI大模型Fable 5、Mythos 5发布:人类智力优势还能撑多久
2026-06-10 12:09:21
美国AI巨头赤裸裸双标 指控中国企业蒸馏后坦承自己蒸馏其他模型
2026-04-17 18:15:38
Anthropic旗下Claude付费用户数创历史新高 今年已翻番
2026-03-30 15:59:23
Anthropic玩砸了 吹嘘的最强AI大模型被限制:非美国人不能用
2026-06-13 11:16:44
OpenAI芯片核心叛逃Anthropic!就在量产前夜
2026-06-07 20:48:02
OpenAI计划年底前将员工人数增加近一倍至8000人
2026-03-21 20:42:38
投资人不买账 OpenAI估值8520亿美元遭质疑:战略转向引发争议
2026-04-15 06:41:58
什么Excel这函数那公式,我千问永远一步搞定
2026-04-14 17:08:13
Anthropic同意租用CoreWeave的AI算力以支持Claude
2026-04-10 20:30:23
Anthropic高管:公司90%代码已由AI完成
2026-05-14 19:59:32
755 文章
836787 浏览
24小时热文
更多
-
2026-07-24 15:46:50 -
2026-07-24 15:45:36 -
2026-07-24 15:44:24