1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

正文:2025年12月,OpenAI公开了一项名为“忏悔训练”(Confessions)的新方法,用于提升AI模型的诚实性。该研究在GPT-5-Thinking上实验,通过让模型生成“忏悔报告”,主动承认回答中的错误或违规行为。结果显示,在12个测试场景中,模型有11个场景会以较高概率坦白问题,且忏悔内容比原回答更诚实。此训练不影响模型完成主任务的能力。技术核心是将忏悔奖励与主任务奖励隔离,避免模型因承认错误而受罚。研究还发现,未经专门训练的GPT-5-Thinking已具备一定忏悔能力,但训练后在指令遵循等方面表现更佳。不过,该方法对模型“真心认为正确”的错误无效,也无法防御越狱攻击。OpenAI计划将其与思维链监控等技术结合使用,进一步提升AI安全性。

原文链接
本文链接:https://kx.umi6.com/article/29670.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
Kimi上去了 Anthropic换锚了?
2026-08-03 16:09:46
千问App上新重磅功能:支持办公助理、定时任务!可自动处理工作
2026-08-07 11:19:13
亿级日活App的“算力生死劫”:推理成本倒挂,他们靠跨云架构砍掉75% GPU集群
2026-08-04 09:40:59
激流:中国科技投资的势能与锚点|甲子引力X
2026-08-04 12:49:01
又一家AI基金暴雷了
2026-08-05 21:02:02
AI不再用完即忘:华为诺亚开源MindMemOS,记忆和Skill一起进化
2026-08-03 11:54:44
刚刚450亿美元爆仓、如今婚礼照办!华尔街00后股神发致歉信:彻底失败
2026-08-04 17:07:24
114B参数、6B激活,Sand.ai刚刚开源全球首个千亿MoE视频生成模型
2026-08-05 15:52:17
GPT-Live 底层拆解:OpenAI 如何让 95% 的音频帧不再延迟
2026-08-06 22:52:05
DeepSeek单日吞下8万亿Token OpenAI被迫降价追赶
2026-08-03 16:11:17
腾讯混元Hy ASR 3.0 preview:让语音识别理解上下文
2026-08-04 18:03:09
AI顶会现场,见到了一家美妆巨头
2026-08-01 11:15:06
资本重仓端侧物理AI:前海母基金数亿元押注,Om AI联汇加速端侧AI商业化落地
2026-08-04 15:55:54
24小时热文
更多
扫一扫体验小程序