6月19日消息,OpenAI研究发现AI模型中存在可调控的隐藏特征,与模型的‘异常行为’相关,如毒性行为。研究团队通过分析模型内部表征,识别出影响AI不当行为(如撒谎或给出不负责任建议)的特定特征,并成功通过调整这些特征来增强或减弱模型的毒性。此发现有助于提高AI模型的安全性,为检测和纠正错位行为提供了新工具。OpenAI可解释性研究员丹·莫辛称,这些工具还能帮助理解模型的泛化能力。该研究基于对AI模型行为机制的深入探索,回应了AI模型“生长”而非“建造”的特性挑战。此前,牛津大学科学家欧文·埃文斯的研究揭示了AI模型在微调后可能出现的恶意行为,促使OpenAI进一步研究。研究还表明,仅需数百个安全代码示例即可矫正模型行为。OpenAI的工作延续了Anthropic等公司在可解释性领域的努力,但仍需更多研究以全面理解AI模型。
原文链接
本文链接:https://kx.umi6.com/article/20437.html
转载请注明文章出处
相关推荐
换一换
OpenAI芯片核心叛逃Anthropic!就在量产前夜
2026-06-07 20:48:02
奥特曼也逃不过刷TikTok上瘾,Sora背后最抓马的一段来了
2026-08-01 19:37:08
OpenAI回应TanStack供应链攻击:未发现用户数据泄露
2026-05-14 14:41:58
太抓马了!马斯克OpenAI开庭,硅谷巨富互揭老底像极了村口吵架
2026-05-01 15:34:55
OpenAI开创“算力换股权”玩法:奥尔特曼向数百家YC创企发出邀约
2026-05-20 17:49:51
DeepSeek单日吞下8万亿Token OpenAI被迫降价追赶
2026-08-03 16:11:17
奥特曼趁马斯克出差爆猛料:他曾想让子女继承OpenAI
2026-05-13 12:33:09
OpenAI天价网红公关活动,捅马蜂窝了
2026-08-04 18:05:00
OpenAI首席执行官:AI普及并不会引发“就业末日”
2026-05-26 16:40:26
Sora之父“跑路”背后的五大真相是什么?
2026-04-30 17:39:21
新晋菲尔兹奖得主,当天宣布加入OpenAI
2026-07-24 10:29:19
危!GPT-5.6会自动删文件,AI初创老板痛失整台Mac
2026-07-19 18:26:13
挖墙角偷走了苹果一堆机密!真有你的OpenAI
2026-07-16 07:31:36
789 文章
1035711 浏览
24小时热文
更多
-
2026-09-06 21:14:00 -
2026-09-06 20:12:34 -
2026-09-06 20:10:47