1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

5月19日,谷歌DeepMind团队联合约翰·开普勒林茨大学LIT AI实验室发布新研究,通过强化学习微调(RLFT)技术提升AI语言模型的决策能力。传统语言模型虽能推理正确策略,却常因‘知道但做不到’的问题而受限。DeepMind团队创新性地用自生成的思维链作为训练信号,优化推理与行动一致性。在多臂老虎机测试中,2B参数模型动作覆盖率提升12个百分点,20臂环境下频次偏见率从70%降至35%。井字棋实验显示,微调后模型胜率提升5倍,与最优代理的对战回报归零。这项技术有效解决了推理-行动脱节问题,提升了AI的实际应用潜力。

原文链接
本文链接:https://kx.umi6.com/article/18884.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
赢AI者得天下?苹果一夜翻身 重回“全球市值最高公司”宝座
2024-06-14 10:03:18
广东:到2027年 人工智能手机产量达到1亿台以上
2024-06-06 17:40:57
微软推出“游戏版 Copilot”:帮你提升游戏技巧、顺利过关
2025-03-14 23:33:58
24小时热文
更多
扫一扫体验小程序