三大模型巨头比拼“幻觉”能力:ChatGPT优势明显,DeepSeek表现欠佳
近日,智利大学研究员Roberto Araya通过四组对照实验,比较了Gemini 2.0 Flash、ChatGPT o3-mini和DeepSeek R1在应对幻觉问题上的表现。实验结果显示,ChatGPT o3-mini在推理灵活性和准确性上占据绝对优势,能够高效切换策略得出正确结论。相比之下,DeepSeek R1和Gemini 2.0 Flash虽尝试使用策略,但推理过程常出错或混乱。
进一步研究发现,Gemini 2.0 Flash的推理用词最少,但其策略使用效果不佳;ChatGPT o3-mini的推理过程和结论正确率最高;DeepSeek R1推理冗长但结论正确率较高。
研究还通过贝叶斯推理实验,考察模型在无提示和有提示条件下的表现。结果显示,ChatGPT o3-mini在提示条件下表现最优,能灵活使用自然频率推理;DeepSeek R1推理过程冗长且混乱;Gemini 2.0 Flash虽尝试生态策略,但推理过程存在错误。
幻觉问题是大模型的常见挑战,可分为事实性幻觉和忠实性幻觉。其成因包括数据质量问题、训练偏差及推理过程中的创造性“想象”。尽管幻觉难以完全避免,但通过提升数据质量、引入先验知识及优化模型架构,可显著降低其影响。
原文链接
本文链接:https://kx.umi6.com/article/16344.html
转载请注明文章出处
相关推荐
换一换
腾讯宣布升级大模型研发架构 前OpenAI研究员姚顺雨任要职
2025-12-17 17:58:49
杭州“十五五”规划建议:实施大模型前沿技术攻关和高端芯片、基础软件、模型算法等研发计划 建设人工智能开源社区
2026-01-16 11:34:57
阶跃星辰杀入季后赛,强势跻身AI“新六小虎”第一梯队
2026-02-27 15:48:37
腾讯AI下了一场「及时雨」
2025-12-19 10:42:16
WAIC信息爆炸!大佬们都在说什么,笔记看这里
2026-07-18 12:23:17
智谱AI,排名「第二」
2025-12-21 12:41:26
GPT-5.6首批实测来了!精准狙击Mythos
2026-06-10 15:15:36
卓世科技,股改完成!
2026-01-05 15:08:15
中金:2026年大模型在强化学习、模型记忆、上下文工程等方面将取得更多突破
2026-02-05 08:39:59
终于要变聪明了!特斯拉官宣接入豆包
2026-06-24 15:38:03
MiniMax M3一手实测:老黄PPT上74个Logo,我以为能难住它
2026-06-03 00:53:27
荣膺2026 WAIC“镇馆之宝”!大模型原生智能体手机STEPX Neo解锁AI交互新范式
2026-07-15 14:59:25
马斯克直呼完了:Anthropic 73页论文刷屏,全球大模型中招思想病毒!
2026-08-20 16:35:22
737 文章
935168 浏览
24小时热文
更多
-
2026-09-06 21:14:00 -
2026-09-06 20:12:34 -
2026-09-06 20:10:47