标题:万轮实测:GPT-4.5 不如 GPT-4
经过总计30291次盲测投票,大多数人更喜欢GPT-4。赛博菩萨Andrej Karpathy回顾了GPT系列的发展历史:GPT-1只能生成基本文本,GPT-2较为混乱,GPT-3更为有趣;GPT-3.5达到商用水平并引发“ChatGPT时刻”;GPT-4带来全面提升。
Karpathy设计了5个有趣的prompt来评估非推理能力,并让GPT-4和GPT-4.5分别作答。用户在不知情的情况下进行投票比较。
结果显示: - 问题一:GPT-4胜出(32.8% vs 25.2%) - 问题二:GPT-4胜出(30.4% vs 23.1%) - 问题三:GPT-4胜出(14% vs 26.1%) - 问题四:GPT-4胜出(16.1% vs 29.5%) - 问题五:GPT-4胜出(29.2% vs 16.1%)
最终,GPT-4.5在情商任务上表现不如GPT-4。
原文链接
本文链接:https://kx.umi6.com/article/14566.html
转载请注明文章出处
相关推荐
换一换
挑战谷歌,OpenAI 搜索引擎 SearchGPT 登场:基于 GPT-4 系列 AI 模型,初期仅邀请 1 万人测试
2024-07-26 07:30:58
OpenAI推出GPT4.5研究预览版:迄今最大的模型
2025-02-28 07:57:50
GPT-4被证实具有「人类心智」登Nature!AI比人类更好察觉讽刺和暗示
2024-05-27 18:08:59
GPT-4.5深陷争议
2025-02-28 17:19:36
OpenAI计划在未来几周内发布GPT-4.5模型 未来将推出整合多项技术的GPT-5
2025-02-13 05:48:34
加州大学研究:AI 模型 GPT - 4.5 和 Llama 3.1 - 405B 可通过标准图灵测试
2025-04-02 16:33:23
GPT-4即将“退役”
2025-04-15 11:26:27
成功率达 53%,研究显示 GPT-4 可自主利用“零日”漏洞攻破网站
2024-06-09 14:05:27
OpenAI公开破解GPT-4思维的新方法,Ilya也参与了!
2024-06-07 20:15:45
GPT-4欺骗人类高达99.16%惊人率,PNAS重磅研究曝出,LLM推理越强欺骗值越高
2024-06-11 08:39:03
大决战!OpenAI可能发布GPT-4.5,狙击马斯克Gork3
2025-02-19 10:44:30
曝GPT-4.5本周空降!1T激活参数,120T训练数据,会吐出阶段性思考成果然后继续思考
2025-02-27 10:11:51
奥特曼剧透大动作:GPT-4.5马上发布,GPT-5免费畅聊
2025-02-13 11:57:00
702 文章
837357 浏览
24小时热文
更多
-
2026-09-06 21:14:00 -
2026-09-06 20:12:34 -
2026-09-06 20:10:47