标题:OpenAI的“看图思考”,被玩坏了……
知道大模型开始卷视觉推理了,但没想到这么卷——连数学试卷都快不够用了。
推理分逻辑和演绎两类,GPT-o3更新后两者都有涉及。视觉推理不新鲜,各家都在做,关键是从图片中识别并理解元素,进而应用于交互和任务解决。
Gemini 2.5曾表现出色,但o3刚发布时认不出武康大楼,下午才恢复正常。它能识别验证码,实用性较强,但在传统搜索引擎面前,这类简单任务意义不大。
测试中,o3尝试了国家公务员考试图形推理题,耗时超六分钟,思维链长达5千字,结合代码辅助,可惜答错了。这种归纳推理可用于AI检测AI生成的图像。
o3还能解迷宫,但推理时间长且效果一般,最后生成的路径无法点击。它通过调用外部工具解决问题,但准确率和响应速度有待提高。
演绎推理更令人兴奋,团队设计了“看工位猜MBTI”的挑战。o3通过分析桌面细节,判断同事的性格倾向,虽有趣但有时不如本人了解自己。
总体而言,o3的图片推理能力潜力巨大,但娱乐性强于实用性,切勿用于严肃场合。
原文链接
本文链接:https://kx.umi6.com/article/17410.html
转载请注明文章出处
相关推荐
换一换
梁文锋突袭马斯克!DeepSeek V4 Pro对战Grok 4.6,首测夯爆了
2026-08-13 10:09:23
GPT-5.6突然发布!Fable5痛失最强基模王座
2026-06-27 10:51:01
美国封杀对华AI芯片适得其反 老外担心2种最坏情况即将出现
2026-08-29 19:13:22
独家解读|OpenAI 为什么要冒死“脱离群众”?
2026-06-29 14:34:03
大模型的尽头 怎么是费大厨辣椒炒肉?
2026-05-24 15:42:37
Kimi上去了 Anthropic换锚了?
2026-08-03 16:09:46
微博CEO吐槽Manus能力拉跨:后悔买大模型年费包
2026-08-29 00:36:54
终于用上AI的公司 发现业务被大模型公司抢了
2026-07-19 14:15:02
美国公司又吹牛!首例AI自主勒索攻击被拆穿:人类幕后操盘、AI只配敲键盘
2026-07-07 17:39:23
OpenAI回应TanStack供应链攻击:未发现用户数据泄露
2026-05-14 14:41:58
他亲手造出o1和o3,却突然宣布:人类可以永远退休了!
2026-08-28 11:00:36
至知研究院提出大模型可解释性新路线:拆权重,数据成本不到1%
2026-08-15 15:15:17
微软AI营收首度揭密:严重依赖OpenAI 营收占比或达70%
2026-08-06 09:24:31
832 文章
1045906 浏览
24小时热文
更多
-
2026-09-06 21:14:00 -
2026-09-06 20:12:34 -
2026-09-06 20:10:47