标题:OpenAI的“看图思考”,被玩坏了……
知道大模型开始卷视觉推理了,但没想到这么卷——连数学试卷都快不够用了。
推理分逻辑和演绎两类,GPT-o3更新后两者都有涉及。视觉推理不新鲜,各家都在做,关键是从图片中识别并理解元素,进而应用于交互和任务解决。
Gemini 2.5曾表现出色,但o3刚发布时认不出武康大楼,下午才恢复正常。它能识别验证码,实用性较强,但在传统搜索引擎面前,这类简单任务意义不大。
测试中,o3尝试了国家公务员考试图形推理题,耗时超六分钟,思维链长达5千字,结合代码辅助,可惜答错了。这种归纳推理可用于AI检测AI生成的图像。
o3还能解迷宫,但推理时间长且效果一般,最后生成的路径无法点击。它通过调用外部工具解决问题,但准确率和响应速度有待提高。
演绎推理更令人兴奋,团队设计了“看工位猜MBTI”的挑战。o3通过分析桌面细节,判断同事的性格倾向,虽有趣但有时不如本人了解自己。
总体而言,o3的图片推理能力潜力巨大,但娱乐性强于实用性,切勿用于严肃场合。
原文链接
本文链接:https://kx.umi6.com/article/17410.html
转载请注明文章出处
相关推荐
换一换
报道称OpenAI未达销售目标 相关股票大跌
2026-04-28 18:33:59
独家|百度成立模型委员会(BMC) 加强人工智能技术优势
2026-05-15 10:39:37
大模型的尽头 怎么是费大厨辣椒炒肉?
2026-05-24 15:42:37
GPT-5.6首批实测来了!精准狙击Mythos
2026-06-10 15:15:36
GPT-5.6刚发布,OpenAI安全主管就跑路了??
2026-07-13 15:16:01
大模型也得「睡觉」了:Google 的这篇论文,戳中了AI 的最大软肋
2026-07-23 12:47:10
独家专访|苏炜杰加入OpenAI:Scaling Law撞墙后为什么需要数学家出手?
2026-06-29 15:36:01
马斯克起诉OpenAI OpenAI上市计划或遇重创
2026-04-28 17:29:04
OpenAI计划为ChatGPT广告定价新方案 探讨其他升级方案
2026-04-15 21:24:20
郭明錤:OpenAI进军手机 正与联发科、高通合作开发处理器
2026-04-27 12:10:29
马斯克称OpenAI是自己的创意 现任CEO奥尔特曼是“小偷”
2026-04-29 14:26:51
OpenAI首席财务官:公司或将筹集更多资金 未来可能考虑通过公开市场融资
2026-05-15 16:58:46
小红书大模型IMO满分夺金,第三题解法让冠军选手直呼优雅
2026-07-22 08:44:40
817 文章
894546 浏览
24小时热文
更多
-
2026-07-24 00:15:46 -
2026-07-24 00:14:08 -
2026-07-24 00:12:30