1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

标题:AI连电路图都看不懂?SeePhys新基准暴击多模态短板,正确率仅55%

当前顶尖AI模型能否真正“看懂”物理图像?全新基准SeePhys给出了答案,结果显示顶级模型准确率不足55%。

SeePhys由中山大学、苏黎世联邦理工学院、华为诺亚方舟实验室和香港大学联合推出,涵盖从初中到博士资格考试的全谱系多模态物理问题。该基准强调图形感知在理解物理世界中的重要性,并已正式开源。

实验评估了LLM/MLLM在复杂科学图表与理论推导耦合任务中的表现。即使是最先进的Gemini-2.5-Pro和o4-mini模型,准确率也未达55%,揭示了多模态推理的重大挑战。

SeePhys的独特之处在于其广泛的知识层级覆盖和对视觉信息的深度依赖。它包含2000道题目和2245张图表,涉及经典力学、电磁学等多个领域,分为初中到博士资格考试八个知识层级,以及21类异构图表。

实验发现显示,最佳模型Gemini-2.5-Pro准确率为54.9%,初中物理题正确率低于70%。纯语言模型的表现接近多模态模型,视觉依赖性高的问题正确率明显低于依赖性低的问题。此外,模型对特定图表类型的识别存在障碍,如波动方程图和电路图。

适当视觉提示有助于模型理解问题本质,但知识注入的效果已显现边际效应。研究还归纳出九种常见的错误推理模式,包括视觉误读、过度简化等。

参赛链接:https://www.codabench.org/competitions/7925/ 挑战赛详细信息:https://sites.google.com/view/ai4mathworkshopicml2025/challenge ICML workshop主页:https://sites.google.com/view/ai4mathworkshopicml2025/home 论文:https://arxiv.org/pdf/2505.19099 项目主页:https://github.com/SeePhys/seephys-project

原文链接
本文链接:https://kx.umi6.com/article/19451.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
马斯克力挺 AMD:在中小型 AI 模型方面相当不错,暗示将降低对英伟达依赖
2025-09-13 16:27:30
谷歌开源 MedGemma AI 模型,医疗图像与文本分析神器
2025-05-21 15:09:11
六大AI模型被扔进加密市场厮杀,DeepSeek暂为交易之王
2025-10-20 18:12:39
谷歌 Gemini 3.0 Pro 旗舰 AI 模型内测流出:编程实力亮眼,下周上线
2025-10-03 15:41:08
马斯克发布Grok 4,年费飚到2万+
2025-07-10 19:26:08
从GPT-5到DeepSeek V3.1,顶尖AI大模型的新方向出现了!
2025-09-01 16:20:02
没网也能用!谷歌发布离线机器人AI模型:具备视觉识别、语言理解能力
2025-06-26 17:02:10
华为AI模型运行专利公布
2025-09-05 15:25:04
OpenAI 3万亿美元测试,AI首战44个行业人类专家!
2025-09-27 15:43:00
骁龙X2 Elite NPU算力达80 TOPS 遥遥领先AMD/Intel!为何如此之高
2025-10-19 17:51:16
新研究:人类读指针式时钟准确率达 89.1%,顶尖 AI 仅 13.3%
2025-09-14 16:42:29
谷歌前 CEO 施密特示警:AI 模型极容易被黑客利用
2025-10-11 09:58:07
人类VS AI:波兰程序员10小时编程马拉松中击败OpenAI!
2025-07-20 19:08:20
24小时热文
更多
扫一扫体验小程序