上海交通大学王德泉教授课题组最新研究揭示了多模态大模型在处理自相矛盾指令时的局限性。他们提出了"自相矛盾指令集"(SCI)基准测试,旨在评估模型检测冲突指令的能力。研究中,团队设计了包含2万个冲突指令的多模态基准测试,覆盖语言-语言和视觉-语言两种范式。通过构建框架AutoCreate,他们高效地生成了包含多模态冲突的任务。
实验结果显示,当前多模态大模型在处理自相矛盾指令时表现不佳,主要原因是缺乏对指令合理性的评估能力,即认知能力不足。为解决这一问题,研究团队提出了"认知觉醒提示"(CAP)方法。CAP通过在输入中加入简单的提示,为模型提供外部认知能力支持,显著提高了其矛盾检测能力,且几乎未对模型性能产生负面影响。
这一发现强调了多模态大模型在自我意识和认知能力方面的需求,以更好地处理复杂的指令冲突。研究团队表示,当前模型在面对自相矛盾的指令时存在不足,这需要更多的自我意识和认知能力。通过CAP方法,模型能够在一定程度上弥补这一缺陷。
论文的第一作者为上海交通大学博士研究生郜今,通讯作者为王德泉教授,他是上海交通大学长聘教轨助理教授、博士生导师。王教授的研究成果在国际顶级会议发表,拥有较高的学术影响力。
原文链接
本文链接:https://kx.umi6.com/article/5108.html
转载请注明文章出处
相关推荐
换一换
上海已发布超150款备案大模型
2026-03-28 20:16:44
花几百万买的H100在「摸鱼」?英伟达:别怪显卡,是你的模型「长得丑」
2026-07-23 18:00:12
花3000元让AI改口,大模型的尽头是广告?
2026-01-06 19:29:29
大模型的尽头 怎么是费大厨辣椒炒肉?
2026-05-24 15:42:37
月之暗面近20天收入超去年全年
2026-02-23 19:11:04
Kimi即将推出新一代万亿大模型:开源王者刷新 去年已超GPT5
2026-01-20 22:33:50
独家专访|苏炜杰加入OpenAI:Scaling Law撞墙后为什么需要数学家出手?
2026-06-29 15:36:01
潞晨尤洋:日常办公没必要上私有模型,这三类企业才需要 | MEET2026
2025-12-22 10:34:39
建议你不要再相信AI基准测试,排行榜已经没啥公信力了
2025-12-04 12:18:33
开源 AI 模型 TOP5,被中国厂商包圆
2025-10-15 18:39:57
备案平均时长缩至2个月 目前已有216款大模型在京完成备案
2026-02-28 19:46:01
顶尖技术+标准产品+创新模式+可靠服务,打造大模型商业落地中国范式
2025-12-16 10:32:22
杭州“十五五”规划建议:实施大模型前沿技术攻关和高端芯片、基础软件、模型算法等研发计划 建设人工智能开源社区
2026-01-16 11:34:57
776 文章
888799 浏览
24小时热文
更多
-
2026-07-24 13:47:18 -
2026-07-24 13:45:42 -
2026-07-24 13:44:02