11月9日,研究人员测试谷歌AI模型Veo-3生成手术视频的能力,发现其虽能生成逼真画面,但缺乏医学逻辑理解。研究使用SurgVeo基准评测,涵盖50段真实手术视频,由4名外科医生评分。结果显示,Veo-3在腹腔手术中视觉合理性初评3.72分,但器械操作和手术逻辑性分别仅1.78分和1.61分;神经外科表现更差,手术逻辑性评分低至1.13分。超93%错误源于医学逻辑问题,如虚构器械或违反生理规律。提供更多上下文未显著改善结果,表明模型缺乏医学推理能力。团队计划开源SurgVeo数据集以推动改进,并警示此类AI用于医学培训可能误导医学生或手术机器人,强调现有系统远未达到安全应用标准。
原文链接
本文链接:https://kx.umi6.com/article/28056.html
转载请注明文章出处
相关推荐
换一换
搅动推理 AI 模型风云:谷歌被曝 1 月 23 日发布增强版 Gemini 2.0 Flash Thinking
2025-01-21 11:36:22
AI秒破18世纪「天书」账本!谷歌新模型盲测刷屏全网
2025-11-13 19:14:35
机器人为啥困在Demo?讯飞新公司爻方智能给出答案:缺一味「本体认知」
2026-07-23 16:53:44
成本直降 90%!原来 Kimi K3 叠 Claude Code 还能这么玩
2026-07-23 12:51:59
超越π0,中国团队用1B参数模型登顶具身智能榜单
2026-07-23 14:49:03
国家具身智能应用中试基地发布首个合作世界模型 魔芯科技MoWorld 3D正式亮相
2026-07-20 17:22:05
美国开源AI实验室Arcee表示:中国模型没有危险性 但会威胁美国闭源模型的利润空间
2026-07-23 15:52:51
WAIC重磅成果|上海仪电智算牵头成立“智算系统架构联盟”并发布《超节点系统架构规范》
2026-07-21 18:21:18
业内首款超算+智算的大规模计算底座,在WAIC上我们找到了
2026-07-22 15:01:30
WAIC重磅成果|智爱赛思全面升级并发布科研专属Token Plan
2026-07-21 18:17:58
2026世界人工智能大会“未来计算·未来算力”专题论坛在沪召开,共识凝聚五问
2026-07-19 19:28:01
上海这场大赛有点“野”:让AI自主科研、控核聚变、认甲骨文
2026-07-23 09:36:06
GMI Cloud 携AI Cloud、MaaS、Agentbox等全栈智算解决方案亮相 WAIC 2026
2026-07-20 13:16:16
753 文章
837273 浏览
24小时热文
更多
-
2026-07-24 12:36:48 -
2026-07-24 11:35:13 -
2026-07-24 10:33:39