【通用模型竟比医疗专用模型更懂医疗?】近日,纽约大学阿布扎比分校等团队在ACL 2026 Findings发表论文,发布首个中、英、阿拉伯语多语言医疗错误评测基准MedErrBench。研究揭示两大反直觉发现:一是医疗专用模型在错误检测与纠正上表现竟不如通用大模型,其中Doubao、DeepSeek等国产模型在三语数据集上普遍超越GPT-4o和Gemini;二是英文原生模型在中文原生数据集上的表现优于英文翻译数据集,凸显原生数据质量的价值。研究指出,领域知识并非唯一决定因素,推理与上下文理解更为关键。医疗AI现阶段应务实做好辅助医生纠错的“安全网”角色。
原文链接
本文链接:https://kx.umi6.com/article/37586.html
转载请注明文章出处
相关推荐
换一换
爸妈的 AI 健康小棉袄来了!像医生能追问、读报告、还能识药看皮肤
2025-06-26 15:25:29
毕马威:医疗大模型中国发布数量占全球七成
2025-07-03 13:24:48
让OpenAI只领先5天,百川发布推理新模型,掀翻医疗垂域开源天花板
2025-08-11 23:09:21
全国首款 上海研发的医疗大模型产品进入国家创新医疗器械特别审查通道
2026-05-07 19:36:56
科学岛团队提出医疗大模型智能体决策框架FRAME
2025-08-18 17:54:22
DeepSeek爆火后 大模型加速落地医疗!华为已入局
2025-02-20 10:12:36
阿里斩获国际AI顶会最佳资源论文奖,提出Agent评测新范式
2026-07-08 16:19:01
中国信通院发布AI Infra运维领域首个评测基准
2026-06-30 16:28:03
讯飞星火医疗大模型能力跃升,“更懂你健康的AI”系列产品发布
2025-11-07 23:11:18
医疗大模型,集体下沉
2025-04-21 15:43:38
云知声:近期与江苏省医保局等达成深度合作 总金额超2000万元
2026-01-05 06:49:12
京东健康发布医疗大模型产品体系“AI 京医”,可辅助医生完成病史收集、病历书写等工作
2025-01-11 21:41:51
医疗界迎来重磅大模型,还有10多个场景的智能体!
2025-04-11 10:37:36
849 文章
1085183 浏览
24小时热文
更多
-
2026-10-09 12:58:44 -
2026-10-09 12:56:14 -
2026-10-09 12:54:47