综合
7*24 快讯
AI科普
合作
全部
英雄令
项目方
开发者
产品方
投资者
【通用模型竟比医疗专用模型更懂医疗?】近日,纽约大学阿布扎比分校等团队在ACL 2026 Findings发表论文,发布首个中、英、阿拉伯语多语言医疗错误评测基准MedErrBench。研究揭示两大反直觉发现:一是医疗专用模型在错误检测与纠正上表现竟不如通用大模型,其中Doubao、DeepSeek等国产模型在三语数据集上普遍超越GPT-4o和Gemini;二是英文原生模型在中文原生数据集上的表现优于英文翻译数据集,凸显原生数据质量的价值。研究指出,领域知识并非唯一决定因素,推理与上下文理解更为关键。医疗AI现阶段应务实做好辅助医生纠错的“安全网”角色。
原文链接
加载更多
暂无内容