标题:大模型法律推理优势难复制!LEXam评测集引领新标准
大模型推理能力备受关注,但在法律等实际应用领域仍有局限。近日,苏黎世联邦理工学院等机构发布全新法律推理基准数据集LEXam,涵盖瑞士、欧洲及国际法,包含4886道题目,覆盖本科至硕士水平的法律考试。该数据集在Hugging Face趋势榜排名第一,下载量超1700次。
LEXam不仅提供标准答案,还详细记录推理路径,包括问题识别、规则回忆及适用等步骤。这种设计帮助评估LLM在复杂推理中的缺陷,而非仅关注最终正确性。团队引入“LLM-as-a-Judge”模式,通过模型评估自身推理步骤质量,结果显示与专家评分高度一致,为自动化评估提供了高效路径。
测试显示,专精推理优化模型表现最佳,Gemini-2.5-Pro以82.2分领先。GPT-4系列虽表现优异,但仍落后于专精模型。此外,模型在英文任务上优于德语,跨学科法律领域表现更优,国际法题目得分高于地区法律。多选题测试表明,模型在选项增多时准确率显著下降,凸显其依赖浅层特征的局限性。
LEXam为法律推理评估提供了透明、可靠的工具,推动相关研究发展。项目主页和论文已公开供参考。
原文链接
本文链接:https://kx.umi6.com/article/19779.html
转载请注明文章出处
相关推荐
换一换
马年4大顶流模型会师阿里云Coding Plan开工!Token量大管饱,自由切换真香
2026-02-26 00:01:12
花几百万买的H100在「摸鱼」?英伟达:别怪显卡,是你的模型「长得丑」
2026-07-23 18:00:12
赛博朋克修车!网友用笔记本跑大模型查故障:不如200元买OBD
2026-09-02 19:47:51
上海已发布超150款备案大模型
2026-03-28 20:16:44
月之暗面近20天收入超去年全年
2026-02-23 19:11:04
持续霸榜!阿里千问3.6Plus问鼎全球大模型调用周榜冠军
2026-04-07 12:52:26
AI最尴尬的短板,中国科学院出手了
2026-07-27 13:11:50
消息称腾讯大模型团队架构调整:前 OpenAI 研究员姚顺雨任要职,校招最高 2 倍薪资挖 AI 人才
2025-12-17 17:57:42
至知研究院提出大模型可解释性新路线:拆权重,数据成本不到1%
2026-08-15 15:15:17
全球大模型第一股要来了 智谱发布IPO招股书:代码能力并列全球第一
2025-12-19 23:17:39
独家|百度成立模型委员会(BMC) 加强人工智能技术优势
2026-05-15 10:39:37
美国封杀对华AI芯片适得其反 老外担心2种最坏情况即将出现
2026-08-29 19:13:22
鏖战2025年,大模型围着开源转
2025-12-25 18:55:44
702 文章
837589 浏览
24小时热文
更多
-
2026-09-06 21:14:00 -
2026-09-06 20:12:34 -
2026-09-06 20:10:47