标题:大模型法律推理优势难复制!LEXam评测集引领新标准
大模型推理能力备受关注,但在法律等实际应用领域仍有局限。近日,苏黎世联邦理工学院等机构发布全新法律推理基准数据集LEXam,涵盖瑞士、欧洲及国际法,包含4886道题目,覆盖本科至硕士水平的法律考试。该数据集在Hugging Face趋势榜排名第一,下载量超1700次。
LEXam不仅提供标准答案,还详细记录推理路径,包括问题识别、规则回忆及适用等步骤。这种设计帮助评估LLM在复杂推理中的缺陷,而非仅关注最终正确性。团队引入“LLM-as-a-Judge”模式,通过模型评估自身推理步骤质量,结果显示与专家评分高度一致,为自动化评估提供了高效路径。
测试显示,专精推理优化模型表现最佳,Gemini-2.5-Pro以82.2分领先。GPT-4系列虽表现优异,但仍落后于专精模型。此外,模型在英文任务上优于德语,跨学科法律领域表现更优,国际法题目得分高于地区法律。多选题测试表明,模型在选项增多时准确率显著下降,凸显其依赖浅层特征的局限性。
LEXam为法律推理评估提供了透明、可靠的工具,推动相关研究发展。项目主页和论文已公开供参考。
原文链接
本文链接:https://kx.umi6.com/article/19779.html
转载请注明文章出处
相关推荐
换一换
独家专访|苏炜杰加入OpenAI:Scaling Law撞墙后为什么需要数学家出手?
2026-06-29 15:36:01
Karpathy 最新发文:别把 AI 当人看,它没欲望也不怕死
2025-11-22 19:29:36
智谱AI,排名「第二」
2025-12-21 12:41:26
大模型的尽头 怎么是费大厨辣椒炒肉?
2026-05-24 15:42:37
小红书大模型IMO满分夺金,第三题解法让冠军选手直呼优雅
2026-07-22 08:44:40
腾讯AI下了一场「及时雨」
2025-12-19 10:42:16
火线解析智谱AI招股书:年营收3亿增速130%,率先冲刺全球大模型第一股
2025-12-19 23:14:23
AGI今天起有了量化标准!Bengio牵头定义,当前进度条58%
2025-10-17 14:17:43
不整虚的!中美AI同步加速:47天30次更新,中国AI的最强主场究竟在哪?
2026-02-22 18:50:22
长三角一体化大模型发布 AI将为区域发展提供决策支撑
2026-01-12 09:40:07
中国企业调用大模型日均达37万亿tokens
2026-02-24 13:54:18
Manus救不了Meta
2026-01-08 20:35:12
刚刚,智谱港交所敲钟!市值528亿港元
2026-01-08 11:04:01
694 文章
726208 浏览
24小时热文
更多
-
2026-07-24 00:15:46 -
2026-07-24 00:14:08 -
2026-07-24 00:12:30