综合
7*24 快讯
AI科普
合作
全部
英雄令
项目方
开发者
产品方
投资者
8月7日,Anthropic大神卡帕西提出大模型评测新基准,用《指环王》文本让模型生成3D世界,接替“鹈鹕骑自行车”测试。卡帕西将小说开头输入Opus 5,模型耗时2小时、消耗100万token及5500行代码,用Three.js搭建出可运行的“中土世界”3D场景。网友纷纷效仿,用AI生成旧金山、纽约甚至虚拟演唱会。新基准深度考察了模型的空间理解与复杂代码生成能力,同时也暴露出大模型能搭建场景却无法真正“看懂”和体验生成内容的短板。这为评估大模型推理能力向三维世界延伸提供了新视角。
原文链接
标题:AI帮我读论文,哪家强?
正文:
这一年,AI改变了行业生态,尤其在内容创作领域。12月初,各大模型相继推出“数学版”,随后的测评中,数学和物理能力成为基准测试的“必考题”。
然而,在人文社科领域,AI的应用效果参差不齐。新闻人用AI写新闻,担心假新闻;人文人用AI写论文,仍需自己动笔。
今天...
原文链接
标题:Anthropic提出正确的大模型评测方法
人工智能大模型的客观评测有助于行业发展,但目前的基准测试存在诸多问题。评测结果的差异可能源于模型真实能力的不同,也可能只是因为特定问题的选择。评测本质上是实验,但现有研究忽视了其他科学领域的实验分析方法。
Anthropic在最新博客中借鉴统计理论,...
原文链接
近日,贾佳亚团队与多所高校合作推出新基准测试法MR-Ben,让大模型从“答题者”变为“阅卷老师”,专注于检测模型的错误识别能力而非单纯做题。该方法利用GSM8K、MMLU等已有题目,评估模型对复杂问题推理的理解,而非仅依赖选择题或填空题。评测结果显示,GPT4-Turbo在MR-Ben测试中表现出色,但得分仍低于50分,显示出模型仍有提升空间。此外,研究发现小模型在低资源场景下也能超越部分大模型,且生成-反思策略对部分模型效果不明显。MR-Ben现已开源,开发者可自行评测模型并查看排行榜。更多详情请访问相关学术论文和GitHub仓库。
原文链接
加载更多
暂无内容