1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议
综合
7*24 快讯
AI科普
合作
全部
英雄令
项目方
开发者
产品方
投资者
Show me《指环王》!卡帕西强推大模型评测新基准
8月7日,Anthropic大神卡帕西提出大模型评测新基准,用《指环王》文本让模型生成3D世界,接替“鹈鹕骑自行车”测试。卡帕西将小说开头输入Opus 5,模型耗时2小时、消耗100万token及5500行代码,用Three.js搭建出可运行的“中土世界”3D场景。网友纷纷效仿,用AI生成旧金山、纽约甚至虚拟演唱会。新基准深度考察了模型的空间理解与复杂代码生成能力,同时也暴露出大模型能搭建场景却无法真正“看懂”和体验生成内容的短板。这为评估大模型推理能力向三维世界延伸提供了新视角。
月光编码师
08-07 10:13:44
分享至
打开微信扫一扫
内容投诉
生成图片
AI帮我读论文,哪家强?
标题:AI帮我读论文,哪家强? 正文: 这一年,AI改变了行业生态,尤其在内容创作领域。12月初,各大模型相继推出“数学版”,随后的测评中,数学和物理能力成为基准测试的“必考题”。 然而,在人文社科领域,AI的应用效果参差不齐。新闻人用AI写新闻,担心假新闻;人文人用AI写论文,仍需自己动笔。 今天...
DreamCoder
01-03 15:50:44
分享至
打开微信扫一扫
内容投诉
生成图片
OpenAI最强竞对Anthropic:正确的大模型评测应该是怎样的?
标题:Anthropic提出正确的大模型评测方法 人工智能大模型的客观评测有助于行业发展,但目前的基准测试存在诸多问题。评测结果的差异可能源于模型真实能力的不同,也可能只是因为特定问题的选择。评测本质上是实验,但现有研究忽视了其他科学领域的实验分析方法。 Anthropic在最新博客中借鉴统计理论,...
AI创想团
11-20 16:13:21
分享至
打开微信扫一扫
内容投诉
生成图片
专治大模型“刷题”,贾佳亚团队新基准让模型只挑错不做题,GPT-4得分不到50
近日,贾佳亚团队与多所高校合作推出新基准测试法MR-Ben,让大模型从“答题者”变为“阅卷老师”,专注于检测模型的错误识别能力而非单纯做题。该方法利用GSM8K、MMLU等已有题目,评估模型对复杂问题推理的理解,而非仅依赖选择题或填空题。评测结果显示,GPT4-Turbo在MR-Ben测试中表现出色,但得分仍低于50分,显示出模型仍有提升空间。此外,研究发现小模型在低资源场景下也能超越部分大模型,且生成-反思策略对部分模型效果不明显。MR-Ben现已开源,开发者可自行评测模型并查看排行榜。更多详情请访问相关学术论文和GitHub仓库。
阿达旻
07-18 17:06:23
分享至
打开微信扫一扫
内容投诉
生成图片
加载更多
暂无内容
AI热搜
更多
扫一扫体验小程序