2024年12月19日,智源研究院发布了国内外100多个开源和商业闭源的大模型评测结果,涵盖语言、视觉语言、文生图、文生视频、语音语言等多种模态。评测显示,2024年下半年大模型发展更注重综合能力提升与实际应用。语言模型方面,字节跳动的Doubao-pro-32k-preview和百度的ERNIE 4.0 Turbo表现最佳,分别排名第一和第二。
文生视频模型中,国产模型领先全球。视觉语言模型虽开源架构趋同,但表现各异,部分开源模型在图文理解任务上接近头部闭源模型,但仍需提升长尾视觉知识与文字识别能力。
文生图模型中,腾讯Hunyuan Image排名首位,字节跳动Doubao image v2.1和Ideogram 2.0紧随其后。语音语言模型中,阿里巴巴Qwen2-Audio表现最优,香港中文大学&微软WavLLM和清华大学&字节跳动Salmon位列二三。
此外,智源研究院推出FlagEval大模型角斗场和FlagEval Debate,前者支持语言问答、多模态图文理解等自定义评测,后者评估模型的逻辑推理、观点理解和语言表达能力。评测发现,大模型在金融量化交易领域展现了一定潜力,但仍需提高实际代码生成能力。
原文链接
本文链接:https://kx.umi6.com/article/10457.html
转载请注明文章出处
相关推荐
换一换
大厂AI新战场:AQ狂飙,蚂蚁押注大健康赛道
2025-11-09 16:34:57
全球开发者狂喜!Codex移除5小时限制,Fable 5订阅再延7天,有人烧token烧到住院
2026-07-13 13:10:48
美团 LongCat 大模型官方 App 发布:支持联网搜索,还可以发起语音通话
2025-11-03 14:22:48
消息称小米研发智能问答助手产品“Mi Chat”
2025-12-09 17:51:08
阶跃星辰杀入季后赛,强势跻身AI“新六小虎”第一梯队
2026-02-27 15:48:37
美图吴欣鸿回应大模型竞争:美图应用数据仍在快速增长
2026-02-05 18:05:31
ToC智能体火得快,但更大的价值在企业丨中关村科金@MEET2026
2025-12-12 14:53:17
我国大模型密集落地 新技术加速普惠应用
2026-02-14 12:17:30
清华孙茂松:对工业界而言,大厂可以Scaling,其他玩家重在垂直应用 | MEET2026
2025-12-21 10:35:20
2025最大赌注:为什么所有厂商都押宝AI手机?
2025-12-25 09:25:38
大模型的尽头 怎么是费大厨辣椒炒肉?
2026-05-24 15:42:37
马年4大顶流模型会师阿里云Coding Plan开工!Token量大管饱,自由切换真香
2026-02-26 00:01:12
智谱中标679.8万元水电大模型项目
2025-11-05 20:23:03
765 文章
823563 浏览
24小时热文
更多
-
2026-07-24 00:15:46 -
2026-07-24 00:14:08 -
2026-07-24 00:12:30