2024年12月19日,智源研究院发布了国内外100多个开源和商业闭源的大模型评测结果,涵盖语言、视觉语言、文生图、文生视频、语音语言等多种模态。评测显示,2024年下半年大模型发展更注重综合能力提升与实际应用。语言模型方面,字节跳动的Doubao-pro-32k-preview和百度的ERNIE 4.0 Turbo表现最佳,分别排名第一和第二。
文生视频模型中,国产模型领先全球。视觉语言模型虽开源架构趋同,但表现各异,部分开源模型在图文理解任务上接近头部闭源模型,但仍需提升长尾视觉知识与文字识别能力。
文生图模型中,腾讯Hunyuan Image排名首位,字节跳动Doubao image v2.1和Ideogram 2.0紧随其后。语音语言模型中,阿里巴巴Qwen2-Audio表现最优,香港中文大学&微软WavLLM和清华大学&字节跳动Salmon位列二三。
此外,智源研究院推出FlagEval大模型角斗场和FlagEval Debate,前者支持语言问答、多模态图文理解等自定义评测,后者评估模型的逻辑推理、观点理解和语言表达能力。评测发现,大模型在金融量化交易领域展现了一定潜力,但仍需提高实际代码生成能力。
原文链接
本文链接:https://kx.umi6.com/article/10457.html
转载请注明文章出处
相关推荐
换一换
我国大模型密集落地 新技术加速普惠应用
2026-02-14 12:17:30
语境才是真正的护城河
2026-01-17 16:34:25
大模型也得「睡觉」了:Google 的这篇论文,戳中了AI 的最大软肋
2026-07-23 12:47:10
突破人类控制!美国AI开始攻击真人了
2026-08-08 14:13:14
潞晨尤洋:日常办公没必要上私有模型,这三类企业才需要 | MEET2026
2025-12-22 10:34:39
月之暗面 Kimi 创始人杨植麟:中国技术不仅要好用还要参与制定规则,未来大模型要推出到 K100
2026-01-12 09:22:11
美国封杀对华AI芯片适得其反 老外担心2种最坏情况即将出现
2026-08-29 19:13:22
Kimi即将推出新一代万亿大模型:开源王者刷新 去年已超GPT5
2026-01-20 22:33:50
终于用上AI的公司 发现业务被大模型公司抢了
2026-07-19 14:15:02
大模型年终观察,如何定义2025年的「好模型」?
2025-12-22 21:00:44
阿里千问大模型换将,32岁林俊旸官宣告别
2026-03-04 10:27:38
郑州:在医疗、教育、物流、防灾减灾等领域打造一批大模型典型示范 形成“AI+千行百业”全场景体系
2026-05-09 20:36:41
刚刚,港股AGI第一股杀疯了!Agent业务半年进账近5亿,Token收入Q2暴涨500%
2026-08-28 18:21:32
784 文章
964576 浏览
24小时热文
更多
-
2026-09-06 21:14:00 -
2026-09-06 20:12:34 -
2026-09-06 20:10:47