中文数据在AI大模型发展中遭遇困境,被视为"互联网孤岛"。由于数据分散、质量低和短缺,中国AI大模型依赖英文开源语料,中文语料尤其是高质量数据匮乏,导致模型思维西式化。国家数据局报告显示,尽管中国数据总量庞大,但仍面临有效供给不足和价值释放难题。为破局,国家和企业正在推动数据共享计划,如开源数据集、共建共享和“数算一体”模式,尝试解决数据孤岛问题。专家建议市场机制和数据联盟将是未来趋势,以促进数据的高效利用和价值发挥。
原文链接
本文链接:https://kx.umi6.com/article/3408.html
转载请注明文章出处
相关推荐
换一换
媒体再爆:OpenAI的GPT-5训练遇阻
2024-12-23 10:54:43
OpenAI在内,所有大模型都撞到了同一堵墙
2024-11-11 20:44:10
国家数据局:国内多数AI模型训练使用的中文数据占比已超60%
2025-08-21 15:37:53
我国多数模型使用的中文数据占比超 60%,部分已达 80%
2025-08-14 11:52:44
拆解 Claude 5.1:38 小时不睡觉的背后,Anthropic 正在终结「模型论」
2026-09-03 17:33:12
「说 Harness 会被淘汰的,肯定没做过工程」,Kimi 前 CLI 负责人戳破了 AI 圈最大的误解
2026-08-31 16:51:39
Claude最强Fable 5.1发布!8项屠榜,最高降价45%,反蒸馏机制上线
2026-09-02 11:24:33
OpenAI买几万台Mac搞强化训练!英伟达的活被苹果抢了
2026-08-31 11:38:31
今年最难的机器人Demo,“机器人含量”为0
2026-09-03 10:15:24
AI本地部署不如官方版的元凶找到了:734个依赖包,每一个都可能坑
2026-08-29 22:20:53
自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning
2026-09-01 13:36:24
人类 越来越难理解AI
2026-08-31 16:50:05
A社化身A割!Claude官宣永久提额25%,结果到手反而少17%
2026-09-01 16:44:57
752 文章
940140 浏览
24小时热文
更多
-
2026-09-06 21:14:00 -
2026-09-06 20:12:34 -
2026-09-06 20:10:47