1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

标题:1万tokens成大模型长文本“智商”分水岭

正文:
当上下文长度扩展至1万tokens,主流大模型的性能集体“失智”,且下降并非均匀,而是在某些节点出现断崖式下跌。例如,Claude Sonnet 4在1000tokens后准确率从90%降至60%,而GPT-4.1和Gemini 2.5 Flash则表现为下降后放缓再下降。最终,所有模型在1万tokens时准确率仅剩50%。这意味着,大模型处理长文本时的可靠性会因输入长度增加而显著下降,且不同模型的“失智”节点各异。

这是Chroma团队通过升级版“大海捞针”(NIAH)测试得出的结论。他们评估了包括GPT-4.1、Claude 4、Gemini 2.5和Qwen3等18个主流大模型,发现随着输入长度增加,模型性能普遍下降。研究还首次揭示,这种下降受语义特征、干扰信息及文本结构等因素影响,且不同模型对这些因素的敏感度存在差异。

实验设计了四项对照任务,核心原则是保持任务复杂度不变,仅调整输入长度。结果显示:
1. 输入长度是性能下降的核心变量,无论任务简单与否,长文本处理能力均受影响;
2. 针-问题语义相似度低或干扰信息多会加剧性能衰减;
3. 连贯文本比打乱结构更易导致性能下降;
4. 不同模型表现差异明显,但整体稳定性均较差。

例如,在针-问题相似度实验中,低相似度组在1万tokens时准确率仅为40%-60%,远低于高相似度组的60%-80%。干扰信息实验显示,加入多个干扰项后,模型准确率比基线低30%-50%。此外,连贯文本结构使部分模型准确率降至30%-40%,而打乱结构则维持在50%-60%。

尽管大模型的上下文窗口不断扩展,但其性能并非均匀一致。研究建议用户通过明确指令、保存上下文等方式缓解长文本处理中的缺陷。

Chroma团队专注于开发开源AI应用数据库,旨在简化LLM应用构建,并计划推出免费技术预览。代码已开源,感兴趣者可复现研究结果。

— 完 —

原文链接
本文链接:https://kx.umi6.com/article/21920.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
上海制造,AI入魂:央国企率先“重用”大模型,自动化设备被换下
2026-07-17 18:46:05
刚刚,智谱港交所敲钟!市值528亿港元
2026-01-08 11:04:01
备案平均时长缩至2个月 目前已有216款大模型在京完成备案
2026-02-28 19:46:01
美国公司又吹牛!首例AI自主勒索攻击被拆穿:人类幕后操盘、AI只配敲键盘
2026-07-07 17:39:23
15元买数百万Token:一句你好烧掉5万
2026-06-18 01:04:32
豆包大模型2.0正式发布
2026-02-14 14:23:01
宇树科技王兴兴:谁能把机器人用的大模型做出来 谁就是全世界最厉害的AI公司和机器人公司
2026-01-30 12:25:48
大模型也得「睡觉」了:Google 的这篇论文,戳中了AI 的最大软肋
2026-07-23 12:47:10
微博CEO吐槽Manus能力拉跨:后悔买大模型年费包
2026-08-29 00:36:54
Harness 神器 J-Space 造假案背后,思维链作者暴论,小模型 + 工具干不掉顶级大模型
2026-08-20 12:26:39
智谱AI今日正式上市,一文讲透你想知道的6件事
2026-01-09 21:35:10
消息称腾讯大模型团队架构调整:前 OpenAI 研究员姚顺雨任要职,校招最高 2 倍薪资挖 AI 人才
2025-12-17 17:57:42
还在为大模型洗数据熬夜?蚂蚁拿下VLDB工业最佳论文,一套宽表搞定35PB语料,效率狂飙5.6倍
2026-09-02 15:35:06
24小时热文
更多
扫一扫体验小程序