1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

智谱揭示“降智”原因:Scaling的隐痛与解决之道

量子位 | 公众号 QbitAI
作者:鹭羽

Scaling即正义?智谱团队却在最新技术博客中坦言,这一过程并非一帆风顺。他们将GLM-5系列模型在高负载下出现的异常现象称为“Scaling Pain”,并详细分享了踩坑经历与解决方案。

自GLM-5发布以来,用户反馈了一些复杂Coding Agent任务中的异常问题,包括乱码、重复生成和生僻字符。然而,这些异常在线下环境中难以复现,给排查带来了巨大挑战。经过数周努力,团队发现问题根源在于高负载下的推理状态管理,特别是KV Cache的竞态冲突和加载时序缺失。

针对乱码和生僻字符问题,团队发现投机采样(Speculative Decoding)指标异常低,表明草稿模型与目标模型的KV缓存不匹配;而复读问题则与损坏的KV缓存导致注意力模式退化有关。基于此,智谱设计了一套在线异常监控策略,通过设置spec_accept_length和spec_accept_rate阈值,主动中止异常生成请求。

为彻底解决问题,团队优化了PD分离架构下的KV Cache管理,引入显式同步机制,确保写入与回收安全有序。同时,针对HiCache加载时序缺失问题,重构了读取流程,避免未就绪数据被访问。修复后,异常输出率从万分之十几降至万分之三以下。

此外,团队还提出了一种名为LayerSplit的KV Cache分层存储方案,以缓解长上下文任务中Prefill阶段的内存和带宽压力。该方案通过部分存储与广播机制显著降低GPU内存占用,并通过通信与计算重叠隐藏延迟。结合GLM-5.1测试显示,在特定场景下系统吞吐量提升了10%至132%。

智谱总结道,随着AI进入高并发、长上下文的Coding Agent时代,仅靠Scaling Law推动能力增长已不够,还需要强大的系统工程支撑。未来,维护推理基础设施的稳定性和质量将成为关键。

参考链接:
[1] https://z.ai/blog/scaling-pain
[2] https://www.zhipuai.cn/zh/research/159

原文链接
本文链接:https://kx.umi6.com/article/35424.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
深度解读:智谱为什么要在 Infra 层搞 RSI?
2026-09-18 15:21:51
智谱获浦东创投、张江集团10亿元战略投资
2025-07-02 13:41:18
智谱发布新一代旗舰模型GLM-5.1 同时提价10%
2026-04-08 10:49:35
智谱首份业绩报告:商业化全面爆发,Maas平台ARR达17亿元提升60倍
2026-03-31 18:02:15
投资界24h | MiniMax、智谱通过港交所聆讯;红杉中国买下「小脏鞋」;江苏社保科创基金完成备案
2025-12-22 10:41:44
智谱推出“Claude API 用户特别搬家计划”:替换 API URL 即可无缝切换
2025-09-05 18:22:23
用编程大模型登顶开源第一后,智谱GLM团队被拷问了3小时
2025-12-25 11:29:48
智谱发布GLM-4.6 寒武纪、摩尔线程已适配
2025-09-30 16:33:45
智谱联合华为开源首个国产芯片训练的多模态SOTA模型
2026-01-14 09:24:34
北京市人工智能产业投资基金追加投资智谱2亿元
2025-04-17 19:51:35
智谱港交所敲钟上市,首席科学家唐杰要求公司全面回归基础模型研究
2026-01-08 12:07:27
智谱 CEO 张鹏:到 2030 年完全实现超级 AI 的可能性不大
2025-09-30 19:31:37
智谱、MiniMax争夺「大模型第一股」
2025-12-24 10:30:23
24小时热文
更多
扫一扫体验小程序