综合
7*24 快讯
AI科普
合作
全部
英雄令
项目方
开发者
产品方
投资者
10月,字节Seed团队揭示了DeepSeek-V4模型表现“时强时弱”的深层原因。研究发现,在代码补全和128K长上下文测试中,仅微调输入信息位置(如增加无关字符),模型的检索准确率竟呈现每隔4个Token的周期性波动,最大差距达40.2%。团队指出,这源于模型采用的“分块KV Cache压缩”技术。该技术虽降低内存开销,却导致模型对信息在压缩窗口中的位置产生“相位敏感性”。对照实验证实,分块压缩设计本身会引入此周期性偏差。研究建议评估此类模型需考量不同相位表现,后训练与架构迭代可有效缓解该问题。
原文链接
加载更多
暂无内容