综合
7*24 快讯
AI科普
合作
全部
英雄令
项目方
开发者
产品方
投资者
9月底,字节团队发布论文指出,DeepSeek V4系列模型存在隐藏Bug:同一问题仅因多加几个空格,回答便大相径庭。这源于其采用的“分块KV Cache压缩技术”,该技术将长文本切块压缩以节省显存,但若关键信息落在切块交界的“信息盲区”,模型就会“失忆”翻车。这种“相位敏感性”缺陷在Llama 3等采用类似技术的模型中也存在。目前,DeepSeek已通过减小压缩步长缓解此问题。同时,业界正积极探索“动态分块”技术,通过根据语义灵活调整切块边界,有望彻底根治这一长文本处理的先天短板。
原文链接
加载更多
暂无内容