综合
7*24 快讯
AI科普
合作
全部
英雄令
项目方
开发者
产品方
投资者
近日,智谱AI发布GLM-5.3-Flash模型并登顶OpenRouter调用榜首。月之暗面研究员发现,该模型与Kimi K3在底层KDA线性注意力的核心参数“遗忘门下界”上均设为-5,引发“撞衫”热议。其实,-5是兼顾长文本记忆与训练稳定性的“黄金平衡点”,能大幅降低推理成本。参数趋同并非抄袭,而是技术演进的必然。这标志着国产顶尖大模型团队已集体迈入底层算子优化的深水区。在极致算力压迫下,中国AI团队正以惊人的工程效率与敏捷度,不断突破长文本处理的物理极限,推动大模型行业加速走向成熟。
原文链接
2025年10月,月之暗面开源全新Kimi Linear架构,首次在相同训练条件下超越传统全注意力模型。该架构通过创新的Kimi Delta Attention(KDA)机制,在长上下文任务中减少75%的KV缓存需求,推理速度提升6倍,同时保持高精度。KDA引入细粒度遗忘门控与改进的增量学习规则,确保超长序列中的稳定性和泛化能力。模型采用3:1混合层设计,结合工程优化,无缝兼容现有Transformer系统。实验表明,Kimi Linear在多项基准测试中全面领先,并在数学推理、代码生成等任务中表现优异。这一突破或预示AI架构正迈向多元创新时代。技术报告已发布于Hugging Face平台。
原文链接
加载更多
暂无内容