即刻·AI探索站8/7 01:3873精选

SemiAnalysis:Kimi K3架构解析

李惠子Huizi: SemiAnalysis:Kimi K3,其人、其神话、其传奇

阅读原文

推荐理由:SemiAnalysis 深度拆解 Kimi K3 架构,从 DeltaNet 到 KDA 再到 FlashKDA,技术演进讲得清楚。对做模型选型和推理优化的 AI 创作者,这篇能帮你判断长上下文场景下的效率取舍,值得细读。

SemiAnalysis发布深度技术分析,解读Kimi K3模型架构。K3采用混合注意力机制,其中线性注意力层KDA源自DeltaNet演进,通过门控对角矩阵实现逐通道记忆衰减。Moonshot开源定制Kernel FlashKDA,使Prefill和Decode阶段计算量随序列长度线性或常数增长。K3与Kimi Linear共享专家数量和注意力比例,KDA与MLA交错排列,比例为3:1。文章指出,其他前沿模型如GLM 5.2、DeepSeek V4等转向基于GQA的稀疏注意力,而K3仍保留MLA,推测未来K4可能调整。

关联讨论 · 1

来源与依据

时间证据
8/7 01:38
收录于 8/7 01:50
交叉线索
2 个独立来源
内容可信度: