即刻·AI探索站8/7 01:3873 分精选
SemiAnalysis:Kimi K3架构解析
李惠子Huizi: SemiAnalysis:Kimi K3,其人、其神话、其传奇
推荐理由:SemiAnalysis 深度拆解 Kimi K3 架构,从 DeltaNet 到 KDA 再到 FlashKDA,技术演进讲得清楚。对做模型选型和推理优化的 AI 创作者,这篇能帮你判断长上下文场景下的效率取舍,值得细读。
SemiAnalysis发布深度技术分析,解读Kimi K3模型架构。K3采用混合注意力机制,其中线性注意力层KDA源自DeltaNet演进,通过门控对角矩阵实现逐通道记忆衰减。Moonshot开源定制Kernel FlashKDA,使Prefill和Decode阶段计算量随序列长度线性或常数增长。K3与Kimi Linear共享专家数量和注意力比例,KDA与MLA交错排列,比例为3:1。文章指出,其他前沿模型如GLM 5.2、DeepSeek V4等转向基于GQA的稀疏注意力,而K3仍保留MLA,推测未来K4可能调整。