- SemiAnalysis对月之暗面(Moonshot)发布的Kimi K3开源前沿模型进行了深度架构解读。报告核心涵盖五大技术亮点:(1)Kimi Delt
- 序号:399
- 星球链接:打开网页
- 附件:图片 0,音频 0,文档 0
- 音频文件:无音频
图片
无图片
正文
- SemiAnalysis对月之暗面(Moonshot)发布的Kimi K3开源前沿模型进行了深度架构解读。报告核心涵盖五大技术亮点:(1)Kimi Delta Attention(KDA)——一种基于DeltaNet的线性注意力层,通过将历史键值对压缩为单一隐藏状态实现线性复杂度,Moonshot还开源了定制GPU内核FlashKDA;(2)跨深度注意力残差(Attention Residuals)——用注意力机制替代传统残差连接,让每一层可选择性访问先前层的表征,实现1.25倍计算效率提升,块注意力设计将通信开销从O(Ld)降至O(Nd);(3)稳定潜在MoE(Stable LatentMoE)——在路由分派前压缩token,解压后做聚合,并通过RMSNorm降低尺度敏感性,潜在维度减半使激活专家数翻倍至16而通信量不变;(4)分位数负载均衡(QB)——无需超参数、无需aux-loss的动态路由器偏置更新方法;(5)服务性能方面,Kimi K3采用KDA与MLA的3:1混合比例,结合vLLM的32K粒度前缀缓存管理,在B300等GPU上展现优异推理吞吐量,KV吞吐随序列长度增加优势愈加明显。
SemiAnalysis于2026年8月4日发布的这篇深度技术报告,对中国AI公司月之暗面(Moonshot)推出的开源前沿模型 进行了全面的架构剖析。报告系统解读了Kimi K3背后的五大非传统技术设计,包括线性注意力机制(KDA)、跨深度注意力残差(Attention Residuals)、潜在MoE架构、分位数负载均衡以及混合注意力的推理服务优化。报告指出,Kimi K3采用了许多业界独一无二的技术路线,这些设计虽然在性能上极具竞争力,但在KV缓存效率、前缀缓存管理等方面也带来了独特的工程挑战。报告同时基于InferenceX基准测试,对Kimi K3在B300等GPU上的实际推理表现进行了实测。
一、Kimi Delta Attention(KDA):从线性注意力到高效记忆压缩 KDA是Kimi K3混合注意力机制中的线性注意力层。报告追溯了KDA的技术演进路径: :通过移除标准softmax注意力中的softmax运算,将注意力计算复杂度从二次降低到线性O(Ld²)。其核心是将所有历史的键值对压缩到一个隐藏状态矩阵S中。 :改进了线性注意力的损失函数,通过最小化值检索的L2范数来正则化矩阵S的增长,解决了旧信息与新信息混淆导致学习不稳定的问题。 :GDN引入了LSTM遗忘门alpha来控制记忆生命周期,KDA进一步将alpha扩展为对角矩阵,实现逐通道的细粒度记忆衰减和位置感知。 :Moonshot开发并开源了FlashKDA的定制GPU内核。该内核将KDA的递归公式进行了矩阵化重写,在prefill阶段采用chunk级并行化(通过UT变换计算中间矩阵),在decode阶段则保持常数复杂度。具体来说: Decode阶段每次约7×D² FLOPs,内存访问约8×D²字节 Prefill阶段总计算复杂度为O(TD²),内存访问为O(TC + TD + D²) 二、注意力残差(Attention Residuals):跨越深度的信息流 这是Kimi K3最具创新性的架构设计之一。报告指出,传统残差连接虽然使构建更深的网络成为可能,但存在两个核心问题: :随着深度增加,残差流中的信息会发生不可逆损失 :后续层必须增大输出增益才能对修改后的残差流产生影响 : 将标准因果自注意力的"对序列维度做注意力"替换为"对深度维度做注意力" 每个层ℓ学习一个查询向量wℓ(而非从当前token生成) 对先前所有层的表征做softmax注意力 : 将L层分为N个块,每块S层 在完整块输出上做注意力,对当前运行块使用演化中的部分和 将通信开销从O(Ld)降至O(Nd) 相比标准残差连接实现,验证损失持续更低 : 针对流水线并行,通过在虚拟阶段间缓存输入,将通信量从O(C)降至O(P) 配合激活检查点,内存开销仅比标准架构多4% : :类似于prefill阶段,对已完成块做批量注意力 :类似于decode阶段,使用在线softmax进行块内演化求和 三、稳定潜在MoE(Stable LatentMoE) : 在路由token分派前进行压缩,聚合后解压 在上投影(解压)操作前应用RMSNorm,降低对尺度变化的敏感性 : 报告推导了一个关键公式: $$\frac{T_{comm}}{T_{comp}} = \frac{P \cdot F}{6 \cdot m \cdot B} \cdot (1 - \frac{1}{E})$$ 其中: t:EP域内总token数;K:每token激活专家数;N:总专家数;E:EP并行规模 d:专家输入维度;m:专家中间维度 P:每激活元素通信字节数;F:有效FFN吞吐;B:有效单向网络带宽 : 通信与计算时间之比 m增大,比值降低,理论上可隐藏的通信比例增大 这解释了Kimi K3等近期开源模型(包括DeepSeek V4 Pro、MiniMax M3、MiMo V2.5 Pro、Inkling)纷纷将专家中间维度提升至3072的设计动机 Kimi K3的潜在输入维度为3584(K2的7168的一半),使得激活专家数从8翻倍至16而通信量不变。 四、分位数负载均衡(Quantile Balancing, QB) QB是由Jianlin Su于2026年2月提出的的负载均衡技术: 与aux-free负载均衡的基本原理相同:路由器偏置根据系统负载动态更新 不同之处:QB不通过小系数更新偏置,而是直接根据路由器分数相对于路由截止阈值的分布计算下一个偏置 当路由器均衡负载时,偏置更新自然变小 : 每个token找到第(k+1)高的偏置路由器分数作为截止阈值 对每个专家,排序其路由器分数与每个token截止值之间的边际 将负偏置设为第(q+1)大的边际,恰好留下q个边际在阈值之上 由于q/m = k/n,这实际上就是边际的(1-k/n)分位数 五、KV缓存效率与服务性能 : 定义为KV缓存大小除以prefill时间(Time to First Token) 代表使用PD分离可靠服务模型所需的最小带宽 是理解KV缓存效率的良好代理指标 随序列长度增加,混合线性注意力的优势愈加明显 : KDA的循环状态大小固定,不随序列长度增长 但线性注意力使前缀缓存变得复杂——如果不预先知道前缀边界位置,必须在每个token位置缓存KDA循环状态,导致内存使用退化为随序列长度增长 解决方案:以粗粒度(如vLLM每32K tokens)保存循环状态,并在提示边界处额外缓存 : Kimi K3在KDA之外保留全注意力的MLA(Multi-head Latent Attention) MLA使用吸收技巧减少decode计算但增加prefill计算 对于以decode为主的推理工作负载是合理权衡,但对于prefill为主的智能体工作负载代价过高 所有前沿开源权重模型均采用基于GQA的注意力机制(如DeepSeek V4 Compressed Sparse Attention、MiniMax M3 Sparse Attention等) 报告推测Moonsshot未来模型(如Kimi K4)将用其他机制替代MLA : KV缓存在GPU集群中遵循内存层次结构:HBM → 服务器DRAM → SSD 支持write-through和write-back策略 多节点场景优势:跨节点共享前缀缓存、避免MLA张量并行的KV缓存重复、节点故障时的KV缓存冗余 六、InferenceX基准测试 : 基于Claude Code真实内部trace录制 回放一小时trace至稳态 中位数:每轮142k输入token、444输出token、每会话65轮 : 模型可装入单节点,权重后GPU HBM仅能容纳3.25M token的KV缓存 吞吐量随批量大小增加而上升,直到并发数超过8 与3.25M token的KV缓存预算大致吻合 超过该点后缓存抖动加剧,命中率降至:截至7月30日,OpenRouter上所有提供商对Kimi K3的最低定价为输入$3/百万token、输出$15/百万token。Nvidia和AMD均在vLLM上提供Day 0支持,具备DRAM卸载和DSpark推测解码能力。
本报告为,并非针对特定上市公司的投资评级报告。SemiAnalysis作为AI基础设施领域的独立研究机构,对Kimi K3的模型架构设计进行了纯技术维度的深度剖析,不涉及估值或买卖建议。 报告中提到的相关上市公司包括: (提供Day 0支持,GPU推理硬件) (提供Day 0支持,MI355X等推理硬件) (Kimi K3的开发者,尚未上市)
:Kimi K3采用的注意力残差、潜在MoE、KDA等非传统设计虽然理论上具有优势,但在实际大规模部署中可能面临稳定性、可扩展性等未预见的问题。 :虽然KDA理论上降低了KV缓存空间复杂度,但前缀缓存管理、循环状态保存粒度等问题使其在实际服务中难以达到理论最优效果。 :对于智能体(agentic)等长prefill工作负载,MLA的吸收技巧带来的额外计算成本可能成为瓶颈。 :推理性能严重依赖于GPU(H300、B200等)的HBM容量、DRAM带宽和互联拓扑,不同硬件平台的表现差异显著。 :分位数负载均衡(QB)作为2026年初才提出的方法,长期稳定性与收敛性仍需更多生产环境验证。 :前沿开源模型(DeepSeek V4、MiniMax M3、MiMo等)迭代速度极快,Kimi K3的技术领先窗口可能较短。 :Kimi K3的规模庞大,B200单节点无法容纳,需要流水线并行(PP),这进一步增加了部署复杂度和推理延迟。
总体总结
主题正文
- 报告核心涵盖五大技术亮点:(1)Kimi Delta Attention(KDA)——一种基于DeltaNet的线性注意力层,通过将历史键值对压缩为单一隐藏状态实现线性复杂度,Moonshot还开源了定制GPU内核FlashKDA;
- (2)跨深度注意力残差(Attention Residuals)——用注意力机制替代传统残差连接,让每一层可选择性访问先前层的表征,实现1.25倍计算效率提升,块注意力设计将通信开销从O(Ld)降至O(Nd);
- (3)稳定潜在MoE(Stable LatentMoE)——在路由分派前压缩token,解压后做聚合,并通过RMSNorm降低尺度敏感性,潜在维度减半使激活专家数翻倍至16而通信量不变;
- (5)服务性能方面,Kimi K3采用KDA与MLA的3:1混合比例,结合vLLM的32K粒度前缀缓存管理,在B300等GPU上展现优异推理吞吐量,KV吞吐随序列长度增加优势愈加明显。
- 报告系统解读了Kimi K3背后的五大非传统技术设计,包括线性注意力机制(KDA)、跨深度注意力残差(Attention Residuals)、潜在MoE架构、分位数负载均衡以及混合注意力的推理服务优化。
- :改进了线性注意力的损失函数,通过最小化值检索的L2范数来正则化矩阵S的增长,解决了旧信息与新信息混淆导致学习不稳定的问题。
- 所有前沿开源权重模型均采用基于GQA的注意力机制(如DeepSeek V4 Compressed Sparse Attention、MiniMax M3 Sparse Attention等)
- SemiAnalysis作为AI基础设施领域的独立研究机构,对Kimi K3的模型架构设计进行了纯技术维度的深度剖析,不涉及估值或买卖建议。