摘要:月之暗面Kimi K3全栈开源——2.8万亿参数MoE架构,全球首个3万亿级别开源模型。KDA(Kimi Delta Attention)混合线性注意力+AttnRes注意力残差、Stable LatentMoE(896专家激活16个)、1M上下文、原生多模态。全栈开源涵盖权重+三项底层Infra(MoonEP/FlashKDA/AgentEnv)。上线30分钟HuggingFace 4000+赞创历史纪录,华为昇腾Day 0适配,马斯克公开点赞并紧急启动Grok 4.6,黄仁勋为此发第一条推文。本文拆解KDA注意力机制、Stable LatentMoE稀疏化、三项Infra的技术细节、以及K3与DeepSeek V4的开源协同进化叙事。
2026年7月27日深夜11点,HuggingFace趋势榜被一个模型炸了。
Kimi K3上线30分钟,超过4000个赞。HuggingFace CEO Clem Delangue发文:"迄今为止最快的发布增长速度!!"上线前10分钟,下载页面短暂404——近3700名开发者在蹲守。
Kimi K3的2.8万亿总参数使其成为全球第一个迈入3万亿级别的开源模型。896个MoE专家,每次只激活16个。1M上下文。原生多模态。配套开源MoonEP、FlashKDA、AgentEnv三项底层Infra技术——从模型权重到训练系统,全栈公开。
7月17日模型发布,7月27日全栈开源,Kimi K3用了10天重新定义了"开源模型的性能天花板"。
一、KDA注意力:不再让模型"健忘"
传统Transformer的Softmax Attention有一个致命问题:计算复杂度随序列长度平方增长(O(n²))。当上下文从128K升到1M,不是慢8倍,是慢64倍。
KDA(Kimi Delta Attention)的做法:把注意力计算从O(n²)压到O(n)。
不是完整计算每个token对所有token的注意力,而是用一个delta值来"增量更新"注意力状态。类似读一本书——到第100页时,不必把前99页全部重读一遍来理解这一页,脑子里已有一个"压缩摘要"。
配合AttnRes(注意力残差)——以3:1比例在KDA和Gated MLA之间混合,通过块级残差增强跨层信息流动。两个设计组合,实现1M上下文下的高效推理。
FlashKDA(KDA的高性能算子实现)在英伟达H20上,prefill速度相比基线提升1.72~2.22倍。
二、896专家,但每次只叫16个"干活"
MoE的核心思想:大模型由很多"小专家"组成,每次推理只激活一小部分。K3把知识分散在896个专家里,每个token只叫16个出来干活。
关键创新在"Stable"。传统MoE训练时有一个著名问题:专家负载不均——有些专家累死,有些闲置。这会导致Loss震荡甚至训练崩溃。
Stable LatentMoE通过SiTU-GLU和Quantile Balancing在极端稀疏度下保持训练稳定——896个专家、每次只激活16个这种设置,训练全程无崩溃。
Moonshot官方给出数字:相比K2,整体扩展效率提升约2.5倍。同样算力,K3比K2学到的更多。
对比DeepSeek V4 Pro(1.6T总参数,49B激活,稀疏比32.7:1),Kimi K3是2.8T总参数、~104B激活、稀疏比27:1。K3的有效激活参数是V4 Pro的两倍多——知识储备更多,每次推理用的"脑力"也更多。
三、三项Infra全栈开源
这次开源最被行业看重的,不只是模型权重,是训练系统的全栈公开:
MoonEP:超大规模细粒度MoE的高性能通信库。在896个专家的巨型集群中,专家间数据通信是最大瓶颈。MoonEP解决了不均衡负载下的高效通信问题。
FlashKDA:KDA高性能算子,可直接作为flash-linear-attention的替换后端插入任何框架。其他模型团队也能用它加速线性注意力实现。
AgentEnv:与KVCache.ai合作的沙箱系统。支持快速快照、恢复和分叉,能应对大规模并行的Agent工作流——几百个Agent同时在隔离沙箱里训练。
这三项技术的开源意味着:你不仅能跑K3,还能复现K3的训练过程。在3万亿参数级别中是第一次。
四、真实能力:GPU内核优化和编译器
两个案例最能说明K3的能力边界:
GPU内核优化。 在相同沙箱环境中,给K3 24小时独立完成4个GPU内核优化任务(AttnRes、DSA、KDA、MLA)。结果:AttnRes延迟从283.6ms降至114.4ms(-59.7%),DSA减少55.1%,KDA减少73.6%。综合表现与Claude Fable 5持平,显著优于Opus 4.8和GPT-5.6 Sol。
从零写GPU编译器。 K3在无预设代码模板的情况下独立开发了MiniTriton——一个紧凑的Triton风格编译器,包含自研tile级IR层、MLIR后端、优化pass和PTX代码生成管道。更关键的是:它用MiniTriton跑通了完整nanoGPT训练,loss曲线几乎与参考实现重合。
一个模型能优化自己底层的算子实现、能从零设计编译器并实际运行GPT训练任务——这是"会聊天"和"会做事"之间的系统级工程鸿沟。
五、全行业Day 0响应
K3开源当晚的反应速度堪称历史级:
| HuggingFace | 30分钟4000+赞登顶,CEO称"最快发布增长纪录" |
| 华为昇腾 | Day 0适配,原生支持MXFP4量化 |
| 阿里云 | 真武M890超节点首日适配 |
| Devin(Cognition) | 宣布接入,“首个性能逼近前沿水准的开源模型” |
| 马斯克 | 公开评价"令人印象深刻",xAI启动Grok 4.6(2T参数) |
| 黄仁勋 | 发第一条推文,联合133机构力挺开源模型 |
| Kimi估值 | 500亿美元,即将Pre-IPO |
六、K3和DeepSeek V4:不是对手,是接力
翻开技术报告会发现一种开源协同进化模式:
- K3的KDA混合线性注意力机制,源头可追溯到DeepSeek V2的MLA
- DeepSeek V4的Muon优化器,最早被Kimi K2大规模验证过
不是硅谷式的"你发模型我几小时内立刻发更新狙击"。你开源的技术我用并优化,我验证过的方案你采纳并推广。每个参与者都在抬高水位线,所有人受益。
总结
Kimi K3定义了2026年7月开源大模型的三个"首次":
一句话:开源模型不再是在闭源身后追赶,它正在定义新一轮AI竞赛的起跑线。
📱 更多AI开源项目深度解读 每天解读 GitHub/HuggingFace 最新热门AI项目,从架构原理到工程落地,从开发者实测到行业启示。
「圈圈的AI工程笔记」**,和数万开发者一起看懂AI前沿。链接
标签:Kimi K3 月之暗面 开源大模型 MoE KDA HuggingFace



