月之暗面把 Transformer 的三块老地基全换了:Kimi K3 架构拆解
传输接收 · 行星 DELTA-1 · 坐标 [0.91, -0.27]
2026 年 7 月 16 日,月之暗面发布 Kimi K3—全球首个 3T 级开源模型(2.8 万亿参数)。但”参数最大”只是噱头,真正值得记的是:K3 没在旧架构上堆料,它把 Transformer 沿用近十年的三块老地基—注意力机制、残差连接、优化器—全部换了。这篇记的是架构,不是跑分。
先看它要治什么病
vanilla Transformer 有两个随规模恶化的”慢性病”。第一,注意力是 O(L²):序列长度翻倍,计算量翻四倍,KV 缓存随长度线性膨胀。100 万 token 的上下文在传统注意力下是显存杀手。第二,残差连接是均匀加法:output = input + F(input),每层输出无差别累加,隐藏状态随深度无限增长,深层贡献被稀释—模型越深,越”记不住”早期层学到的东西。
K3 的赌注是:要冲到 2.8T + 100 万上下文,光加卡不够,得把这两个病根挖掉。
KDA:让注意力不再随长度爆炸
KDA(Kimi Delta Attention)是 K3 的注意力新地基,技术源头是月之暗面 2025 年底的 Kimi Linear 研究线(arXiv: 2510.26692)。它属于线性注意力家族—不再让每个 token 和序列里所有 token 两两算相似度,而是用一个固定大小的递归状态(recurrent memory)把历史信息压缩进去。计算复杂度从 O(L²) 降到接近 O(L),KV 缓存大小不再随序列长度增长。
KDA 的具体改进对象是 Gated DeltaNet。此前 Qwen3-Next 等方案对每个注意力头施加标量门控(一个头一个门),KDA 把门控细化到通道级(每个特征维度一个门),对有限的递归记忆做更精细的管理—哪些信息该留、哪些该遗忘,颗粒度更细。
但纯线性注意力会丢精度,所以 K3 用了 3:1 混合布局:每 4 层里,3 层走 KDA 线性注意力(高效、缓存固定),1 层保留全局注意力(Gated MLA,带门控的多头潜在注意力,借自 DeepSeek)。官方数据:这一配置在质量基准上反超全注意力,同时把 KV 缓存最多砍掉 75%,100 万 token 上下文下解码速度提升最高 6.3 倍。固定大小的递归状态,是 K3 敢给 100 万上下文的底气。
AttnRes:把”均匀求和”换成”按需检索”
AttnRes(Attention Residuals)是 K3 里最新、也最没被完全披露的组件。它动的是残差连接这块十年没变的老地基。
传统残差是均匀求和:每一层的输出无差别加进主路径,深层信号在层层累加中被稀释。AttnRes 把这个”无差别加法”换成对前序各层输出的 Softmax 注意力—每一层不再被动接收所有上层传下来的累加和,而是根据当前输入内容,主动跨深度检索最相关的历史表示。一句话:从”我全都要”变成”我按需调取”。
官方在 48B 模型上验证:不到 2% 的额外计算成本,换来约 25% 的训练效率提升(约 1.25 倍)。这个改动引发了不小反响—Karpathy 说”看来我们还没把 Attention is All You Need 这句话按字面意思理解透”,OpenAI 前研究副总裁 Jerry Tworek 直接称它”标志着深度学习 2.0 的到来”。
Stable LatentMoE:896 选 16 的极致稀疏
2.8 万亿参数要想跑得动,必须极度稀疏。K3 的 MoE 配置是 896 个专家,每个 token 只激活 16 个(激活率约 1.8%)。在这种稀疏度下,路由和负载均衡成了头号难题—专家分配不均会让一部分卡空转、一部分卡堵死。
K3 的一整套配套:Quantile Balancing 直接根据路由分数的分位数分配专家,干掉了传统方法里难调的启发式均衡超参;Per-Head Muon 把 2024 年新出的 Muon 优化器扩展到按注意力头独立优化,让每个头各自找到最适配的学习节奏;再加上 SiTU(Sigmoid Tanh Unit,激活控制)和 Gated MLA(注意力选择性)。
三件新组件合在一起,K3 官方给出的账是:相比 K2,整体 scaling 效率提升约 2.5 倍—同样的算力换更多智能。量化上,从 SFT 阶段就开始 QAT(MXFP4 权重 + MXFP8 激活),保证开源后能在多种硬件上跑。
为什么营销人该关心
营销人不需要懂 KDA 的递归状态,但该懂两件事。第一,长上下文从”演示功能”变成”日常负载”。 100 万 token 意味着可以把整个品牌资产库、几百份历史文案、一整季的社媒数据塞进一次对话,模型不会”看前面忘后面”—这是把 AI 从”灵感工具”变成”可控生产工具”的前提。第二,开源权重的意义。 7 月 27 日完整权重开放后,企业可自部署、数据不出域,对有合规要求的品牌方,这是闭源旗舰给不了的。
怎么用
- 判断要不要上:任务需要”一次性消化大量品牌资料”(全案策划、跨季复盘、长文档生成)-> K3 的 1M 上下文值得试;只是写几条短文案 -> 用更便宜的 K2.6 / GLM-5.2 即可。
- 成本心法:官方 API 缓存命中输入 3.00/MTok、输出 $15/MTok,编码场景缓存命中率超 90%。保持长前缀不变能持续吃缓存折扣。
- 避坑:K3 对”思考历史”敏感,中途从别的模型切到 K3 会让生成质量不稳;它还偏”主动”,遇到歧义会替你做决定,需在 system prompt / AGENTS.md 里写明边界。
// END OF LOG