论文标题: Kimi K3: Open Frontier Intelligence — Technical Report of Kimi K3作者: Kimi Team (Moonshot AI)发布日期: 2026年7月16日权重发布: 2026年7月27日论文链接: GitHub Tech Report模型权重: HuggingFace技术博客: kimi.com/blog/kimi-k3
一、模型概要
项目 | Kimi K2 | Kimi K3 | 变化 |
架构 | MoE | MoE | — |
总参数量 | 1.04T | 2.8T (2.78T) | ↑ 167% |
激活参数量 | 32.6B | 104B | ↑ 220% |
层数 | 61 | 93 | ↑ 52% |
注意力机制 | MLA | KDA + Gated MLA (3:1混合) | 全新 |
激活函数 | SwiGLU | SiTU-GLU | 全新 |
路由专家数 | 384 | 896 | ↑ 133% |
每token激活专家 | 8 | 16 | ↑ 100% |
共享专家 | 1 | 2 | ↑ 100% |
注意力头数 | 64 | 96 | ↑ 50% |
上下文长度 | 128K | 1M (1048576) | 8× |
词表大小 | 160K | 160K | = |
视觉编码器 | 无原生 | MoonViT-V2 (401M, 27层) | 全新 |
量化 | — | MXFP4权重 / MXFP8激活 | 全新 |
训练上下文 | 128K | 1M | 8× |
核心定位: 世界首个开源 3T 级参数模型,在编码、智能体、知识工作、推理和视觉任务上达到前沿水平。
二、核心架构创新
Kimi Delta Attention (KDA)
是什么: 一种基于 delta-rule 递归的线性注意力机制,用通道级遗忘门扩展。
核心公式:
S_t = (I - β_t k_t k_t^T Diag(α_t)) S_{t-1} + β_t k_t v_t^T
õ_t = S_t^T q_tα_t: 通道级保留因子 (0,1)^d_k β_t: delta-rule 写入强度
关键改进 — 下界衰减 (Lower-Bounded Decay):
Kimi Linear: g = -e^A · Softplus(z)→ 无界负值Kimi K3: g = g_min · Sigmoid(e^A · z)→ 有界 (g_min, 0),g_min=-5效果: 所有 Tensor Core tile 都能用密集矩阵乘法,消除位置对角线瓶颈
全秩门控: 输出门从低秩改为输入相关全秩投影
y_t = W_o [Sigmoid(W_g x_t) ⊙ RMSNorm(õ_t)]计算优势: KDA 用固定大小递归状态替代 softmax attention 的 KV cache,状态大小固定、传递成本低。
混合注意力 (Hybrid Attention)
设计: 每 4 层一个 block = 3 KDA + 1 Gated MLA (3:1 比例)
KDA: 高效长序列混合(线性复杂度) Gated MLA: 周期性全局注意力(保留全局交互能力) 末层额外加一个 Gated MLA,确保最后一层始终是全局注意力 MLA 层使用 NoPE (无位置编码),位置信息由 KDA 隐式编码
好处: 扩展到 1M 上下文无需修改位置编码参数(无 RoPE rescaling/插值)
Attention Residuals (AttnRes)
问题: 标准 Residual Connection 将所有信息压缩到单一状态 h_l,类似 RNN 时间瓶颈。
解决方案: 让每层选择性从所有前层检索表征,而非均匀累加。
每层定义可学习伪查询 q_l = w_l 键/值 = 所有前层输出 f_i(h_i) Softmax attention: α_{i→l} = φ(q_l, k_i) / Σ φ(q_l, k_j)RMSNorm 防止大输出层主导权重
Block AttnRes 优化:
将 L 层分为 N=8 个 block(每 block 12 层) 块内求和得到单一表征,块间全注意力 内存从 O(Ld) 降到 O(Nd) N≈8 即可恢复大部分收益
Stable LatentMoE
设计: 896 路由专家,每 token 激活 16 个 + 2 共享专家,稀疏度 56x
三大稳定化组件:
a) Normalized LatentMoE
在路由专家聚合后、 上投影前插入 RMSNorm 降低路由分支对尺度变化的敏感性 持续改善验证损失和下游基准
b) SiTU-GLU (Sigmoid Tanh Unit GLU)
SiTU-GLU(x) = β₁·tanh(W_g·x/β₁) ⊙ Sigmoid(W_g·x) ⊙ β₂·tanh(W_u·x/β₂)β₁=4 (门分支), β₂=25 (上投影分支) 近原点处 ≈ SwiGLU(保留线性响应) 大值时有界 |f(x)| ≤ β₁·β₂ = 100 解决 2.8T 规模下激活值爆炸问题
c) Quantile Balancing (QB)
替代辅助损失无负载均衡的固定步长更新 从路由分数分位数直接推导专家偏置 每个专家精确获得目标负载 直方图估计: 全局 batch 分位数通过 all-reduce 汇总 bin 计数 推理时冻结偏置
三、原生多模态
MoonViT-V2 视觉编码器
- 参数
: 401M, 27层 ViT - 训练方式
: 从零训练(不用 SigLIP 预训练初始化) 原因: SigLIP 初始化导致联合优化不稳定(梯度范数高且频繁 spike) 从零训练使用 next-token prediction,稳定性更好 评估结果与 SigLIP 初始化基线持平,证明对比预训练非必需 - 架构
: RMSNorm + 去除所有 bias,进一步稳定从零优化 - 输入
: 图像和视频共享参数 注意力分解为帧内空间 + 帧间时间 时间池化压缩视频 token Pixel-shuffle 2×2 下采样减少视觉 token 数 4 倍 支持最大 3584×3584 像素输入
训练策略
原生多模态: 语言和视觉从训练开始就联合优化 无后置模态对齐阶段 视觉和文本 token 交错在单一 next-token prediction 目标中
四、训练方法
预训练
- 数据
: Web Text、Code、Mathematics、Knowledge + 大规模视觉语料 - 优化器
: Per-Head Muon(每头独立 Newton-Schulz 正交化) - 学习率
: Cosine decay + 1% linear warmup(优于 WSD) - 上下文渐进
: 8K → 64K → 256K → 1M(四阶段课程) - Scaling Law
: 相比 K2 整体缩放效率提升 ~2.5×
后训练 (Post-Training)
三阶段流程:
- SFT (监督微调)
使用 XTML 聊天模板序列化复杂 agent 轨迹 领域专用模型合成 + 人工标注 从 SFT 阶段开始量化感知训练 (QAT) - RL (强化学习)
三大领域 × 三种推理强度 = 9 个专家模型 领域: 通用任务、通用智能体、编码智能体 强度: low / high / max - Partial Rollout
: 部分轨迹完成即进入策略优化,不等全部完成 - 推理强度RL
: 每问题 token 预算控制,超预算得 -1 惩罚 - Agentic GRM
: 代理式生成奖励模型,锦标赛式二元比较 - MOPD (多教师在线策略蒸馏)
将 9 个领域×强度专家统一为单一模型 逐 token 在策略蒸馏奖励
RL 任务环境
- 统一白盒 RL 环境
: 可配置模块化 agent harness(支持 Kimi Code / Claude Code / Codex / OpenClaw / Hermes) - 知识图谱引导任务合成
: 自演化 DAG,递归扩展概念节点 - 可验证问题
: 多步搜索、专业工作流、多步视觉推理 - 内核优化任务
: CUDA/Triton/CuTe DSL/Gluon/ThunderKittens/TileLang - 个人助手任务
: Gmail/Notion/Slack/Canvas mock 实现 - 自主执行任务 (AET)
: 黑盒系统复制、量化因子发现、税务审计 - Web 开发任务
: 容器化沙箱,多种 agent scaffold
五、量化策略
MXFP4 量化感知训练
- 权重
: MXFP4 (MoE 专家权重) - 激活
: MXFP8 - 非专家组件
(注意力投影、Latent MoE 投影、共享专家、路由器)保持高精度 - 从 SFT 阶段开始 QAT
,覆盖 SFT + RL 全程 RL 中 rollout 和训练共享同一量化方案,消除训练-推理不匹配
推测解码 Draft 模型
基于预训练 MTP 层微调为 EAGLE-3 风格 draft 模型 融合目标模型的低/中/高层特征(第 1/4/最终 AttnRes block 输出) 直接优化 LK 损失(负对数接受率),而非 KL 散度 训练时展开 7 步,推理时递归 drafting
六、基础设施创新
KDA 算法-系统协同设计
组件 | 功能 |
FlashKDA | CUTLASS chunkwise kernel,重叠 intra-chunk 计算与 cross-chunk 状态传递 |
器件内上下文并行 | SM 级自动 CP 规划,无跨设备通信 |
KDA Context Parallelism (KCP) | 跨设备递归状态同步,仅需固定大小 all-gather |
KCP 关键: 分解为局部状态生成 + 累积转移矩阵作用于入状态,通过 prefix scan 恢复各 rank 入状态
3T 级预训练基础设施
组件 | 解决问题 |
MoonEP | 完美均衡专家并行,每 rank 精确 S×K token,零拷贝通信,静态形状无 host 同步 |
统一激活管理器 | 重计算/量化/offload 可自由组合,tensor 粒度声明 |
Memory-efficient MoE | 梯度重写消除对 forward output 的依赖,dispatch 重计算 |
Block AttnRes 内存优化 | 块表征 GPU 常驻,checkpointing 包裹 AttnRes 计算 |
Pipeline ZeRO-2 | 梯度分片 + CPU offload |
P2P Muon | 每 rank 只取本地参数分片,消除全参数 buffer |
1M Token Agent RL 基础设施
- 外部 KV cache 池
: GPU→CPU DRAM 写回,prefetch 回 GPU - 自动限流调度器
: 根据运行时信号动态控制并发 - 梯度 buffer 复用
: 非策略模型前向复用策略模型梯度 buffer
AgentENV 沙箱
基于 Firecracker microVM 的高保真隔离 增量 checkpoint/resume: 133ms/49ms 延迟 三大操作: Pause-Resume / Fork / Snapshot OverlayBD 镜像格式,亚秒级启动 训练期间共创建 51,219,741 个沙箱,1,505,678 个镜像
推理服务
- KDA-aware Prefix Cache
: KDA 递归状态与 MLA KV cache 统一页面管理 解耦粒度: 哈希块 512 token,物理块 6144 token KDA checkpoint 稀疏保存在 hash 边界 支持部分填充页面命中 - 高性能内核
: KDA decoding(投影输入缓存替代状态快照)、Block AttnRes 融合、LatentMoE token-centric WarpDecode - 舰队调度
: 缓存感知亲和调度(一致哈希双集群)+ 基于预算的准入控制
七、评测结果摘要
推理与知识
基准 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | GPT-5.5 | GLM-5.2 |
GPQA Diamond | 93.5 | 92.6 | 94.1 | 91.0 | 93.5 | 91.2 |
HLE-Full (w/ tools) | 56.0 | 63.0 | 58.0 | 57.9 | 52.2 | — |
CritPt | 23.4 | 28.6 | 32.3 | 20.9 | 27.1 | 20.9 |
编码
基准 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | GPT-5.5 | GLM-5.2 |
DeepSWE | 67.5 | 70.0 | 73.0 | 59.0 | 67.0 | 46.2 |
ProgramBench | 77.8 | 76.8 | 77.6 | 71.9 | 70.8 | 63.7 |
Terminal-Bench 2.1 | 88.3 | 88.0 | 88.8 | 84.6 | 83.4 | 82.7 |
FrontierSWE | 81.2 | 86.6 | 71.3 | 66.7 | 64.9 | 67.3 |
SWE-Marathon | 42.0 | 35.0 | 39.0 | 40.0 | 14.0 | 13.0 |
智能体
基准 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | GPT-5.5 | GLM-5.2 |
BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 | 84.4 | — |
MCPMark-Verified | 94.5 | 87.4 | 92.9 | 76.4 | 92.9 | — |
AutomationBench | 30.8 | 29.1 | 29.7 | 27.2 | 22.7 | 12.9 |
OSWorld-Verified | 84.8 | 85.0 | 83.0 | 83.4 | 79.0 | — |
Harvey Lab-AA | 94.6 | 93.6 | 87.2 | 91.1 | 86.3 | 91.0 |
视觉
基准 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | GPT-5.5 |
OmniDocBench | 91.1 | 89.8 | 85.8 | 87.9 | 89.4 |
MathVision (w/ tool) | 97.8 | 98.6 | 97.8 | 97.1 | 96.8 |
ZeroBench (pass@5 w/ tool) | 41.0 | 46.0 | 35.0 | 34.0 | 41.0 |
第三方评测
评测 | Kimi K3 | 排名 |
Artificial Analysis Intelligence Index v4.1 | 57.1 | #4/580 |
Vals AI Vals Index | 74.7 | #2/39 |
WebDev Arena (Elo) | 1,678 | #1/99 (首个登顶开源模型) |
Text Arena (Elo) | 1,486 | #8/200 |
Agent Arena | 9.1 | #4/37 |
成本效率
Kimi Code Bench 2.0: 比 Fable 5 低 4.0 分,但只需 38% 成本 BrowseComp: 最高分 91.2% @ $2.03/任务,GPT-5.6 Sol 的一半成本 GDPval-AA v2: 比 GPT-5.6 Sol 低 50 Elo,成本低 13% AA-Briefcase: 第二名,成本约为 Fable 5 的一半
八、案例研究
GPU 内核优化
在 24 小时预算内优化 4 个内核 (AttnRes/DSA/KDA/MLA) AttnRes: 283.6ms → 114.4ms KDA: 运行时间降低 73.6% 匹配 Fable 5(含 fallback),大幅超越 Opus 4.8/GPT-5.6 Sol/GPT-5.5
GPU 编译器开发 — MiniTriton
从零构建类 Triton 编译器 自定义 tile-level IR + MLIR 优化 + PTX codegen 双模式张量库(eager + 编译路径) 在 NVIDIA L20 上超越 torch eager 和 torch.compile Tensor Core matmul 达到 cuBLAS ~90% 端到端训练 GPT 模型,损失曲线与 PyTorch 参考一致
芯片设计
48 小时自主运行,使用开源 EDA 工具 + Nangate 45nm 为自身架构的 nano 模型设计推理芯片 4mm² 内:100MHz 闭合时序,8700+ tokens/s 解码吞吐 1.46M 标准单元 + 0.277 MiB SRAM + INT4 MAC 阵列 "一个模型为另一个模型设计的芯片"
科研编码
2 小时完成通常需 1-2 周的工作 复现 I-Love-Q 普适关系(计算天体物理) 审阅 20+ 论文,实现完整数值管线,评估 300+ 状态方程 生成 3000+ 行 Python 代码 + 交互式 HTML dashboard
知识工作
42 年 AI ASIC 产业研究网站(120+ 轮迭代,87 份季报,99 份原始 PDF,11000+ 页) 引力波分析(391 事件,20+ 并行子 agent,7 个科学可视化) 3Blue1Brown 风格动画讲解自身架构 从 56 个素材剪辑预告片(帧级节拍同步)
九、网络安全评估
Tier 1 — 漏洞发现
在数十个广泛部署系统中识别数百个候选漏洞 ~70% 经人工审查确认为真实漏洞 - 16 个此前未知漏洞
,涉及 6 个项目 Linux 内核: 远程可触发堆越界写 + Dirty-COW 级 RDMA 子系统权限提升
Tier 2 — Exploit 开发
36 个任务(16 用户态 + 20 内核态) Kimi K3: 14/36 (38.9%) vs GLM-5.2: 8/36 (22.2%) 用户态: 10/16 成功 内核态: 4/20 成功 瓶颈: exploit chain 最后阶段完成、缓解策略选择、调试循环、交付验证
UK AISI + NIST CAISI 独立评估
ExploitBench: Kimi K3 32% vs GLM-5.2 24% 模拟企业网络: 17 步 vs 11 步(人类专家 ~20 小时 32 步) 41 任务中 0 次任意代码执行
十、关键技术贡献总结
- KDA + 混合注意力
: 线性注意力效率 + 全局注意力能力,1M 上下文无需位置编码修改 - Attention Residuals
: 层间选择性检索,突破深度残差瓶颈 - Stable LatentMoE
: 896 专家 × 16 激活,SiTU-GLU + QB 稳定 2.8T 训练 - 原生多模态从零训练
: MoonViT-V2 无需 SigLIP 初始化 - 2.5× 缩放效率
: 相比 K2 的综合架构-数据-训练改进 - 1M Token Agent RL
: Partial rollout + 外部 KV cache + AgentENV microVM - KDA-aware Prefix Cache
: 统一页面管理 KDA 状态与 MLA KV cache - MoonEP 完美均衡专家并行
: 静态形状 + 零拷贝 + 无 host 同步 - 量化感知训练全流程
: MXFP4/MXFP8 从 SFT 贯穿 RL - 开源 3T 权重
: 首个开源 3T 级模型,推动前沿智能民主化
十一、与 K2 的关键差异
维度 | Kimi K2 | Kimi K3 | 改进核心 |
注意力 | 纯 MLA | KDA + Gated MLA (3:1) | 线性效率 + 全局能力 |
深度信息流 | 标准 residual | Attention Residuals | 层间选择性检索 |
MoE 稳定性 | SwiGLU + aux-loss-free | SiTU-GLU + QB | 896 专家稳定训练 |
视觉 | 无原生 | MoonViT-V2 从零训练 | 原生多模态 |
上下文 | 128K | 1M | 8× 扩展 |
量化 | 无 | MXFP4/MXFP8 QAT | 全流程量化 |
RL | 单一强度 | 3 领域 × 3 强度 = 9 专家 | 多强度统一 |
沙箱 | 容器 | AgentENV microVM | 高保真隔离 |
推理缓存 | 标准 | KDA-aware prefix cache | 统一 KDA+MLA 页面 |
缩放效率 | 基准 | 2.5× 提升 | 综合 |
十二、局限与未来方向
已知局限:
研究级推理 (HLE-Full/CritPt) 仍落后 Fable 5 和 GPT-5.6 Sol 内核态 exploit 开发成功率低 (4/20) OSWorld 2.0 和 SaaS-Bench 落后领先模型
未来方向:
推理强度扩展 (low/high 模式后续更新) 推理伙伴生态建设 (vLLM/SGLang/TokenSpeed) 社区协作完善技术细节
十三、API 与部署
API 定价
类型 | 价格 |
Cache-hit 输入 | $0.30/MTok |
Cache-miss 输入 | $3.00/MTok |
输出 | $15.00/MTok |
缓存命中率 | >90% (编码工作负载) |
推理引擎支持
vLLM — recipes SGLang — cookbook TokenSpeed — recipes
访问渠道
Kimi.com / Kimi Work / Kimi Code / Kimi API Platform 推荐部署: 64+ 加速器的 supernode 配置
模型使用注意
始终启用 thinking,返回 reasoning_content reasoning_effort: "low" / "high" / "max" (默认 "max") 多轮对话需完整传回 assistant message(含 reasoning_content + tool_calls) 温度 1.0,单步任务 top-p=0.95,agent 任务 top-p=1.0
报告生成: 2026-07-28 | 基于 Kimi K3 技术报告全文 + HuggingFace 模型卡 + 官方技术博客
既然来了,没关注的同学关注一下再走呗
老于的技术文章推荐阅读:
老于的公号大部分以技术、产业为主,喜欢老于别控制,戳一下:


