推广 热搜: 采购方式  滤芯  带式称重给煤机  甲带  气动隔膜泵  减速机型号  无级变速机  链式给煤机  履带  减速机 

论文速读:Kimi K3 技术分析报告

   日期:2026-07-28 11:14:21     来源:网络整理    作者:本站编辑    评论:0    
论文速读:Kimi K3 技术分析报告
声明:AI生成,是我自己的论文阅读skills 单纯只是笔记,为了减少更多人的阅读成本。
论文标题
: Kimi K3: Open Frontier Intelligence — Technical Report of Kimi K3作者: Kimi Team (Moonshot AI)发布日期: 2026年7月16日权重发布: 2026年7月27日论文链接: GitHub Tech Report模型权重: HuggingFace技术博客: kimi.com/blog/kimi-k3

一、模型概要

项目

Kimi K2

Kimi K3

变化

架构

MoE

MoE

总参数量

1.04T

2.8T (2.78T)

↑ 167%

激活参数量

32.6B

104B

↑ 220%

层数

61

93

↑ 52%

注意力机制

MLA

KDA + Gated MLA (3:1混合)

全新

激活函数

SwiGLU

SiTU-GLU

全新

路由专家数

384

896

↑ 133%

每token激活专家

8

16

↑ 100%

共享专家

1

2

↑ 100%

注意力头数

64

96

↑ 50%

上下文长度

128K

1M (1048576)

词表大小

160K

160K

=

视觉编码器

无原生

MoonViT-V2 (401M, 27层)

全新

量化

MXFP4权重 / MXFP8激活

全新

训练上下文

128K

1M

核心定位: 世界首个开源 3T 级参数模型,在编码、智能体、知识工作、推理和视觉任务上达到前沿水平。


二、核心架构创新

Kimi Delta Attention (KDA)

是什么: 一种基于 delta-rule 递归的线性注意力机制,用通道级遗忘门扩展。

核心公式:

S_t = (I - β_t k_t k_t^T Diag(α_t)) S_{t-1} + β_t k_t v_t^T
õ_t = S_t^T q_t
  • α_t
    : 通道级保留因子 (0,1)^d_k
  • β_t
    : delta-rule 写入强度

关键改进 — 下界衰减 (Lower-Bounded Decay):

  • Kimi Linear: g = -e^A · Softplus(z) → 无界负值
  • Kimi K3: g = g_min · Sigmoid(e^A · z) → 有界 (g_min, 0),g_min=-5
  • 效果: 所有 Tensor Core tile 都能用密集矩阵乘法,消除位置对角线瓶颈

全秩门控: 输出门从低秩改为输入相关全秩投影

y_t = W_o [Sigmoid(W_g x_t) ⊙ RMSNorm(õ_t)]

计算优势: KDA 用固定大小递归状态替代 softmax attention 的 KV cache,状态大小固定、传递成本低。

混合注意力 (Hybrid Attention)

设计: 每 4 层一个 block = 3 KDA + 1 Gated MLA (3:1 比例)

  • KDA: 高效长序列混合(线性复杂度)
  • Gated MLA: 周期性全局注意力(保留全局交互能力)
  • 末层额外加一个 Gated MLA,确保最后一层始终是全局注意力
  • MLA 层使用 NoPE (无位置编码),位置信息由 KDA 隐式编码

好处: 扩展到 1M 上下文无需修改位置编码参数(无 RoPE rescaling/插值)

Attention Residuals (AttnRes)

问题: 标准 Residual Connection 将所有信息压缩到单一状态 h_l,类似 RNN 时间瓶颈。

解决方案: 让每层选择性从所有前层检索表征,而非均匀累加。

  • 每层定义可学习伪查询 q_l = w_l
  • 键/值 = 所有前层输出 f_i(h_i)
  • Softmax attention: α_{i→l} = φ(q_l, k_i) / Σ φ(q_l, k_j)
  • RMSNorm 防止大输出层主导权重

Block AttnRes 优化:

  • 将 L 层分为 N=8 个 block(每 block 12 层)
  • 块内求和得到单一表征,块间全注意力
  • 内存从 O(Ld) 降到 O(Nd)
  • N≈8 即可恢复大部分收益

Stable LatentMoE

设计: 896 路由专家,每 token 激活 16 个 + 2 共享专家,稀疏度 56x

三大稳定化组件:

a) Normalized LatentMoE

  • 在路由专家聚合后、 上投影前插入 RMSNorm
  • 降低路由分支对尺度变化的敏感性
  • 持续改善验证损失和下游基准

b) SiTU-GLU (Sigmoid Tanh Unit GLU)

SiTU-GLU(x) = β₁·tanh(W_g·x/β₁) ⊙ Sigmoid(W_g·x) ⊙ β₂·tanh(W_u·x/β₂)
  • β₁=4 (门分支), β₂=25 (上投影分支)
  • 近原点处 ≈ SwiGLU(保留线性响应)
  • 大值时有界 |f(x)| ≤ β₁·β₂ = 100
  • 解决 2.8T 规模下激活值爆炸问题

c) Quantile Balancing (QB)

  • 替代辅助损失无负载均衡的固定步长更新
  • 从路由分数分位数直接推导专家偏置
  • 每个专家精确获得目标负载
  • 直方图估计: 全局 batch 分位数通过 all-reduce 汇总 bin 计数
  • 推理时冻结偏置

三、原生多模态

MoonViT-V2 视觉编码器

  • 参数
    : 401M, 27层 ViT
  • 训练方式
    从零训练(不用 SigLIP 预训练初始化)
    • 原因: SigLIP 初始化导致联合优化不稳定(梯度范数高且频繁 spike)
    • 从零训练使用 next-token prediction,稳定性更好
    • 评估结果与 SigLIP 初始化基线持平,证明对比预训练非必需
  • 架构
    : RMSNorm + 去除所有 bias,进一步稳定从零优化
  • 输入
    : 图像和视频共享参数
    • 注意力分解为帧内空间 + 帧间时间
    • 时间池化压缩视频 token
    • Pixel-shuffle 2×2 下采样减少视觉 token 数 4 倍
    • 支持最大 3584×3584 像素输入

训练策略

  • 原生多模态: 语言和视觉从训练开始就联合优化
  • 无后置模态对齐阶段
  • 视觉和文本 token 交错在单一 next-token prediction 目标中

四、训练方法

预训练

  • 数据
    : Web Text、Code、Mathematics、Knowledge + 大规模视觉语料
  • 优化器
    : Per-Head Muon(每头独立 Newton-Schulz 正交化)
  • 学习率
    : Cosine decay + 1% linear warmup(优于 WSD)
  • 上下文渐进
    : 8K → 64K → 256K → 1M(四阶段课程)
  • Scaling Law
    : 相比 K2 整体缩放效率提升 ~2.5×

后训练 (Post-Training)

三阶段流程:

  1. SFT (监督微调)
    • 使用 XTML 聊天模板序列化复杂 agent 轨迹
    • 领域专用模型合成 + 人工标注
    • 从 SFT 阶段开始量化感知训练 (QAT)
  2. RL (强化学习)
    • 三大领域 × 三种推理强度 = 9 个专家模型
    • 领域: 通用任务、通用智能体、编码智能体
    • 强度: low / high / max
    • Partial Rollout
      : 部分轨迹完成即进入策略优化,不等全部完成
    • 推理强度RL
      : 每问题 token 预算控制,超预算得 -1 惩罚
    • Agentic GRM
      : 代理式生成奖励模型,锦标赛式二元比较
  3. MOPD (多教师在线策略蒸馏)
    • 将 9 个领域×强度专家统一为单一模型
    • 逐 token 在策略蒸馏奖励

RL 任务环境

  • 统一白盒 RL 环境
    : 可配置模块化 agent harness(支持 Kimi Code / Claude Code / Codex / OpenClaw / Hermes)
  • 知识图谱引导任务合成
    : 自演化 DAG,递归扩展概念节点
  • 可验证问题
    : 多步搜索、专业工作流、多步视觉推理
  • 内核优化任务
    : CUDA/Triton/CuTe DSL/Gluon/ThunderKittens/TileLang
  • 个人助手任务
    : Gmail/Notion/Slack/Canvas mock 实现
  • 自主执行任务 (AET)
    : 黑盒系统复制、量化因子发现、税务审计
  • Web 开发任务
    : 容器化沙箱,多种 agent scaffold

五、量化策略

MXFP4 量化感知训练

  • 权重
    : MXFP4 (MoE 专家权重)
  • 激活
    : MXFP8
  • 非专家组件
    (注意力投影、Latent MoE 投影、共享专家、路由器)保持高精度
  • 从 SFT 阶段开始 QAT
    ,覆盖 SFT + RL 全程
  • RL 中 rollout 和训练共享同一量化方案,消除训练-推理不匹配

推测解码 Draft 模型

  • 基于预训练 MTP 层微调为 EAGLE-3 风格 draft 模型
  • 融合目标模型的低/中/高层特征(第 1/4/最终 AttnRes block 输出)
  • 直接优化 LK 损失(负对数接受率),而非 KL 散度
  • 训练时展开 7 步,推理时递归 drafting

六、基础设施创新

KDA 算法-系统协同设计

组件

功能

FlashKDA

CUTLASS chunkwise kernel,重叠 intra-chunk 计算与 cross-chunk 状态传递

器件内上下文并行

SM 级自动 CP 规划,无跨设备通信

KDA Context Parallelism (KCP)

跨设备递归状态同步,仅需固定大小 all-gather

KCP 关键: 分解为局部状态生成 + 累积转移矩阵作用于入状态,通过 prefix scan 恢复各 rank 入状态

3T 级预训练基础设施

组件

解决问题

MoonEP

完美均衡专家并行,每 rank 精确 S×K token,零拷贝通信,静态形状无 host 同步

统一激活管理器

重计算/量化/offload 可自由组合,tensor 粒度声明

Memory-efficient MoE

梯度重写消除对 forward output 的依赖,dispatch 重计算

Block AttnRes 内存优化

块表征 GPU 常驻,checkpointing 包裹 AttnRes 计算

Pipeline ZeRO-2

梯度分片 + CPU offload

P2P Muon

每 rank 只取本地参数分片,消除全参数 buffer

1M Token Agent RL 基础设施

  • 外部 KV cache 池
    : GPU→CPU DRAM 写回,prefetch 回 GPU
  • 自动限流调度器
    : 根据运行时信号动态控制并发
  • 梯度 buffer 复用
    : 非策略模型前向复用策略模型梯度 buffer

AgentENV 沙箱

  • 基于 Firecracker microVM 的高保真隔离
  • 增量 checkpoint/resume: 133ms/49ms 延迟
  • 三大操作: Pause-Resume / Fork / Snapshot
  • OverlayBD 镜像格式,亚秒级启动
  • 训练期间共创建 51,219,741 个沙箱,1,505,678 个镜像

推理服务

  • KDA-aware Prefix Cache
    : KDA 递归状态与 MLA KV cache 统一页面管理
    • 解耦粒度: 哈希块 512 token,物理块 6144 token
    • KDA checkpoint 稀疏保存在 hash 边界
    • 支持部分填充页面命中
  • 高性能内核
    : KDA decoding(投影输入缓存替代状态快照)、Block AttnRes 融合、LatentMoE token-centric WarpDecode
  • 舰队调度
    : 缓存感知亲和调度(一致哈希双集群)+ 基于预算的准入控制

七、评测结果摘要

推理与知识

基准

Kimi K3

Claude Fable 5

GPT-5.6 Sol

Claude Opus 4.8

GPT-5.5

GLM-5.2

GPQA Diamond

93.5

92.6

94.1

91.0

93.5

91.2

HLE-Full (w/ tools)

56.0

63.0

58.0

57.9

52.2

CritPt

23.4

28.6

32.3

20.9

27.1

20.9

编码

基准

Kimi K3

Claude Fable 5

GPT-5.6 Sol

Claude Opus 4.8

GPT-5.5

GLM-5.2

DeepSWE

67.5

70.0

73.0

59.0

67.0

46.2

ProgramBench

77.8

76.8

77.6

71.9

70.8

63.7

Terminal-Bench 2.1

88.3

88.0

88.8

84.6

83.4

82.7

FrontierSWE

81.2

86.6

71.3

66.7

64.9

67.3

SWE-Marathon

42.0

35.0

39.0

40.0

14.0

13.0

智能体

基准

Kimi K3

Claude Fable 5

GPT-5.6 Sol

Claude Opus 4.8

GPT-5.5

GLM-5.2

BrowseComp

91.2

88.0

90.4

84.3

84.4

MCPMark-Verified

94.5

87.4

92.9

76.4

92.9

AutomationBench

30.8

29.1

29.7

27.2

22.7

12.9

OSWorld-Verified

84.8

85.0

83.0

83.4

79.0

Harvey Lab-AA

94.6

93.6

87.2

91.1

86.3

91.0

视觉

基准

Kimi K3

Claude Fable 5

GPT-5.6 Sol

Claude Opus 4.8

GPT-5.5

OmniDocBench

91.1

89.8

85.8

87.9

89.4

MathVision (w/ tool)

97.8

98.6

97.8

97.1

96.8

ZeroBench (pass@5 w/ tool)

41.0

46.0

35.0

34.0

41.0

第三方评测

评测

Kimi K3

排名

Artificial Analysis Intelligence Index v4.1

57.1

#4/580

Vals AI Vals Index

74.7

#2/39

WebDev Arena (Elo)

1,678

#1/99 (首个登顶开源模型)

Text Arena (Elo)

1,486

#8/200

Agent Arena

9.1

#4/37

成本效率

  • Kimi Code Bench 2.0: 比 Fable 5 低 4.0 分,但只需 38% 成本
  • BrowseComp: 最高分 91.2% @ $2.03/任务,GPT-5.6 Sol 的一半成本
  • GDPval-AA v2: 比 GPT-5.6 Sol 低 50 Elo,成本低 13%
  • AA-Briefcase: 第二名,成本约为 Fable 5 的一半

八、案例研究

GPU 内核优化

  • 在 24 小时预算内优化 4 个内核 (AttnRes/DSA/KDA/MLA)
  • AttnRes: 283.6ms → 114.4ms
  • KDA: 运行时间降低 73.6%
  • 匹配 Fable 5(含 fallback),大幅超越 Opus 4.8/GPT-5.6 Sol/GPT-5.5

GPU 编译器开发 — MiniTriton

  • 从零构建类 Triton 编译器
  • 自定义 tile-level IR + MLIR 优化 + PTX codegen
  • 双模式张量库(eager + 编译路径)
  • 在 NVIDIA L20 上超越 torch eager 和 torch.compile
  • Tensor Core matmul 达到 cuBLAS ~90%
  • 端到端训练 GPT 模型,损失曲线与 PyTorch 参考一致

芯片设计

  • 48 小时自主运行,使用开源 EDA 工具 + Nangate 45nm
  • 为自身架构的 nano 模型设计推理芯片
  • 4mm² 内:100MHz 闭合时序,8700+ tokens/s 解码吞吐
  • 1.46M 标准单元 + 0.277 MiB SRAM + INT4 MAC 阵列
  • "一个模型为另一个模型设计的芯片"

科研编码

  • 2 小时完成通常需 1-2 周的工作
  • 复现 I-Love-Q 普适关系(计算天体物理)
  • 审阅 20+ 论文,实现完整数值管线,评估 300+ 状态方程
  • 生成 3000+ 行 Python 代码 + 交互式 HTML dashboard

知识工作

  • 42 年 AI ASIC 产业研究网站(120+ 轮迭代,87 份季报,99 份原始 PDF,11000+ 页)
  • 引力波分析(391 事件,20+ 并行子 agent,7 个科学可视化)
  • 3Blue1Brown 风格动画讲解自身架构
  • 从 56 个素材剪辑预告片(帧级节拍同步)

九、网络安全评估

Tier 1 — 漏洞发现

  • 在数十个广泛部署系统中识别数百个候选漏洞
  • ~70% 经人工审查确认为真实漏洞
  • 16 个此前未知漏洞
    ,涉及 6 个项目
  • Linux 内核: 远程可触发堆越界写 + Dirty-COW 级 RDMA 子系统权限提升

Tier 2 — Exploit 开发

  • 36 个任务(16 用户态 + 20 内核态)
  • Kimi K3: 14/36 (38.9%) vs GLM-5.2: 8/36 (22.2%)
  • 用户态: 10/16 成功
  • 内核态: 4/20 成功
  • 瓶颈: exploit chain 最后阶段完成、缓解策略选择、调试循环、交付验证

UK AISI + NIST CAISI 独立评估

  • ExploitBench: Kimi K3 32% vs GLM-5.2 24%
  • 模拟企业网络: 17 步 vs 11 步(人类专家 ~20 小时 32 步)
  • 41 任务中 0 次任意代码执行

十、关键技术贡献总结

  1. KDA + 混合注意力
    : 线性注意力效率 + 全局注意力能力,1M 上下文无需位置编码修改
  2. Attention Residuals
    : 层间选择性检索,突破深度残差瓶颈
  3. Stable LatentMoE
    : 896 专家 × 16 激活,SiTU-GLU + QB 稳定 2.8T 训练
  4. 原生多模态从零训练
    : MoonViT-V2 无需 SigLIP 初始化
  5. 2.5× 缩放效率
    : 相比 K2 的综合架构-数据-训练改进
  6. 1M Token Agent RL
    : Partial rollout + 外部 KV cache + AgentENV microVM
  7. KDA-aware Prefix Cache
    : 统一页面管理 KDA 状态与 MLA KV cache
  8. MoonEP 完美均衡专家并行
    : 静态形状 + 零拷贝 + 无 host 同步
  9. 量化感知训练全流程
    : MXFP4/MXFP8 从 SFT 贯穿 RL
  10. 开源 3T 权重
    : 首个开源 3T 级模型,推动前沿智能民主化

十一、与 K2 的关键差异

维度

Kimi K2

Kimi K3

改进核心

注意力

纯 MLA

KDA + Gated MLA (3:1)

线性效率 + 全局能力

深度信息流

标准 residual

Attention Residuals

层间选择性检索

MoE 稳定性

SwiGLU + aux-loss-free

SiTU-GLU + QB

896 专家稳定训练

视觉

无原生

MoonViT-V2 从零训练

原生多模态

上下文

128K

1M

8× 扩展

量化

MXFP4/MXFP8 QAT

全流程量化

RL

单一强度

3 领域 × 3 强度 = 9 专家

多强度统一

沙箱

容器

AgentENV microVM

高保真隔离

推理缓存

标准

KDA-aware prefix cache

统一 KDA+MLA 页面

缩放效率

基准

2.5× 提升

综合


十二、局限与未来方向

已知局限:

  • 研究级推理 (HLE-Full/CritPt) 仍落后 Fable 5 和 GPT-5.6 Sol
  • 内核态 exploit 开发成功率低 (4/20)
  • OSWorld 2.0 和 SaaS-Bench 落后领先模型

未来方向:

  • 推理强度扩展 (low/high 模式后续更新)
  • 推理伙伴生态建设 (vLLM/SGLang/TokenSpeed)
  • 社区协作完善技术细节

十三、API 与部署

API 定价

类型

价格

Cache-hit 输入

$0.30/MTok

Cache-miss 输入

$3.00/MTok

输出

$15.00/MTok

缓存命中率

>90% (编码工作负载)

推理引擎支持

  • vLLM — recipes
  • SGLang — cookbook
  • TokenSpeed — recipes

访问渠道

  • Kimi.com / Kimi Work / Kimi Code / Kimi API Platform
  • 推荐部署: 64+ 加速器的 supernode 配置

模型使用注意

  • 始终启用 thinking,返回 reasoning_content
  • reasoning_effort: "low" / "high" / "max" (默认 "max")
  • 多轮对话需完整传回 assistant message(含 reasoning_content + tool_calls)
  • 温度 1.0,单步任务 top-p=0.95,agent 任务 top-p=1.0

报告生成: 2026-07-28 | 基于 Kimi K3 技术报告全文 + HuggingFace 模型卡 + 官方技术博客

既然来了,没关注的同学关注一下再走呗

老于的技术文章推荐阅读:

一篇让你了解人工智能四巨头的学术成就

从0开始学AI,深扒ChatGPT技术原理。

ChatGPT前辈:InstructGPT 论文整理

万卡 GPU 集群互联:硬件配置和网络设计

大语言模型中,上下文长度的拓展的常用方式

翻译:专家混合 (MoE):条件计算的诞生和兴起

论文阅读:搞定万卡集群!万卡算力基础设施背后的工程努力。

老于的公号大部分以技术、产业为主,喜欢老于别控制,戳一下:

 
打赏
 
更多>同类资讯
0相关评论

推荐图文
推荐资讯
点击排行
网站首页  |  关于我们  |  联系方式  |  使用协议  |  版权隐私  |  网站地图  |  排名推广  |  广告服务  |  积分换礼  |  网站留言  |  RSS订阅  |  违规举报  |  皖ICP备20008329号-18
Powered By DESTOON