Kimi K3 正式开放权重:2.8 万亿参数与三项训练基础设施同步发布

月之暗面正式发布 Kimi K3 完整模型权重与技术报告,并同步开源 MoonEP、FlashKDA、AgentEnv 三项训练基础设施。模型总参数达 2.8 万亿,支持原生视觉理解和 100 万 Token 上下文,但 1.56 TB 的权重规模也抬高了私有部署门槛。

月牙光环前开启的模型权重资料库与中央 K3 核心,前方陈列三组技术基座
Kimi K3 月之暗面 开放权重模型 多模态模型 AI 编程

月之暗面于 2026 年 7 月 27 日正式开放 Kimi K3 完整模型权重和技术报告,并同步公开支撑模型训练的 MoonEPFlashKDAAgentEnv 三项基础设施。模型权重已进入 Hugging Face,代码、许可证和技术报告也已放入官方 GitHub 仓库。

这次开放把 Kimi K3 从可通过产品和 API 使用的旗舰模型,推进到可以下载、部署、微调和二次开发的开放权重模型。它的规模同样醒目:总参数 2.8 万亿,每个 Token 激活 1040 亿参数,支持原生视觉理解与 100 万 Token 上下文。

不过,“开放权重”不等于普通开发者可以在工作站上直接运行。官方 Hugging Face 仓库的文件规模约为 1.56 TB,存储只是第一道门槛,加载权重、专家并行、长上下文推理和稳定服务还需要多卡基础设施。对多数独立开发者和小团队,API 或第三方托管推理仍是更现实的试用入口。

这次开放了哪些内容

本次发布覆盖模型、研究报告与训练基础设施,而不只是一个在线体验入口。

开放内容

用途

对开发者的直接价值

Kimi K3 完整权重

私有部署、微调与二次开发

可以自行控制推理环境与数据边界

Kimi K3 技术报告

了解架构、训练和评测方法

便于研究复现和判断模型边界

MoonEP

超大规模细粒度 MoE 的专家并行通信

降低专家通信对训练效率的影响

FlashKDA

Kimi Delta Attention 高性能算子

为长上下文注意力提供工程实现

AgentEnv

分布式强化学习执行环境

支持隔离、快照、恢复及大规模并行 Agent 任务

其中 FlashKDA 此前已经公开,MoonEPAgentEnv 随 Kimi K3 开放日正式开源。三项技术分别覆盖通信、算子与强化学习环境,显示月之暗面希望外部团队能够研究支撑 K3 的工程链路,而不只是消费模型输出。

2.8 万亿参数背后的稀疏架构

Kimi K3 采用混合专家(MoE)架构,总参数达到 2.8 万亿,但推理时不会同时激活全部参数。模型设有 896 个路由专家,每个 Token 选择其中 16 个,并配有 2 个共享专家,单次激活参数约为 1040 亿。

核心规格包括:

  • 93 层网络,包含 69 层 Kimi Delta Attention 与 24 层 Gated MLA;
  • 100 万 Token 上下文窗口,准确上限为 1,048,576 Token;
  • MoonViT-V2 视觉编码器,支持文本和图像输入;
  • 从监督微调阶段开始采用量化感知训练,权重使用 MXFP4、激活使用 MXFP8;
  • Stable LatentMoE 在 896 个专家中激活 16 个,官方称相较 Kimi K2 的整体扩展效率提高约 2.5 倍。

这里的“2.5 倍”是官方对单位算力扩展效率的描述,并不等同于所有任务都比 K2 快 2.5 倍或强 2.5 倍。MoE 的稀疏激活可以控制单次计算量,但完整权重仍需存储和分布到推理集群,工程成本不会随激活参数等比例下降。

能力重点从短回答转向长程任务

Kimi K3 的产品定位集中在长程编码、Agent 知识工作与原生多模态。官方技术材料展示的任务已超出一次性代码补全,包括在大型代码仓库中持续工作、调用终端工具、优化 GPU 内核,以及结合视觉反馈完成游戏、前端与 CAD 开发。

模型也面向深度研究、办公自动化、表格处理和交互式可视化等知识工作。原生视觉能力让截图、文档页面和界面反馈可以进入同一任务链,100 万 Token 上下文则为大型代码库和长文档集合提供更大的输入空间。

官方公布了推理、编程、Agent 和多模态等多组评测,但不同模型使用的 Agent 框架、推理强度、硬件与回退机制并不完全一致。部分榜单来自厂商自测或内部基准,现阶段更适合用来选择测试场景,不能直接推导出 Kimi K3 在所有真实任务中都领先闭源模型。

一个更稳妥的判断是:Kimi K3 已把开放权重模型推到更长上下文、更大规模和更复杂 Agent 任务的竞争区间;实际稳定性、延迟与总体成本仍需要在具体业务中验证。

许可证允许商用,但存在规模条件

模型代码和权重采用专门的 Kimi K3 License。许可证允许使用、复制、修改、合并、发布、分发、再许可、销售、部署和微调,也允许创建衍生作品,但需要保留版权与许可声明并遵守适用法律。

商业使用还需关注两类条件:

  • 如果企业及关联方经营“模型即服务”业务,任意连续 12 个月合计收入超过 2000 万美元,需要先与月之暗面另行签约,才能将 Kimi K3 或衍生作品用于商业目的。
  • 如果使用 Kimi K3 的商业产品月活超过 1 亿,或月收入超过 2000 万美元,需要在产品界面显著展示“Kimi K3”。

内部使用,以及通过月之暗面官方产品或认证推理伙伴使用,不受上述两项规模条件约束。小团队通常不会立即触及门槛,但准备对外提供模型 API、托管微调或大规模消费产品时,应把许可证审查列入上线流程。

小团队应该先测什么

官方 API 已提供 kimi-k3,兼容 OpenAI 和 Anthropic 风格接口;自托管则推荐使用 vLLM、SGLang 或 TokenSpeed。模型始终开启思考,并返回 reasoning_content。在多轮对话和工具调用中,开发者需要把上一轮完整的助手消息原样传回,包括思考内容与 tool_calls,否则可能影响任务连续性。

对没有大规模 GPU 集群的团队,可以先做三类小范围验证:

  1. 用真实代码仓库测试跨文件修改、终端调用、失败恢复和长时间任务完成率,而不只比较单轮代码答案。
  2. 用含截图、PDF 页面或界面反馈的任务测试视觉理解,记录错误率、人工接管次数和上下文增长速度。
  3. 在相同任务集上比较 Kimi K3 API 与现有模型的总耗时、Token 成本、重试次数和最终可交付质量。

若团队确实需要数据留在自有环境,再评估托管私有实例或多机部署。1.56 TB 的权重体量决定了自托管是一项基础设施决策,不只是下载模型后启动一个服务。

接下来要观察的是部署生态

权重开放只是起点。接下来更有参考价值的是主流推理框架的稳定适配、量化版本、不同硬件上的吞吐和显存需求,以及第三方对长程 Agent 任务的复现结果。

Kimi K3 同时开放模型权重、技术报告和训练基础设施,为研究者提供了更多可检查的技术细节。对小团队来说,它首先增加了一个前沿能力的可选供应源;是否值得迁移,最终仍取决于具体任务质量、服务成本、许可证边界和部署复杂度。