Kimi K3 正式开放权重:2.8 万亿参数与三项训练基础设施同步发布
月之暗面正式发布 Kimi K3 完整模型权重与技术报告,并同步开源 MoonEP、FlashKDA、AgentEnv 三项训练基础设施。模型总参数达 2.8 万亿,支持原生视觉理解和 100 万 Token 上下文,但 1.56 TB 的权重规模也抬高了私有部署门槛。
月之暗面于 2026 年 7 月 27 日正式开放 Kimi K3 完整模型权重和技术报告,并同步公开支撑模型训练的 MoonEP、FlashKDA 与 AgentEnv 三项基础设施。模型权重已进入 Hugging Face,代码、许可证和技术报告也已放入官方 GitHub 仓库。
这次开放把 Kimi K3 从可通过产品和 API 使用的旗舰模型,推进到可以下载、部署、微调和二次开发的开放权重模型。它的规模同样醒目:总参数 2.8 万亿,每个 Token 激活 1040 亿参数,支持原生视觉理解与 100 万 Token 上下文。
不过,“开放权重”不等于普通开发者可以在工作站上直接运行。官方 Hugging Face 仓库的文件规模约为 1.56 TB,存储只是第一道门槛,加载权重、专家并行、长上下文推理和稳定服务还需要多卡基础设施。对多数独立开发者和小团队,API 或第三方托管推理仍是更现实的试用入口。
这次开放了哪些内容
本次发布覆盖模型、研究报告与训练基础设施,而不只是一个在线体验入口。
开放内容 | 用途 | 对开发者的直接价值 |
|---|---|---|
Kimi K3 完整权重 | 私有部署、微调与二次开发 | 可以自行控制推理环境与数据边界 |
Kimi K3 技术报告 | 了解架构、训练和评测方法 | 便于研究复现和判断模型边界 |
| 超大规模细粒度 MoE 的专家并行通信 | 降低专家通信对训练效率的影响 |
| Kimi Delta Attention 高性能算子 | 为长上下文注意力提供工程实现 |
| 分布式强化学习执行环境 | 支持隔离、快照、恢复及大规模并行 Agent 任务 |
其中 FlashKDA 此前已经公开,MoonEP 和 AgentEnv 随 Kimi K3 开放日正式开源。三项技术分别覆盖通信、算子与强化学习环境,显示月之暗面希望外部团队能够研究支撑 K3 的工程链路,而不只是消费模型输出。
2.8 万亿参数背后的稀疏架构
Kimi K3 采用混合专家(MoE)架构,总参数达到 2.8 万亿,但推理时不会同时激活全部参数。模型设有 896 个路由专家,每个 Token 选择其中 16 个,并配有 2 个共享专家,单次激活参数约为 1040 亿。
核心规格包括:
- 93 层网络,包含 69 层 Kimi Delta Attention 与 24 层 Gated MLA;
- 100 万 Token 上下文窗口,准确上限为 1,048,576 Token;
- MoonViT-V2 视觉编码器,支持文本和图像输入;
- 从监督微调阶段开始采用量化感知训练,权重使用 MXFP4、激活使用 MXFP8;
- Stable LatentMoE 在 896 个专家中激活 16 个,官方称相较 Kimi K2 的整体扩展效率提高约 2.5 倍。
这里的“2.5 倍”是官方对单位算力扩展效率的描述,并不等同于所有任务都比 K2 快 2.5 倍或强 2.5 倍。MoE 的稀疏激活可以控制单次计算量,但完整权重仍需存储和分布到推理集群,工程成本不会随激活参数等比例下降。
能力重点从短回答转向长程任务
Kimi K3 的产品定位集中在长程编码、Agent 知识工作与原生多模态。官方技术材料展示的任务已超出一次性代码补全,包括在大型代码仓库中持续工作、调用终端工具、优化 GPU 内核,以及结合视觉反馈完成游戏、前端与 CAD 开发。
模型也面向深度研究、办公自动化、表格处理和交互式可视化等知识工作。原生视觉能力让截图、文档页面和界面反馈可以进入同一任务链,100 万 Token 上下文则为大型代码库和长文档集合提供更大的输入空间。
官方公布了推理、编程、Agent 和多模态等多组评测,但不同模型使用的 Agent 框架、推理强度、硬件与回退机制并不完全一致。部分榜单来自厂商自测或内部基准,现阶段更适合用来选择测试场景,不能直接推导出 Kimi K3 在所有真实任务中都领先闭源模型。
一个更稳妥的判断是:Kimi K3 已把开放权重模型推到更长上下文、更大规模和更复杂 Agent 任务的竞争区间;实际稳定性、延迟与总体成本仍需要在具体业务中验证。
许可证允许商用,但存在规模条件
模型代码和权重采用专门的 Kimi K3 License。许可证允许使用、复制、修改、合并、发布、分发、再许可、销售、部署和微调,也允许创建衍生作品,但需要保留版权与许可声明并遵守适用法律。
商业使用还需关注两类条件:
- 如果企业及关联方经营“模型即服务”业务,任意连续 12 个月合计收入超过 2000 万美元,需要先与月之暗面另行签约,才能将 Kimi K3 或衍生作品用于商业目的。
- 如果使用 Kimi K3 的商业产品月活超过 1 亿,或月收入超过 2000 万美元,需要在产品界面显著展示“Kimi K3”。
内部使用,以及通过月之暗面官方产品或认证推理伙伴使用,不受上述两项规模条件约束。小团队通常不会立即触及门槛,但准备对外提供模型 API、托管微调或大规模消费产品时,应把许可证审查列入上线流程。
小团队应该先测什么
官方 API 已提供 kimi-k3,兼容 OpenAI 和 Anthropic 风格接口;自托管则推荐使用 vLLM、SGLang 或 TokenSpeed。模型始终开启思考,并返回 reasoning_content。在多轮对话和工具调用中,开发者需要把上一轮完整的助手消息原样传回,包括思考内容与 tool_calls,否则可能影响任务连续性。
对没有大规模 GPU 集群的团队,可以先做三类小范围验证:
- 用真实代码仓库测试跨文件修改、终端调用、失败恢复和长时间任务完成率,而不只比较单轮代码答案。
- 用含截图、PDF 页面或界面反馈的任务测试视觉理解,记录错误率、人工接管次数和上下文增长速度。
- 在相同任务集上比较 Kimi K3 API 与现有模型的总耗时、Token 成本、重试次数和最终可交付质量。
若团队确实需要数据留在自有环境,再评估托管私有实例或多机部署。1.56 TB 的权重体量决定了自托管是一项基础设施决策,不只是下载模型后启动一个服务。
接下来要观察的是部署生态
权重开放只是起点。接下来更有参考价值的是主流推理框架的稳定适配、量化版本、不同硬件上的吞吐和显存需求,以及第三方对长程 Agent 任务的复现结果。
Kimi K3 同时开放模型权重、技术报告和训练基础设施,为研究者提供了更多可检查的技术细节。对小团队来说,它首先增加了一个前沿能力的可选供应源;是否值得迁移,最终仍取决于具体任务质量、服务成本、许可证边界和部署复杂度。