Kimi K3权重上线魔乐社区!基于昇腾的推理部署指南来了

Kimi K3权重上线魔乐社区!基于昇腾的推理部署指南来了 Kimi K3全球首个开源的 3 万亿级别 MoE 模型昇腾 Day0 适配原生视觉理解 百万 token 上下文 关键Infra技术全面开放。2026 年 7 月 27 日月之暗面正式开源 Kimi K3的模型权重以及支撑 Kimi K3 模型训练的关键 Infra 技术MoonEP、FlashKDA 和 AgentEnv。Kimi K3是一个拥有2.8 万亿参数的混合专家MoE模型具备原生视觉理解能力并支持 100 万 token 的上下文窗口。它是全球首个开源的 3 万亿级别模型面向长程编程、知识工作和推理等前沿智能场景而设计。Kimi K3 的开源模型权重和NPU适配的量化权重均已上线魔乐社区欢迎广大开发者下载下载地址模型原始权重https://modelers.cn/models/moonshotai/Kimi-K3量化权重(NPU适配https://modelers.cn/models/Eco-Tech/Kimi-K3-w4a81. 技术报告与关键 Infra 技术同步公开Kimi K3 参数规模是 Kimi K2.5 的3 倍左右但规模化并不仅仅是参数的堆叠。在并不宽裕的算力条件下Kimi K3 凭借Kimi Delta Attention、Attention Residuals 以及 MoonEP等一系列技术创新规模化效率提升了2.5 倍即在算力最优意义下单位算力产出智能约等于原来 2.5 倍。与 Kimi K3 模型权重一起公开的还有 Kimi K3 的技术报告以及支撑训练的三项 Infra 技术MoonEP、FlashKDA 和 AgentEnv覆盖从高性能通信、高性能算子到分布式 RL 环境的关键链路。其中 FlashKDA 此前已开源MoonEP 和 AgentEnv 则随本次发布正式开源。MoonEPMoonEP 是 Kimi 团队为超大的细粒度 MoE 打造的高性能通信库让专家并行expert-parallel的通信在不均衡的情况下仍然实现极致效率。FlashKDAFlashKDA 是 Kimi 团队实现的 Kimi Delta Attention 高性能算子。在英伟达 H20 上相比 flash-linear-attention 基线它的prefill 速度提升 1.72–2.22 倍可以直接作为 flash-linear-attention 的替换后端。AgentEnvAgentEnv 是 Kimi 团队与 KVCache.ai 合作开发的沙箱系统用于大规模运行 Agent 环境。它为 Kimi K3 的后训练提供高保真、强隔离沙箱灵活支持快速快照、恢复和分叉fork等可应对大规模并行的 Agent 工作流与训练任务。2. 昇腾实现 Day0 适配此次 Kimi K3 一经开源发布昇腾即实现 Day0 适配在训练侧基于 MindSpeed MM 在 Atlas 800 A3、Atlas 900 A3 SuperPoD 上完成减层训练基础功能适配在算子、并行加速、显存优化等方面进行专项优化在推理侧通过 vLLM Ascend 与 SGLang 开源推理引擎实现快速部署同时昇腾 950 超节点支持 FP8、MXFP8、MXFP4 等全系列数值精度格式原生支持 Kimi K3 的 mxFP4 量化权重。Kimi K3 接入 vLLM Ascend / SGLang 后用户仍可沿用 vLLM / SGLang 的服务接口、调度方式和参数体系。vLLM Ascend 支持 Prefix Cache、Chunked Prefill、异步调度、PD 分离和内存池化等能力在适配 KDA、Gated MLA 和 LatentMoE 新结构的同时保持这些框架能力与使用方式不变使 K3 能够无缝进入现有 vLLM 推理服务体系。融合算子加速: KDA Prefill 与 Decode 双路径KDA 状态具有严格的时序依赖vLLM Ascend 针对 Prefill 和 Decode 为 Kimi K3 设计了两条执行路径Prefill 以 64 Token 为 Chunk将 QK 归一化、Gate 累积和 Chunk KDA 组织为批量计算Decode MTP 则直接在状态池上执行短序列递归更新。Decode 路径使用Ascend C 融合 Kernel在单次执行中完成 QK L2Norm、Gate 与 Beta 处理、状态衰减、Delta Rule、外积更新、输出计算和 Final State 原地回写。V×K 工作状态驻留 Unified Buffer并按“逻辑序列 × Value Head”并行分配任务从而减少多算子启动、临时 Workspace、全局内存往返和阶段间同步开销。MoE 通算: MC2 支撑 896 专家与大规模 EPKimi K3 在部署时EP64 下每张卡只有 14 个路由专家而每个 Token 要访问 16 个专家跨 Rank 交换是必然动作。vLLM Ascend 通过 MC2 将路由后的 Token 重排、跨 Rank 分发、局部专家计算和结果回收组织为一条设备侧流水线避免 CPU 参与热路径调度。MC2 路径在 Dispatch 前、GMM2 前与 Combine 前记录 Stream Event使 Shared Expert 可以在独立 Stream 中与路由专家、通信阶段重叠。Token 分发、专家 GMM 与结果回收因此可以在设备侧连续推进减少 CPU 介入和阶段间等待。原生量化: MXFP4 权重与逐 Token 动态 MXFP8 激活Kimi K3 以 MXFP4 承载专家权重、以 MXFP8 承载专家计算激活。vLLM Ascend 通过 ModelSlim 量化配置直接加载原生量化权重并在设备侧执行逐 Token 动态 MX 量化、生成 Per-Token Scale量化结果与 Scale 随 Token 一同进入专家分发和 Grouped MatMul减少权重与激活的存储、访存及中间搬运开销。量化范围按模块控制Router 保持高精度发布版权重中的 LatentMoE 降维、升维投影保持 BF16ModelSlim 原生权重则可对其独立量化。第一层专家计算后的激活与 MXFP8 量化融合再直接进入第二层矩阵计算在兼顾关键模块精度的同时减少独立量化 Kernel 和阶段间同步。并行布局优化: FlashComm1 降低冗余计算vLLM Ascend 针对 K3 多模态输入从全局 Embedding 切换到 TP 分片布局的特点对 FlashComm1 执行路径进行了模型级适配。vLLM Ascend 将布局转换前移到第一层解码器边界一次完成Token 分片和通信编排后续 KDA / MLA 仅在确实需要完整序列的位置集中执行 All-Gather避免多次数据收集及其带来的冗余处理。同时vLLM Ascend 进一步打通 FlashComm1 与 Shared Expert DP、TP Shard 的布局语义使视觉、注意力和专家计算沿用一致的分片方式减少中间张量搬运和多种并行策略组合下的同步开销。投机推理: SGLang 支持 DSpark 投机推理能力SGLang 在继承原有特性外与 SGL 社区同步发布 Kimi K3 DSpark 投机推理能力。DSpark 算法在一个月前正式公开亮相通过分层草稿生成降低自回归推理单次生成开销。本次 SGLang 在 Kimi K3 Day0 支持中创新性引入该算法解决模型没有原生投机权重的问题全面提升昇腾上 decode 阶段的推理性能至 TPOT 50ms。3. Kimi K3 推理部署指导用户及开发者可访问以下链接获取 Kimi K3 基于昇腾的部署指导vLLM Ascendhttps://docs.vllm.ai/projects/ascend/en/v0.23.0/tutorials/models/Kimi-K3.htmlSGLanghttps://github.com/sgl-project/sglang/issues/32519欢迎体验无论你是高校科研人员、AI 算法工程师还是开源大模型爱好者都可以前往魔乐社区一键获取 Kimi K3 完整开源权重。除了下载与体验我们也欢迎你在社区分享部署实践、性能测试、量化方案和调优经验交流 Kimi K3 的微调方法、国产算力适配心得及行业落地案例与更多开发者共同推动国产大模型与国产算力生态繁荣发展。立即前往魔乐社区获取 Kimi K3 完整开源权重https://modelers.cn/models/moonshotai/Kimi-K3https://modelers.cn/models/Eco-Tech/Kimi-K3-w4a8