SOURCE // NEWS

2.8万亿参数巨兽!Kimi K3开源模型AWS部署实战指南

2.8万亿参数巨兽!Kimi K3开源模型AWS部署实战指南

开源模型的能力已经强大到足以处理复杂的多步 Agent 工作流、高级推理和长上下文编程。然而,随着模型能力的提升,其参数量也急剧膨胀,托管多万亿参数架构需要专门构建的基础设施、高端 GPU 计算和优化的推理框架。2026年7月27日,月之暗面(Moonshot AI)发布了 Kimi K3,这是一个拥有 2.8万亿参数的混合专家(MoE)模型,也是首个达到3万亿参数级别的开源模型。#Kimi K3 在提供前沿级智能的同时公开了权重,使企业能够在自己的基础设施上自主托管当今最强大的模型之一。本文将介绍如何使用 Amazon #SageMaker HyperPodAmazon EKSAWS 上部署 Kimi K3。

Kimi K3 建立在独特的技术架构之上,采用了 Kimi Delta Attention (KDA)、门控多头潜在注意力机制 (MLA) 以及稳定的潜在混合专家框架(Stable LatentMoE)。该模型将 2.8 万亿个参数分布在 896个专家中,每个 Token 仅激活其中 16 个。这意味着在单次前向传播中,仅有约 1040亿个激活参数,相比其前代产品 Kimi K2,其扩展效率提升了 2.5倍。此外,Kimi K3 拥有高达 100万 Token 的超长上下文窗口,原生支持多模态输入(文本+视觉),并具备强大的原生工具调用、结构化输出以及多步问题求解的持续思考模式。

目前,Kimi K3 的开源权重已托管于 Hugging Face(标识符为 moonshotai/Kimi-K3)。为了平衡大模型部署时的生成质量与显存效率,官方权重采用了 MXFP4(4位微缩放浮点)格式。鉴于该模型的庞大规模,运行 Kimi K3 需要专用的推理容器。目前,vLLM 针对 Kimi K3 的专项提交已集成在 #vllm/vllm-openai:kimi-k3 镜像中,后续将合并至 vLLM 主分支。vLLM 提供了对 MoE 架构、张量并行(Tensor Parallelism)以及 MXFP4 量化格式的原生支持。

AgentUpdate 深度解析

Kimi K3 的开源及 AWS 部署方案,代表着超大规模 MoE 模型走向企业私有化部署的分水岭。相较于 Llama 3.1 405B 等传统密集型大模型,Kimi K3 凭借 2.8T 的超大体量和稀疏激活架构,在保持高吞吐的同时,为复杂 AI Agent 提供了前所未有的推理深度。其独特的 MLA 架构与 1M 长度的上下文,能完美承载多 Agent 协同中的冗长历史记忆与复杂工具链调用。结合 vLLMMXFP4 极高压缩比的量化技术,企业用户终于可以在弹性算力云端,以相对经济的成本,构建出具备“慢思考”能力的自主 Agent。这一生态演进,将加速 AI Agent 从简单的聊天助手,真正转变为能解决行业核心痛点的智能实体。