摘要
7月28日,月之暗面发布Kimi K3模型权重和技术报告,并开源三大关键Infra技术:MoonEP、FlashKDA和AgentEnv。Kimi K3拥有2.8万亿参数,采用混合专家(MoE)架构,支持原生视觉理解和100万token上下文窗口。凭借Kimi Delta Attention、Attention Residuals及MoonEP等技术创新,规模化效率提升2.5倍。目前,每个人均可下载部署Kimi K3模型。MoonEP是专为超细粒度MoE打造的高性能通信库;FlashKDA是Kimi Delta Attention的高性能算子,在H20上prefill速度提升1.72-2.22倍;AgentEnv是与KVCache.ai合作的沙箱系统,为后训练提供高保真强隔离沙箱。
月之暗面开源Kimi K3模型权重及技术报告,公布三大关键Infra技术
新浪科技讯 7月28日上午消息,昨晚间,月之暗面发布Kimi K3模型权重、技术报告,并开源支撑Kimi K3模型训练的关键Infra技术:MoonEP、FlashKDA和AgentEnv。
Kimi K3是一个拥有2.8万亿参数的混合专家(MoE)模型,具备原生视觉理解能力,并支持100万token的上下文窗口,其参数规模是Kimi K2.5的3倍左右,在并不宽裕的算力条件下,凭借Kimi Delta Attention、Attention Residuals以及MoonEP等一系列技术创新,规模化效率提升了2.5倍。
目前,每个人都可以下载并部署Kimi K3模型——无论是用于内部研发,还是嵌入到面向终端用户的产品中,均可自由使用。
据悉,支撑Kimi K3训练效率与稳定性的关键技术有三项:MoonEP、FlashKDA和AgentEnv。此前,月之暗面已开源FlashKDA,MoonEP和AgentEnv则随本次发布正式开源。
MoonEP是为超大的细粒度MoE打造的高性能通信库,让专家并行(expert-parallel)的通信在不均衡的情况下仍然实现极致效率。
FlashKDA是Kimi Delta Attention高性能算子(kernel)。在英伟达H20上,相比flash-linear-attention基线,它的prefill速度提升1.72-2.22倍,可以直接作为flash-linear-attention的替换后端。
AgentENV是月之暗面与KVCache.ai合作开发的沙箱系统,用于大规模运行Agent环境。它为Kimi K3的后训练提供高保真、强隔离沙箱,灵活支持快速快照、恢复和分叉(fork)等,可以应对大规模并行的Agent工作流与训练任务。(文猛)