亚洲财经

搜索

Kimi K3开放日:模型权重、技术报告和关键Infra技术同步开放

Kimi K3开放日:模型权重、技术报告和关键Infra技术同步开放

今天是 Kimi K3 开放日,我们发布 Kimi K3 的模型权重、技术报告,并开源支撑 Kimi K3 模型训练的关键 Infra 技术:MoonEP、FlashKDA和AgentEnv。希望以此加速前沿智能的部署与普及,促进 AGI 研究。

Kimi K3 权重公布

Kimi K3 是我们能力最强的模型:这是一个拥有 2.8 万亿参数的混合专家(MoE)模型,具备原生视觉理解能力,并支持 100 万 token 的上下文窗口。

Kimi K3 参数规模是 Kimi K2.5 的 3 倍左右,但是规模化并不仅仅是参数的堆叠,在并不宽裕的算力条件下,我们凭借 Kimi Delta Attention、Attention Residuals 以及 MoonEP 等一系列技术创新,规模化效率提升了 2.5 倍(即在算力最优意义下,单位算力产出智能约等于原来 2.5 倍)。

现在,每个人都可以下载并部署 Kimi K3 模型——无论是用于内部研发,还是嵌入到面向终端用户的产品中,均可自由使用(其他使用情形,详见Kimi K3 许可证)。

图片

Kimi K3 技术报告发布

今天,与 Kimi K3 模型权重一起公开的,还有我们的模型训练方法——Kimi K3 技术报告已同步上线。

从技术报告中,你可以了解这些技术细节:

  • KDA + AttnRes:以 3:1 比例混合 KDA 与 Gated MLA,实现高效长上下文建模,并通过块级注意力残差增强跨层信息流动。 

  • Stable LatentMoE:每个 token 从 896 个路由专家中激活 16 个,并通过 SiTU-GLU 与 Quantile Balancing 保持极高稀疏度下的训练稳定。 

  • MoonViT-V2:视觉编码器从零开始使用 next-token prediction 训练,无需对比预训练,在达到 SigLIP 初始化基线效果的同时获得更稳定的优化过程。 

  • 后训练与评估:在通用推理、通用 Agent 和编程 Agent 三大领域进行大规模任务合成,百万 token 上下文的强化学习基建,近 20 个内部评测集的完整评估结果。

以上几点只是概览,详细论述与消融实验,都已在技术报告中展开。

Kimi K3 关键 Infra 技术开源

模型能力背后,离不开训练系统,即 Infra 基础设施层的稳定支撑。今天,我们向大家介绍支撑 Kimi K3 训练的三项 Infra 技术:MoonEP、FlashKDA 和 AgentEnv,覆盖从高性能通信、高性能算子到分布式 RL 环境的关键链路。其中 FlashKDA 此前已开源,MoonEP 和 AgentEnv 则随本次发布正式开源。

  • MoonEP:MoonEP 是我们为超大的细粒度 MoE 打造的高性能通信库,让专家并行(expert-parallel)的通信在不均衡的情况下仍然实现极致效率。

  • FlashKDA:FlashKDA 是我们实现的 Kimi Delta Attention 高性能算子(kernel)。在英伟达 H20 上,相比 flash-linear-attention 基线,它的 prefill 速度提升 1.72-2.22 倍,可以直接作为 flash-linear-attention 的替换后端。 

  • AgentEnv:AgentENV 是我们与 KVCache.ai 合作开发的沙箱系统,用于大规模运行 Agent 环境。它为 Kimi K3 的后训练提供高保真、强隔离沙箱,灵活支持快速快照、恢复和分叉(fork)等,可以应对大规模并行的 Agent 工作流与训练任务。

这三项技术是支撑 Kimi K3 训练效率与稳定性的关键。现在将它们开放出来,希望也能为你训练下一代模型提供帮助。

为什么我们选择开放

我们坚信开放权重模型的价值。它们能降低获取智能的门槛,推动创新,并赋予用户对数据更大的控制权、隐私保护和所有权。在过去几周里,我们很高兴听到了许多来自 AI 社区,以及与我们有着共同愿景的技术领袖的支持声音。

我们相信,对于 AGI 这样具有深远影响的技术,一个广泛、开放的生态系统是最适合承载它的土壤。为此,我们将继续贡献自己的力量。

本文来源:月之暗面Kimi

风险提示及免责条款
市场有风险,投资需谨慎。本文不构成个人投资建议,也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资,责任自负。

资讯来源:月之暗面Kimi