风险提示:理性看待区块链,提高风险意识!
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

Kimi K3开放日:模型权重、技术报告和关键Infra技术同步开放

摘要

今天是 Kimi K3 开放日,我们发布 Kimi K3 的模型权重、技术报告,并开源支撑 Kimi K3 模型训练的关键 Infra 技术:MoonEP、FlashKDA和AgentEnv。希望以此加速前沿智能的部署与普及,促进 AGI 研究。 Kimi K3 权重公...

Kimi K3开放日:模型权重、技术报告和关键Infra技术同步开放

今天是 Kimi K3 开放日,我们发布 Kimi K3 的模型权重、技术报告,并开源支撑 Kimi K3 模型训练的关键 Infra 技术:MoonEP、FlashKDA和AgentEnv。希望以此加速前沿智能的部署与普及,促进 AGI 研究。

Kimi K3 权重公布

Kimi K3 是我们能力最强的模型:这是一个拥有 2.8 万亿参数的混合专家(MoE)模型,具备原生视觉理解能力,并支持 100 万 token 的上下文窗口。

Kimi K3 参数规模是 Kimi K2.5 的 3 倍左右,但是规模化并不仅仅是参数的堆叠,在并不宽裕的算力条件下,我们凭借 Kimi Delta Attention、Attention Residuals 以及 MoonEP 等一系列技术创新,规模化效率提升了 2.5 倍(即在算力最优意义下,单位算力产出智能约等于原来 2.5 倍)。

现在,每个人都可以下载并部署 Kimi K3 模型——无论是用于内部研发,还是嵌入到面向终端用户的产品中,均可自由使用(其他使用情形,详见Kimi K3 许可证)。

图片

Kimi K3 技术报告发布

今天,与 Kimi K3 模型权重一起公开的,还有我们的模型训练方法——Kimi K3 技术报告已同步上线。

从技术报告中,你可以了解这些技术细节:

  • KDA + AttnRes:以 3:1 比例混合 KDA 与 Gated MLA,实现高效长上下文建模,并通过块级注意力残差增强跨层信息流动。 

  • Stable LatentMoE:每个 token 从 896 个路由专家中激活 16 个,并通过 SiTU-GLU 与 Quantile Balancing 保持极高稀疏度下的训练稳定。 

  • MoonViT-V2:视觉编码器从零开始使用 next-token prediction 训练,无需对比预训练,在达到 SigLIP 初始化基线效果的同时获得更稳定的优化过程。 

  • 后训练与评估:在通用推理、通用 Agent 和编程 Agent 三大领域进行大规模任务合成,百万 token 上下文的强化学习基建,近 20 个内部评测集的完整评估结果。

以上几点只是概览,详细论述与消融实验,都已在技术报告中展开。

Kimi K3 关键 Infra 技术开源

模型能力背后,离不开训练系统,即 Infra 基础设施层的稳定支撑。今天,我们向大家介绍支撑 Kimi K3 训练的三项 Infra 技术:MoonEP、FlashKDA 和 AgentEnv,覆盖从高性能通信、高性能算子到分布式 RL 环境的关键链路。其中 FlashKDA 此前已开源,MoonEP 和 AgentEnv 则随本次发布正式开源。

  • MoonEP:MoonEP 是我们为超大的细粒度 MoE 打造的高性能通信库,让专家并行(expert-parallel)的通信在不均衡的情况下仍然实现极致效率。

  • FlashKDA:FlashKDA 是我们实现的 Kimi Delta Attention 高性能算子(kernel)。在英伟达 H20 上,相比 flash-linear-attention 基线,它的 prefill 速度提升 1.72-2.22 倍,可以直接作为 flash-linear-attention 的替换后端。 

  • AgentEnv:AgentENV 是我们与 KVCache.ai 合作开发的沙箱系统,用于大规模运行 Agent 环境。它为 Kimi K3 的后训练提供高保真、强隔离沙箱,灵活支持快速快照、恢复和分叉(fork)等,可以应对大规模并行的 Agent 工作流与训练任务。

这三项技术是支撑 Kimi K3 训练效率与稳定性的关键。现在将它们开放出来,希望也能为你训练下一代模型提供帮助。

为什么我们选择开放

我们坚信开放权重模型的价值。它们能降低获取智能的门槛,推动创新,并赋予用户对数据更大的控制权、隐私保护和所有权。在过去几周里,我们很高兴听到了许多来自 AI 社区,以及与我们有着共同愿景的技术领袖的支持声音。

我们相信,对于 AGI 这样具有深远影响的技术,一个广泛、开放的生态系统是最适合承载它的土壤。为此,我们将继续贡献自己的力量。

本文来源:月之暗面Kimi

评论 (5)

登录 后即可发表评论
阿潘要减肥

开放权重模型能降低门槛挺好,就看后面生态能不能发展起来了。

0 回复
9527报道
9527报道 4天前

2.8万亿参数还支持大上下文窗口,Kimi K3能力挺强,开放后应用场景应该挺多。

0 回复
@落花
@落花 4天前

直接把核心的东西都开放了,这魄力挺大,感觉能促进不少研究,估计后面有不少基于这模型的创新。

0 回复
别问我是谁

参数规模大还能提升效率,技术有点东西,这开放对小团队搞研发是个好机会。

0 回复
趁早
趁早 4天前

技术报告细节不少,开源的Infra技术也很关键,就是不知道实际用起来咋样。

0 回复
更多