Kimi K3 正式发布:2.8 万亿参数开源大模型,面向长程智能而生
摘要
犯其至难而图其至远 今天,我们正式推出 Kimi K3 —— 我们迄今能力最强的模型。它不是一次参数堆叠的终点,而是一次系统性突破的起点:以「发之以勇、守之以专、达之以强」为准则,在架构、训练、推理与应用全链路完...
犯其至难而图其至远
今天,我们正式推出 Kimi K3 —— 我们迄今能力最强的模型。它不是一次参数堆叠的终点,而是一次系统性突破的起点:以「发之以勇、守之以专、达之以强」为准则,在架构、训练、推理与应用全链路完成深度重构。
核心能力:2.8 万亿参数,原生多模态,百万级上下文
Kimi K3 是一个 2.8 万亿参数的开源大模型,全球首个达到该量级并完全开源的模型。它原生支持视觉理解,上下文窗口达 100 万 token,专为长程编程、知识工作与复杂推理等前沿智能场景设计。
模型基于两项原创架构技术构建:Kimi Delta Attention(KDA)混合线性注意力机制,以及 Attention Residuals(AttnRes)注意力残差结构。二者协同优化信息在超长序列与深层网络中的流动效率,使模型在万亿级规模下仍保持稳定训练与高效推理。
结构升级:稀疏激活与训练范式革新
Kimi K3 采用 Stable LatentMoE 架构,在 896 个专家中仅动态激活 16 个,兼顾能力与效率。为保障稀疏路由稳定性,我们引入 Quantile Balancing 路由策略与 Per-Head Muon 优化机制;新增 Sigmoid Tanh Unit(SiTU)与 Gated MLA 模块,分别强化激活控制与注意力选择性。
训练层面,从监督微调(SFT)阶段即启用量化感知训练,采用 MXFP4 权重与 MXFP8 激活格式,适配更广泛硬件部署;同时设计完全均衡的专家并行方案,消除负载不均瓶颈,关键路径无需主机同步,显著提升吞吐。
长程编程:从单点生成到系统级构建
Kimi K3 具备持续数小时乃至数日的工程级编码能力。它可自主理解大型代码库、协调终端工具、结合截图反馈迭代优化,在游戏开发、前端工程与 CAD 场景中实现视觉闭环(vision in the loop)。
在内核优化竞技场中,Kimi K3 在 NVIDIA H200 与国产 GPU 平台上,独立完成 Attention Residuals、KDA 线性注意力及自研 MLA 内核的分析、重写与验证,表现接近当前最强闭源模型 Fable-5(含回退机制),显著领先其他主流模型。
更进一步,Kimi K3 从零构建了 MiniTriton —— 一套完整可用的 GPU 编译器栈:涵盖 tile 级中间表示、优化 pass、PTX 代码生成,并成功驱动 nanoGPT 训练收敛。这标志着它已超越「写代码」,进入「建系统」的能力层级。
数字创作:3D、芯片、视频,全栈可执行
Kimi K3 将概念、图像、视频直接转化为可交互的数字体验。它复刻长征十号火箭发射回收过程、构建 3D 开放世界游戏、实现 GBA 模拟器,甚至完成黑洞卡冈图雅的物理模拟复现。
在芯片设计验证任务中,Kimi K3 基于开源 EDA 工具与 Nangate 45nm 工艺库,连续 48 小时自主运行,完成芯片架构设计、逻辑综合、时序优化与功能仿真:最终芯片面积 4 mm²,集成 146 万个标准单元与 INT4 MAC 阵列,在 100 MHz 下达成时序收敛,解码吞吐超每秒 8700 token。这是模型为自己打造的「第一颗芯片」,也是长程 Agent 能力的实体印证。
科研与知识工作:端到端闭环落地
Kimi K3 可打通科学文献与可执行代码,自主完成研究全流程。例如,在复现天体物理 I-Love-Q 关系任务中,它两小时内完成通常需资深研究员一至两周的工作:交叉验证 20+ 篇论文、实现数值流程、评估 300+ 种状态方程、发现已有公式矛盾、生成 3000+ 行 Python 代码,并输出交互式 HTML 仪表盘。
在真实知识工作流中,Kimi K3(max 模式)展现出稳定优势:覆盖 ASIC 行业 42 年演进史的研究报告,经 120+ 轮自我迭代生成;可控核聚变产业分析产出专业级演示文稿与多维图表;对 GWTC-5 中 391 个引力波事件的分析,调用 20+ 并发 subagents,整合十余篇论文,生成 7 张科学可视化图与 2 张结构化表格。
交互升级:小组件与看板,让智能持续可见
Kimi Work 新增小组件(Widgets)与看板(Dashboard)功能。小组件可在对话中即时生成交互式组件,连接本地数据或外部插件,支持持续更新;看板则将高频关注的小组件按主题、项目或目标长期聚合,形成个性化智能工作视图。
视频生成:原生多模态驱动高密度创作
依托统一多模态架构,Kimi K3 可理解文字、图像与视频语义,完成专业级动效设计与剪辑。它曾制作一支 4 分 30 秒的「3Blue1Brown」风格动态图形视频,将 KDA 与 AttnRes 技术原理转化为动画图示;也曾从 56 段原始素材中完成选片、动作匹配、逐帧卡点、音频处理与多轮修改,产出品牌宣传视频——同等质量内容,传统流程需资深剪辑师 1–2 个工作日。
部署与接入:开箱即用,兼顾性能与成本
Kimi K3 已全面上线:可通过 kimi.com、最新版 Kimi 手机 App(iOS/Android/鸿蒙)、Kimi Work 桌面客户端(v3.1.0+)、Kimi Code 终端插件及 Kimi API 直接调用。默认思考强度为 max(极致),后续将开放 low 与 high 两档调节。
API 定价为:输入 2 元/百万 token(命中缓存)、20 元/百万 token(未命中),输出 100 元/百万 token。依托 Mooncake 分离式推理架构,实际缓存率超 90%,等效输入成本仅为标价 1/4。企业用户可开通 Kimi 企业版,享受数据隔离、成员管理与私有化支持;托管 Agent 平台 Kimi Hosted Agent 正在开放 Waitlist 测试。
技术承诺:开源、透明、可验证
完整模型权重将于 2026 年 7 月 27 日前开源。配套技术报告将详述架构设计、训练方法、评测体系与基础设施细节。我们已向 vLLM 社区贡献 KDA 适配的 prefill cache 实现,确保长上下文推理高效稳定。
清醒认知:能力边界与使用建议
1. 历史依赖性强:Kimi K3 后训练全程保留思考历史。若 Agent 框架未完整回传历史,或中途切换模型,可能引发上下文干扰。建议使用 Kimi Code 等已验证兼容框架,避免会话中临时切换。
2. 主动性强,需明确约束:为胜任高难长程任务,Kimi K3 在模糊意图下倾向自主决策。如需更强行为边界,请在 system prompt 或 AGENTS.md 中设定具体约束规则。
3. 对标仍在进行中:尽管在多项评测中稳定领先同类开源模型,并逼近最强闭源模型水平,但在部分用户体验维度,与 Claude Fable 5 和 GPT-5.6 Sol 仍有持续追赶空间。
评论 (5)
长程编程和数字创作能力挺牛,不过使用时有不少限制得注意。
这模型参数够大,功能也全,就是开源时间得等2026年,有点久。
API定价看着还行,缓存率高成本能降不少,企业版也有配套服务。
模型架构和训练方法有创新,希望能带来更多突破,就是使用得按规则来。
和最强闭源模型还有差距,还得继续追赶啊。