风险提示:理性看待区块链,提高风险意识!
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

月之暗面发布Kimi K3:2.8万亿参数开源大模型,聚焦智能体编程与长程任务

摘要

全新旗舰模型正式发布 7月16日,月之暗面正式推出新一代开源基础模型Kimi K3。该模型参数规模达2.8万亿,是当前全球公开可获取的参数量最大的开源基础模型。同步上线API服务与完整开发者文档,全面支持私有化部署、...

月之暗面发布Kimi K3:2.8万亿参数开源大模型,聚焦智能体编程与长程任务

全新旗舰模型正式发布

7月16日,月之暗面正式推出新一代开源基础模型Kimi K3。该模型参数规模达2.8万亿,是当前全球公开可获取的参数量最大的开源基础模型。同步上线API服务与完整开发者文档,全面支持私有化部署、二次训练与定制化开发。

技术架构深度升级

Kimi K3专为长程智能体编程与自我演进工作流设计,核心突破在于两项自研技术: Kimi Delta Attention(KDA)混合线性注意力机制,显著优化百万级Token上下文下的信息建模效率; Attention Residuals(AttnRes)结构,在深层网络中强化梯度流动与信息保留,以不到2%的参数增量提升约25%训练效率。 实测显示,KDA在100万Token上下文场景下实现最高6.3倍解码加速。模型原生支持视觉理解能力,无需额外多模态适配即可处理图文混合输入。

面向真实任务的智能体能力

Kimi K3不再停留于单轮问答,而是系统性强化“完成任务”的闭环能力: 可理解大型代码库结构,自主规划开发路径; 支持工具调用、测试执行、运行日志解析与反馈驱动的方案迭代; 在游戏开发、前端工程、CAD辅助设计、基础设施优化等长周期软件工程场景中,能融合代码、日志、测试结果与界面截图进行综合决策。 模型采用高稀疏度MoE架构,共896个专家模块,单次推理仅激活16个,兼顾容量扩展与计算可控性。

实测性能进入全球第一梯队

在多项权威评测中,Kimi K3表现突出: GDPval-AA v2知识工作评测得1687分,超越Claude Opus 4.8 Max(1600分),仅次于Claude Fable 5 Max与GPT-5.6 Sol Max; AA-Briefcase智能体知识工作测试得1527分,排名第二,领先GPT-5.6 Sol Max; BrowseComp长上下文检索测试得分91.2,依托100万Token原生窗口,无需压缩即可完成复杂信息定位任务。 开发者实测反馈,在连续编程、多步骤Agent任务与跨工具协同场景中,Kimi K3展现出接近顶级闭源模型的自主规划与执行稳定性,被部分用户称为具备“Fable级体感”。

开源路线:构建可持续的开发者生态

Kimi K3坚持开放权重策略,允许全球开发者自由下载、本地部署、微调与商用。这一选择并非仅关乎技术透明,更是对AI基础设施演进路径的主动定义: 降低企业AI应用门槛,尤其适配对数据隐私、响应延迟与成本敏感的场景; 推动Agent框架、工具链、评估标准等配套生态共建; 与DeepSeek、智谱等国内开源力量形成协同势能,加速中国AI底层能力向产业纵深渗透。

竞争范式正在迁移

当美国头部厂商持续提高API定价(如Anthropic计划9月起将Claude Opus 4.8输出价格升至每百万15美元),中国开源模型正以更低推理成本(K2.6已约为Opus 4.8的三分之一)、更灵活部署方式与更强任务闭环能力,重塑全球AI价值坐标。 性能差距持续收窄,而开放生态的构建速度、开发者采纳深度与垂直场景落地密度,正成为衡量AI竞争力的新标尺。Kimi K3的发布,标志着中国大模型已从追赶者角色,转向在智能体范式、开源协作与工程化落地层面发起系统性竞逐。

评论 (10)

登录 后即可发表评论
嗯呢呗
嗯呢呗 2周前

开源好啊,降低企业应用门槛,还能推动配套生态共建,对行业发展有好处。

0 回复
顿顿不能少

面向真实任务能力强是真的,在长周期软件工程场景能综合决策,以后开发工作估计更高效了。

0 回复
M轩.¢
M轩.¢ 2周前

新模型发布,竞争范式迁移,中国大模型发展势头很猛。

0 回复
周小顺
周小顺 2周前

这模型可以啊,参数大还开源,而且实测性能进全球第一梯队了,以后在实际应用里估计能发挥不小作用。

0 回复
那个傻狗

实测性能排名不错,开发者反馈也挺好,这模型实用性应该挺高。

0 回复
更多