K3:中国开源模型的第三次冲击波

0 次阅读 2026年07月17日
7月16日晚,月之暗面发布K3 2.8万亿参数,Frontend Code Arena得分1679,登顶榜首。此前K2.6位列第18,此次跃升17位;在7个前端细分任务中,6项排名第一。完整模型权重将于7月27日开源。 坦诚即锋芒 官方博客未回避差距:“整体表现仍落后于最强的闭源模型Claude Fable 5和GPT-5.6 Sol”,但强调——“在整套评测中展现出前沿水平的能力,并稳定超过其他所有模型”。这种不包装、不夸大、锚定具体能力边界的表达,在国产大模型发布中尤为少见。它不宣称全能,只说清一件事:在编程这一核心战场,K3已站到最前列。 全球开发者的即时反应 消息发布后,X平台迅速形成讨论热潮。海外开发者未止步于围观,而是直接将其投入真实工程场景测试。 Vercel CEO Guillermo Rauch用nextjs.org全栈项目实测,结论明确:K3在真实Web工程交付能力上领先Claude Fable 5,是首个在该维度超越全部专有模型的开放权重模型。他同时指出:榜单无法覆盖全部现实复杂度,即便是最强模型,任务完成率也远未达100%。 Arena.ai数据显示:K3以1679分位居Frontend Code Arena榜首;Artificial Analysis独立评测给出综合指数57,与Claude Opus 4.8、GPT-5.5接近;AutomationBench-AA得分53%,位居第一;长程知识工作Elo达1547,仅次于Fable 5;单次任务成本约0.94美元,低于Opus 4.8。 理性声音同步浮现 Simon Willison用经典鹈鹕SVG测试发现:K3图像理解能力显著提升,但一次简单任务消耗超1.6万输出Token,其中推理Token占比高达1.32万,对应成本约0.25美元。推理链过长、Token效率偏低,成为当前明显瓶颈。 Ivan Fioravanti在两项真实UI构建项目中肯定其指令遵循能力与响应速度,但也指出模型存在“主动扩展任务边界”的倾向——它不满足于用户明确划定的范围,有时会自行加戏、补充非必要逻辑。 Bindu Reddy提醒:榜单成绩需经更抗污染的测试验证;当前尚不能等同Opus级模型,尤其在长上下文理解、多轮深度交互及复杂Agent循环中仍有可观差距。 antirez将K3置于开放模型演进脉络中看待:它是快速进步的缩影,但最终价值必须由长期、真实的落地结果来检验。 三次冲击,三条路径 中国开源模型对全球AI格局的冲击,已历三次跃迁: 第一次是DeepSeek R1——以极致性价比证明“能便宜”:有限算力下达成顶尖性能,让全球开发者真正用得起; 第二次是GLM系列——以商业闭环证明“能赚钱”:ARR半年从1亿飙升至10亿,Code Arena盲测登顶,验证可持续变现能力; 第三次是K3——以参数规模、技术纵深与全球声量同步突破,证明“能贵得有道理”:2.8T参数、自研KDA混合线性注意力+Attention Residuals架构、MoE稀疏激活(896专家中仅激活16个),扩展效率提升约2.5倍。 这不是突兀亮相,而是连续演进的结果。过去12个月,9个月的开源模型参数上限由Kimi保持;K3是这条技术路线的自然抵达。 开源,是标准,不是入口 7月27日开源完整权重,但对绝大多数开发者而言,本地部署仍不现实——即使量化后,仍需多张高端显卡协同。所谓“开源”,本质是一份高规格的行业参考规范,而非开箱即用的工具包。 它承担着三重功能:确立技术标杆、建立开发者心智、降低生态接入门槛。将KDA贡献至vLLM社区,正是为未来API服务铺路——你看得懂,学得会,但跑不动;最终,流量仍导向可控的服务接口。 K3的“性格”:重交付,轻节制 它默认选择充分推理换取结果质量,而非追求响应速度或Token节省。Fioravanti观察到其“思考投入多、偶有越界”;Willison的量化实测则揭示:简单任务亦消耗大量推理Token,停止条件策略尚未收敛。 这并非缺陷,而是设计取向:K3面向的是愿为高质量交付支付溢价的企业级开发者,而非追求极致性价比的个人用户。其API定价——输出15美元/百万token、未命中输入3美元/百万token——远高于国产同行,但第三方测算显示,其实际单位任务成本仅为Claude Fable 5的四分之一。贵,是相对于本土模型;而在全球旗舰梯队中,它仍属高端性价比之选。 局部领先,全局追赶 官方坦承差距,业界共识清晰:K3在前端编程、自动化脚本、视觉化交付等任务上表现惊艳;但在复杂统计推断、超长上下文连贯性、多跳Agent决策循环等场景中,仍有明显代差。 它不是一个稳妥的通用聊天助手,而更接近一个主动型Agent:倾向执行、擅长产出可视化结果、需要人工校验终止时机。它的优势不在“万能”,而在“敢做、能成、做得像样”。 小小震撼,刚刚好 K3没有宣称全面超越,只是在一个关键切口上,稳稳坐到了第一排。X上的热议、Rauch的背书、外媒称其为“下一个DeepSeek时刻”,这些反馈本身说明:全球AI从业者正重新校准对中国开源模型的认知坐标。 有震撼,也有局限;有领先,也有待补足。这种克制的真实感,比任何“全面碾压”的叙事都更具力量——因为它指向的不是终点,而是中国AI开源力量真正开始参与定义标准的起点。

(5)

7丶
7丶 1周前

K3参数和排名提升明显,还开源,厉害啊,但推理成本高、有扩展任务边界问题,得改进。

0
余生录
余生录 1周前

中国开源模型三次冲击路径清晰,K3这次有突破,就是本地部署难。

0
黑暗中的四爷

K3适合企业开发者,虽贵但性价比还行,在前端编程表现好。

0
爱吃
爱吃 1周前

K3这成绩不错,不过和最强闭源比还有差距,还得继续追赶。

0
什邡回收旧衣服管师

K3有优势也有局限,能让全球重新认识中国开源模型,是个好开始。

0

新西兰发放近海油气勘探许可

新西兰政府29日授予一家私营企业许可证,允许后者在塔拉纳基盆地近海区域展开12年期的石油勘探,为去年解除相关禁令以来首例。

也门胡塞武装拟对途经红海南部的商船征收通行费

市场消息:也门胡塞武装拟对途经红海南部的商船征收通行费。

花旗将迪士尼目标价从145美元下调至135美元。

花旗将迪士尼目标价从145美元下调至135美元。

花旗将Visa目标价从400美元上调至440美元。

花旗将Visa目标价从400美元上调至440美元。

花旗将康宁目标价从240美元下调至220美元。

花旗将康宁目标价从240美元下调至220美元。

国家网信办就《中华人民共和国反网络暴力法(征求意见稿)》公开征求意见

为了预防、制止和惩治网络暴力,加强反网络暴力工作,保护个人、组织的合法权益,维护国家安全和社会公共利益,按照有关立法规划计划安排,国家互联网信息办公室会同有关部门起草了《中华人民共和国反网络暴力法(征求意见稿)》,现向社会公开征求意见。

渤健公司股价在公布第二季度业绩后盘前下跌2.2%。

渤健公司股价在公布第二季度业绩后盘前下跌2.2%。

中国-东盟区域医药交易(集采)平台推动国产手术机器人在越南进入临床使用

国家医保局消息,近期,中国-东盟区域医药交易(集采)平台助力国产手术机器人完成越南产品注册并取得上市许可,在越南部分头部医疗机构完成安装并投入临床应用,实现了国产大型医用设备在越南从产品注册到临床应用的重要突破。同时,还将推动中越双方就机器人手术技术培训、临床应用推广、学术交流、人才培养等方面开展深度合作。

花旗将希捷科技目标价从1240美元上调至1300美元。

花旗将希捷科技目标价从1240美元上调至1300美元。

为了预防、制止和惩治网络暴力,加强反网络暴力工作,保护个人、组织的合法权益,维护国家安全和社会公共利益,按照有关立法规划计划安排,国家互联网信息办公室就《中华人民共和国反网络暴力法(征求意见稿)》公开征求意见。

为了预防、制止和惩治网络暴力,加强反网络暴力工作,保护个人、组织的合法权益,维护国家安全和社会公共利益,按照有关立法规划计划安排,国家互联网信息办公室就《中华人民共和国反网络暴力法(征求意见稿)》公开征求意见。