web3: 阿里发布开源模型Qwen3.8-Max
摘要
阿里巴巴发布了 Qwen3.8-Max,并称这是公司迄今能力最强的模型。该模型将于下周登陆 Hugging Face 和 ModelScope,这也是 Qwen 系列首次开放 Max 级模型权重。首次开放Max级权重按照阿里披露的数据,Qwen3.8-Max 总...
阿里巴巴发布了 Qwen3.8-Max,并称这是公司迄今能力最强的模型。该模型将于下周登陆 Hugging Face 和 ModelScope,这也是 Qwen 系列首次开放 Max 级模型权重。
首次开放Max级权重
按照阿里披露的数据,Qwen3.8-Max 总参数量为 2.4 万亿,但每次推理仅激活 950 亿参数。这种设计意味着模型不需要在每次运行时调动全部参数,有助于降低算力消耗和部署成本。
这也让具备一定硬件条件的企业和研究团队,更容易自行部署高性能模型,而不必完全依赖大型云数据中心。
重点不在跑分而在持续执行
与常见的模型发布方式不同,阿里这次没有把重点放在单次基准测试成绩上,而是强调模型在长时间任务中的表现。
阿里称,Qwen3.8-Max 曾连续 16 天自主构建一款编程工具,期间完成 265 次代码提交、127 个拉取请求和 151 个问题处理,过程中没有人工直接操作键盘。
在另一项测试中,该模型用 5 天时间复现一篇此前未见过代码的研究论文,最终成绩比原论文结果高出 2.7 分。阿里还称,在一场持续 24 小时的机器学习竞赛中,该模型成绩超过 526 支人类队伍中的 458 支。
兼容Claude Code和Codex
Qwen3.8-Max 同时提供了接入 Anthropic 的 Claude Code 和 OpenAI 的 Codex 的使用说明。阿里表示,其 API 兼容这两家公司的协议,而多数编程基准测试也是在 Claude Code 环境中完成。
从阿里公布的基准表看,Qwen3.8-Max 并非全面领先。在 31 项文本测试中,Anthropic 的 Fable 5 拿下 15 项第一,OpenAI 的 GPT-5.6 Sol 获得 9 项第一,Qwen3.8-Max 获得 7 项第一。在 12 项编程测试中,Qwen3.8-Max 仅拿到 1 项第一。
不过,文章提到,Qwen3.8-Max 的使用成本明显更低,接近 Claude Fable 5 定价的三成。这意味着即便模型在部分任务中需要更多轮推理,整体完成任务的成本仍可能更低。
开源分发成为竞争重点
这一发布也显示出阿里策略出现变化。此前在今年 4 月,阿里取消了 Qwen Code 的免费层,外界一度认为团队正转向更封闭、付费的模型路线。如今开放 Max 级权重,意味着这一方向出现调整。
文章援引 OpenRouter 数据称,中国开源权重模型在平台 token 使用占比,已从 2024 年底不足 2% 升至 2026 年中约 61%。Qwen 也已超过 Meta 的 Llama,成为全球自托管最广泛的模型。
与此同时,美国今年 6 月对部分先进模型实施出口限制,报道还提到,中国监管层也在评估对本土模型出海设置限制。在这一背景下,阿里选择开放高规格模型,显然也在争取更广泛的开发者分发渠道。
评论 (9)
这模型降低算力消耗和部署成本,中小企业也能用了,挺不错。
不看重跑分看重长时间任务表现,思路挺新颖,不知道实际效果咋样。
阿里策略转变了,开放 Max 级权重,是想争取更多开发者吧。
Qwen3.8 - Max 连续 16 天自主构建编程工具,这能力有点厉害。
中国开源权重模型发展挺快,Qwen 成全球自托管最广泛的模型了。
API 兼容别家协议,方便使用,对开发者友好。
美国和中国都有相关限制,阿里开放模型也是为应对这种情况吧。
虽然不是全面领先,但使用成本低,整体完成任务成本可能更低,有竞争力。
在编程测试中拿第一的项不多,还得继续提升编程方面能力。