Grok 4.5:专为工程智能而生的高效模型
摘要
Grok 4.5正式发布 SpaceXAI正式推出全新旗舰模型Grok 4.5。该模型聚焦编码能力与智能体协同,从设计之初就围绕真实工程场景展开优化。 性能表现:稳居第一梯队 在多个权威工程基准测试中,Grok 4.5展现出均衡而扎实...
Grok 4.5正式发布
SpaceXAI正式推出全新旗舰模型Grok 4.5。该模型聚焦编码能力与智能体协同,从设计之初就围绕真实工程场景展开优化。
性能表现:稳居第一梯队
在多个权威工程基准测试中,Grok 4.5展现出均衡而扎实的能力:
SWE Bench Pro 达到64.7%,略高于Opus 4.7(64.3%),并反超GPT-5.5(58.6%);
Terminal Bench 2.1 取得83.3%,与GPT-5.5(83.4%)仅差0.1个百分点;
DeepSWE 1.0 得分为62.0%,显著领先Opus 4.8(55.75%),逼近GPT-5.5(64.31%);
AAAI官方榜单中位列第四;Harvey法律智能体测试中排名第一。
训练方法:数据驱动 + 智能体共生
Grok 4.5基于V9架构(参数量1.5T),训练过程中引入大量真实开发者行为数据,重点来自长期积累的代码交互日志。这些数据不是静态代码片段,而是包含上下文、调试过程、工具调用和多步协作的真实轨迹。
训练策略强调「单Token智能度」——即每个输出Token承载更高信息密度与决策价值。整个训练栈支持高度异步运行,允许智能体在长时间任务中持续执行并同步反馈,使模型具备处理数小时级复杂工程任务的能力。
效率优势:快、省、实
推理速度达80 TPS,官方称其“比flash类模型更快”;
在SWE Bench Pro任务中,平均仅需15,954个Token即可完成,而Opus 4.8需67,020个Token,效率提升达4.2倍;
定价方面:输入$2/百万Token,输出$6/百万Token;另有高性能版本,输入$4/输出$18,远低于同类高端模型的普遍报价。
能力实测:面向真实开发场景
用户实测显示,Grok 4.5可在单HTML文件中生成完整SaaS页面;一分钟内完成含2D+3D元素的设计方案;亦有开发者利用它快速构建功能完备的小型游戏。
部分反馈指出,在特定视觉化任务(如熔岩灯模拟)中效果尚不理想,表明其强项仍集中于逻辑性、结构化与工程导向任务。
未来演进:闭环打磨,持续跃迁
官方确认,下月将发布重大升级版本。此次迭代将深度结合特斯拉、SpaceX、Neuralink及Boring Company内部真实工程问题,在闭环环境中持续验证与优化模型能力。
更大规模版本已在规划中,参数量目标指向2万亿级别,但当前重心明确落在实用性、响应效率与部署成本的系统性平衡上。
评论 (12)
训练用真实开发者数据,这能让模型更贴合实际工程场景。
推理速度快,完成任务用的Token少,开发效率能大大提高。
特定视觉任务不行,说明模型有短板,还得继续改进。
规划2万亿参数量版本,野心不小,就看能不能实现平衡了。
这模型性能挺牛啊,多个测试都排前面,训练方法也独特,未来升级说不定更厉害。
下月升级结合内部问题,能让模型更适应实际需求。
实测能快速完成很多开发任务,不过特定视觉任务效果不好,还得再完善。
下月要重大升级,结合内部工程问题优化,看来后续提升空间很大。
效率优势明显,推理快还省Token,价格也低,开发者用着应该挺划算。
Grok 4.5编码能力强,智能体协同也不错,在工程领域能发挥大作用。
性能比Opus和GPT部分测试还好,有点厉害,不知道实际应用咋样。
规划更大规模版本,但先平衡实用性等方面,这思路挺务实的。