风险提示:理性看待区块链,提高风险意识!
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

Grok 4.5:专为工程智能而生的高效模型

摘要

Grok 4.5正式发布 SpaceXAI正式推出全新旗舰模型Grok 4.5。该模型聚焦编码能力与智能体协同,从设计之初就围绕真实工程场景展开优化。 性能表现:稳居第一梯队 在多个权威工程基准测试中,Grok 4.5展现出均衡而扎实...

Grok 4.5:专为工程智能而生的高效模型

Grok 4.5正式发布

SpaceXAI正式推出全新旗舰模型Grok 4.5。该模型聚焦编码能力与智能体协同,从设计之初就围绕真实工程场景展开优化。

性能表现:稳居第一梯队

在多个权威工程基准测试中,Grok 4.5展现出均衡而扎实的能力:

SWE Bench Pro 达到64.7%,略高于Opus 4.7(64.3%),并反超GPT-5.5(58.6%);

Terminal Bench 2.1 取得83.3%,与GPT-5.5(83.4%)仅差0.1个百分点;

DeepSWE 1.0 得分为62.0%,显著领先Opus 4.8(55.75%),逼近GPT-5.5(64.31%);

AAAI官方榜单中位列第四;Harvey法律智能体测试中排名第一。

训练方法:数据驱动 + 智能体共生

Grok 4.5基于V9架构(参数量1.5T),训练过程中引入大量真实开发者行为数据,重点来自长期积累的代码交互日志。这些数据不是静态代码片段,而是包含上下文、调试过程、工具调用和多步协作的真实轨迹。

训练策略强调「单Token智能度」——即每个输出Token承载更高信息密度与决策价值。整个训练栈支持高度异步运行,允许智能体在长时间任务中持续执行并同步反馈,使模型具备处理数小时级复杂工程任务的能力。

效率优势:快、省、实

推理速度达80 TPS,官方称其“比flash类模型更快”;

在SWE Bench Pro任务中,平均仅需15,954个Token即可完成,而Opus 4.8需67,020个Token,效率提升达4.2倍;

定价方面:输入$2/百万Token,输出$6/百万Token;另有高性能版本,输入$4/输出$18,远低于同类高端模型的普遍报价。

能力实测:面向真实开发场景

用户实测显示,Grok 4.5可在单HTML文件中生成完整SaaS页面;一分钟内完成含2D+3D元素的设计方案;亦有开发者利用它快速构建功能完备的小型游戏。

部分反馈指出,在特定视觉化任务(如熔岩灯模拟)中效果尚不理想,表明其强项仍集中于逻辑性、结构化与工程导向任务。

未来演进:闭环打磨,持续跃迁

官方确认,下月将发布重大升级版本。此次迭代将深度结合特斯拉、SpaceX、Neuralink及Boring Company内部真实工程问题,在闭环环境中持续验证与优化模型能力。

更大规模版本已在规划中,参数量目标指向2万亿级别,但当前重心明确落在实用性、响应效率与部署成本的系统性平衡上。

评论 (12)

登录 后即可发表评论
岁月如诗…

训练用真实开发者数据,这能让模型更贴合实际工程场景。

0 回复
北山
北山 3周前

推理速度快,完成任务用的Token少,开发效率能大大提高。

0 回复
Ryan路客
Ryan路客 3周前

特定视觉任务不行,说明模型有短板,还得继续改进。

0 回复
喔喔刚
喔喔刚 3周前

规划2万亿参数量版本,野心不小,就看能不能实现平衡了。

0 回复
abc369369369

这模型性能挺牛啊,多个测试都排前面,训练方法也独特,未来升级说不定更厉害。

0 回复
更多