风险提示:理性看待区块链,提高风险意识!
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

Grok 4.5正式发布:1.5T MoE模型,聚焦编程与Agent效率革命

摘要

马斯克兑现承诺,Grok 4.5如期而至 xAI于2026年首月正式发布Grok 4.5,这是继Grok 4.3之后的重大升级,也是xAI整合Cursor技术能力后的首款旗舰模型。该模型并非简单参数堆叠,而是围绕真实知识工作流重构训练范式,...

Grok 4.5正式发布:1.5T MoE模型,聚焦编程与Agent效率革命
马斯克兑现承诺,Grok 4.5如期而至 xAI于2026年首月正式发布Grok 4.5,这是继Grok 4.3之后的重大升级,也是xAI整合Cursor技术能力后的首款旗舰模型。该模型并非简单参数堆叠,而是围绕真实知识工作流重构训练范式,主打「快、灵、省」三大特性——更快的推理速度、更灵活的任务适应性、更低的Token消耗与部署成本。 架构与能力:1.5T MoE,50万上下文,原生支持多模态 Grok 4.5采用混合专家(MoE)架构,总参数量达1.5万亿,相较前代提升约三倍。模型支持最高50万token上下文长度(可动态配置),并原生兼容视觉输入,为复杂文档理解、代码可视化分析及多步Agent任务提供基础支撑。 在编程基准测试中,Grok 4.5已接近当前行业头部水平:DeepSWE Bench 1.0得分83.3%,SWE Bench Pro达64.7%,Terminal Bench 2.1为62%,整体表现逼近GPT-5.5与Claude Opus系列。尤为突出的是,在DeepSWE Bench 1.0上,其成绩已超越Opus 4.8。 效率优先:不是更贵,而是更聪明地用Token Grok 4.5的推理吞吐达80 tokens per second(TPS),进入当前主流大模型第一梯队。API定价为每百万输入tokens 2美元、输出tokens 6美元,较同类旗舰模型低60%以上。在SWE Bench Pro任务中,其Token消耗不足Opus 4.8 Max的四分之一。 这种效率提升源于底层训练逻辑的转变:不再追求单一指标峰值,而是以数十万真实软件工程任务为强化学习目标,要求模型完成多步推理、工具调用、错误恢复与结果验证——即模拟真实开发者闭环工作流。 数据驱动:学的不是代码,而是开发过程 模型融合了源自Cursor平台的数万亿Token高质量交互数据,不仅包含源码,更涵盖开发者与IDE、版本系统、调试器及Agent工具的真实交互轨迹。这些数据经过去重、质量筛选与领域过滤,显著提升单位Token的信息密度。模型学习的不再是静态语法模式,而是完整软件交付链路中的决策逻辑与协作习惯。 实测反馈:从PPT生成到游戏开发,响应即所见 官方演示中,Grok 4.5可自主生成结构清晰的太阳系可视化PPT、具备交互逻辑的天气APP原型,以及带Liquid Glass动效的网页界面。内测用户反馈其在游戏UI生成、粒子效果设计与代码审计等场景中响应迅速、完成度高;有开发者已构建「Grok写代码 + Fable审代码」的新协同工作流。 未完待续:硬件级优化尚未启用 值得注意的是,当前发布的Grok 4.5尚未启用xAI自研的GB300专用C/C++推理栈。马斯克透露,该底层优化上线后,推理速度有望再翻倍甚至更高。这意味着,当前展现的性能只是起点——真正的工程竞争力,正从模型层向系统层延伸。 回归本质:不是对标谁,而是重新定义工作流效率 Grok 4.5不执着于在通用榜单上争夺榜首,而是将算力精准投向编程、Agent执行与知识管理等高频刚需场景。当多数模型仍在比拼「能答多难的问题」,Grok 4.5选择回答「如何用最少资源完成最多真实任务」。这或许正是xAI本轮技术演进的核心逻辑。

评论 (5)

登录 后即可发表评论
阿伟阿
阿伟阿 3周前

编程测试成绩逼近头部水平,还超了Opus 4.8,有点东西。

0 回复
[滨海龙龙]

这升级挺牛啊,参数提升不少,效率还高,成本也低,后续优化后估计更厉害。

0 回复
老胡来了

没启用专用推理栈性能就这么强,启用后不得起飞,值得期待。

0 回复
鼎烽包装袋有限公司

不拼通用榜单,专注刚需场景,这思路挺对,能解决实际问题。

0 回复
黄小草的生活

实测效果不错,能应用到很多场景,新工作流也有了。

0 回复
更多