SpaceX与Cursor联合推出Grok 4.5
北京时间7月9日凌晨,SpaceX旗下AI团队正式发布新一代大模型Grok 4.5。该模型由SpaceX AI部门与AI编程工具公司Cursor协同训练完成,是双方完成整合后的首个联合成果。
训练数据更广,覆盖多类知识工作场景
Grok 4.5的训练数据基础不仅包含Cursor积累的数万亿token开发者交互数据——涵盖真实代码库操作、IDE行为、调试流程及智能体环境响应等——还系统性引入高质量STEM任务样本、学术论文片段及法律、金融等专业领域的结构化文本。团队在数据处理阶段投入大量资源进行去重、质量评分与领域聚焦筛选,确保模型具备跨领域泛化能力与高信噪比输出表现。
不追求参数或榜单第一,专注现实成本效率
Grok 4.5未以“最强性能”为宣传核心,而是明确将性价比作为核心竞争力。其输入成本为每百万token 2美元,输出为6美元;在SWE Bench Pro等典型工程任务中,平均token消耗仅为同类领先模型的约1/4。例如,在相同任务下,Grok 4.5输出约15,954个token,而对标模型需67,020个token。
真实任务成本优势显著
根据第三方基准测试机构Artificial Analysis的评估,Grok 4.5在GDPval任务中的单次执行成本为0.49美元,相较当前排行榜前列模型低近90%。其Elo得分为1543,在真实世界智能体知识工作指数中位列第四,展现出在性能与成本之间优异的帕累托平衡。
面向办公与专业服务的深度适配
Grok 4.5已集成至Grok Build平台并成为默认模型,支持复杂办公场景下的端到端任务执行:可自动构建含多工作表联动与网络数据调用的Excel模型,并添加结构化备注;能在PowerPoint中使用原生形状生成逻辑清晰、视觉一致的图表与5页级业务汇报演示文稿;亦可在Word中撰写条理分明、术语准确的专业文档。
编程能力持续强化,支持零样本端到端开发
在软件工程方向,Grok 4.5对Rust、C/C++等系统级语言任务表现出更强鲁棒性。通过单条自然语言提示,即可完成从需求理解、架构设计、代码生成到可运行验证的全流程。例如输入“用Three.js制作一个带HUD界面、可调节时间与速度的太阳系3D交互模拟”,模型可直接输出完整可部署项目,包含行星轨道计算、实时渲染控制与用户交互逻辑。
安全机制升级,兼顾能力与边界
针对专业应用场景,Grok 4.5增强了网络安全任务支持能力。训练与推理阶段均嵌入多重防护策略,旨在识别潜在恶意意图,保障漏洞挖掘、渗透测试等合法安全工作的开展,同时抑制高风险操作路径的生成与执行。
垂直整合能力构成独特优势
Grok 4.5的落地依托于SpaceX已建成的AI基础设施体系:基于约20万块英伟达GPU构建的Colossus超算集群提供底层算力支撑;Cursor的开发者工具链承担分发与反馈闭环;特斯拉与SpaceX内部工程团队则作为首批高频、严苛的真实用户,持续驱动模型迭代优化。这种从硬件、数据、场景到用户的全栈整合路径,构成了当前主流AI厂商尚未复现的能力结构。
(5)
训练数据广,跨领域泛化能力应该不错,适合多类知识工作场景。
输入输出成本低,token消耗少,确实是主打性价比,值得关注。
能适配办公和专业服务,编程能力也强,还升级了安全机制,挺全面的。
这模型性价比挺高,在真实任务里成本优势明显,看来是走实用路线的,有搞头。
SpaceX和Cursor联合搞的,全栈整合路径独特,其他厂商不好复制。