坏!卖token的核心机密被老马学到了

3 次阅读 2026年07月10日

SpaceXAI 正式发布了Grok 4.5,这是他们收购cursor之后首次发布模型。

SpaceXAI是这样描述的:这是他们第一个专门为coding和agents训练的模型,和Cursor一起训练,已经进入Grok Build、Cursor全部计划和 SpaceXAI console。价格也摆在同一张桌面上:每百万input token 2美元,每百万output token 6美元。

Grok 4.5面向普通用户更全面开放。马斯克在X上煽风,说它是Opus-class model,但更快、更省token、成本更低。

这就有点意思了。硅谷模型发布过去最爱讲的,是前沿能力、智能涌现、推理突破、安全边界。Grok 4.5这一轮最像的反而不是传统硅谷发布会,而是过去一年国内模型厂最熟的那套打法:别先问谁是世界第一,看价格说话。

所谓核心机密,不是低价。

真正要紧的是性价比:一次调用多少钱,缓存命中多少钱,接进工作流以后谁来买单。

坏,GLM和MiniMax们的致富密码,让老马学去了。

便宜不是低端,是入口

中国模型厂过去一年最常被讨论的一件事,就是卖便宜token。

DeepSeek、阿里、百度、字节、腾讯们一轮轮把价格打下来,外界很容易把它理解成低端竞争:你没有最强模型,所以只能靠便宜抢调用量。AI的低频用户的人确实爱这样描述,毕竟他们自己不用花钱。

如果模型只是chatbot,便宜确实不够性感。用户一个月付20美元,如果只是聊聊天当陪玩,确实也没啥用。

但coding agent不是这么卖的。

它进IDE,进terminal。每一次调用背后可能是一个bug、一次review、一次失败重跑,再加上loop,再便宜的单价都会让人肉疼。所以说,没有最便宜,只有更便宜。

既然这个前提确定了,token价格就不是“便宜”两个字,而是入口,是真的让普通人能用起来的可能性。

SpaceXAI官方页很会刺激开发者神经。它在SWE-Bench Pro任务上给了一个token efficiency对比:Grok 4.5平均输出15,954 tokens,对照的Opus 4.8 max是67,020 tokens,少4.2倍。这个数当然来自 SpaceXAI自己发布,不能当第三方终审;但它很准确地暴露了这次发布想让市场记住什么。

图 2:Grok 4.5官方页把token efficiency放到前台。

是agent这个商业形态,把中美模型厂都赶到了同一张价格表前。中国厂只是被价格战提前训练过,老马这次把这套语言讲成了一个硅谷故事。

OpenAI也掀桌了

同一天,OpenAI做了一件看上去很技术、其实很商业的事:它公开审计 SWE-Bench Pro。

先解释下:SWE-Bench Pro是coding agent的考试题库,包含的主要考题更接近真实工程场景的活:给模型一个代码仓库、一个issue或bug描述,让它像工程师一样改代码,再用测试验证到底有没有修好。模型厂说自己的agent会写代码、会修bug、能替工程师干活,很多时候就需要这类榜单来证明。

不过这次有点打脸,OpenAI以前说过,老考卷SWE-Bench Verified已经不好用了,大家应该改用新考卷SWE-Bench Pro。结果现在,它发现新考卷里也有大约三成题目有问题。

OpenAI给出一组数据:在731道公开题里,frontier models的通过率8个月里从23.3%涨到80.3%;自动审查确认200个broken tasks,占 27.4%;人工标注认为249个任务有问题,占34.1%。

这些技术细节不用记太多。所谓“撤回建议”,意思很简单:OpenAI 不再建议大家把SWE-Bench Pro当成可靠标准答案了。

其实核心指向点就一个,OpenAI开始质疑标准,他们认为现在得测评不能代表真实得产出,延伸一步来看,就是现有得测评不能真实反映模型是否经济。

OpenAI有Codex,Anthropic有Claude Code,SpaceXAI有Grok Build和Cursor入口。现在已经不完全是toke单价的竞争时代了,模型大厂们开始考虑以解决项目的能力作为卖点,直接影响企业采购、开发者心智和模型厂定价。

这是更深一层的战场:当benchmark不再可靠,企业会把信任从“榜单分数”搬到“真实工作流验证”。

谁能在真实repo里改bug,谁能接入权限系统,谁能解释失败重跑,谁能把一次agent任务拆成可审计的成本,谁就更有资格说自己的模型能干活。

这里刚好接上“卖token”的主线。

旧benchmark信不过了,企业不会因此停止采购agent。它们会换一种问法:别告诉我你榜单第几,先让我看一个真实任务,跑完到底化了多少钱。

这正是中国模型厂最熟的场景。因为卖token从来不只是卖一串数字,它卖的是可比较、可计费、可复现的工作单位。OpenAI审计SWE-Bench Pro,看起来是在清理评测噪音;放在Grok 4.5发布当天,它也客观上把“真实工作流+价格验证”推到了前台。

但OpenAI自己承认约30% 任务有问题,已经把弹药递到了他手里。

老马最擅长的,不是把复杂机构语言讲完整,而是把它压成X上一句能传播的话。他不需要成为评测裁判,他只要不断提醒开发者:裁判也会出错,真实任务才算数。

图 4:OpenAI官网审计页。它清理的是评测噪音,牵动的是coding agent的商业信用。

IDE变成新的收银台

最总一切都关乎于计费,所以agent时代真正的计费模式不在命中缓存,也不在每百万token价格,而是在IDE里。

开发者每天睁眼打开Cursor,切terminal,刷GitHub,看CI面板到底是绿灯还是红灯。过去模型厂争的是网页入口,后来争手机App,再后来争 API。coding agent出现以后,入口往前挪了一步,挪到了代码被写出来的地方。

Cursor的定价页很直白:个人版每月20美元,Teams每用户每月 40 美元,功能写着Agent requests、frontier models、MCPs、skills、hooks、cloud agents、Bugbot usage-based billing、usage analytics。他正在把模型调用、agent能力、团队权限和使用统计打包成一个开发组织的账单中心。

Claude Code也在做同一件事,只是语气更像企业软件。Anthropic的成本文档不讲“革命”,它告诉你怎么追踪token使用、怎么设spend limits,还给出企业用户平均约13美元/developer/active day、150-250 美元/developer/month的参考区间,90%用户低于30美元/active day。

OpenAI的Codex论文则给了使用形态的另一面:2026年上半年Codex 活跃用户增长超过5倍,超过10%用户每周会管理3个以上并发agents,skills使用率到6月升到26.6%。

综合起来看,计费模式就很明确了。

Cursor证明入口在哪里;Claude Code证明账单怎么管;Codex证明agent正在从单次问答,变成并发任务队列。

Grok 4.5要抢的是Cursor里的默认模型、Grok Build里的agent工作流、开发团队的token预算,以及X时间线上“什么才算真的能干活”的解释权。

这也是为什么“成本”突然变锋利。

如果模型还停在聊天框里,成本只是厂商毛利问题。用户不太关心你推理一次烧多少钱,只关心回答是不是像人。可一旦模型进入IDE,成本就变成产品体验的一部分。上下文长不长、吞吐快不快、失败重跑贵不贵、团队用量能不能管,都会变成开发者每天能摸到的阻力。

便宜当然不是免死金牌。

agent改坏一次生产库,省下的token钱不够赔一次事故复盘。X上转得再欢,企业也不敢只靠这个买单。真正能让开发团队留下来的,是稳定性、权限、安全、上下文管理和可控失败。

所以Grok 4.5这张牌也有风险。

首先,SpaceXAI官方token efficiency数据还需要更多第三方复现。其次,Cursor 入口不等于长期默认,开发者会在真实任务里用脚投票。OpenAI、Anthropic、Google不会把IDE账单中心拱手让人,它们只会更快把cost-per-task、workspace integration和eval governance 写进产品叙事。

但这反而说明,竞争的本质已经变了。

以前模型厂争的是“谁更聪明”。现在它们开始争三个更具体的东西:谁定义能干活,谁占住工作入口,谁收走每一次任务调用的钱。

评测权、入口权、计费权,正在变成同一个战场。

Agent正在告诉所有人,AI是新时代的工位。

一次bug fix,一次PR review,一次CI修复,一次文档生成,一次失败重跑。每个单位都要被验证、被计费、被归因。

接下来1-3个月,真正该看的也不是哪家又刷了一个榜单。而是看谁家的token和agent配合的更加经济。

老马未必学了中国。

但这一次,他确实把中国模型厂最早承认的现实,讲成了一个硅谷故事。

本文来自微信公众号“象先志”,作者:卡古拉,36氪经授权发布。

(5)

用户4897634414198

现在模型厂竞争变了,争定义干活、占入口和收费权,接下来就看谁的token和agent更经济。

0
无人扶我青云志

OpenAI审计评测标准,这是要把竞争引到真实工作场景啊,以后得看谁真能干活。

0
七个
七个 2周前

老马把中国模型厂那套打法讲成硅谷故事,这竞争越来越有意思了,就看谁能在真实工作流里胜出。

0
依然帅气

SpaceXAI发布Grok 4.5用低价打法,不过数据还得第三方验证,开发者会用脚投票的。

0
锦瑟_1
锦瑟_1 2周前

IDE成新收银台,模型成本成体验一部分,Grok 4.5有风险,就看稳定性咋样了。

0

英伟达合作伙伴广达电脑寻求发行全球存托股票筹资不超22亿美元

人工智能服务器制造商广达电脑计划通过发行全球存托股票(GDS)筹资至多21.9亿美元。这家英伟达合作伙伴拟发行4900万份证券,每份发行价介于43.91美元至44.77美元。

澜起科技:首次回购50万股A股股份 支付金额约1.03亿元

澜起科技(688008.SH)公告称,2026年7月29日,公司通过集中竞价交易方式首次回购A股股份50万股,占总股本0.04%,回购金额约1.03亿元,价格区间为192.18元/股至210.00元/股。

北交所、全国股转公司启动全国重点专精特新企业培育专项行动

由北交所、全国股转公司联合江苏省委金融办、江苏省工信厅、江苏证监局主办,江苏股权交易中心协办的全国首场重点专精特新企业培训活动7月29日在南京举办。拉开了“全国重点专精特新企业培育专项行动”的序幕。本次活动坚持政策解读与实操指导“双轮驱动”理念,通过系统宣介工信、金融部门支持专精特新企业赴新三板、北交所挂牌上市的政策举措,深度解读区域性股权市场、新三板、北交所全链条服务专精特新企业成长的机制安排,深入剖析企业筹备挂牌上市过程中的常见问题并提供解决方案,旨在推动更多优质专精特新企业依托北交所、新三板市场实现高质量发展,完善覆盖专精特新企业成长全周期的梯度培育生态。参训企业表示,培训内容丰富务实,为企业科学规划挂牌上市路径提供了清晰可循的“导航图”。下一步,北交所、全国股转公司将发挥“工信部-交易所-地方金融部门-区域性股权市场”多方共育专精特新的服务机制,在全国范围内陆续开展专项行动系列活动,持续提升针对重点专精特新企业的管家式服务水平,为服务构建现代化产业体系和实体经济高质量发展积极贡献力量。

财通福鑫定开混合:将于7月30日开盘起至当日10:30停牌

财通基金管理有限公司公告,截至2026年7月29日上海证券交易所收盘,旗下财通多策略福鑫定期开放灵活配置混合型发起式证券投资基金(场内简称:财通福鑫定开混合,交易代码:501046)二级市场交易价格明显高于基金份额净值,出现较大幅度溢价。特此提示投资者关注二级市场交易价格溢价风险,投资者如果盲目投资,可能遭受重大损失。为维护投资者利益,本基金将于2026年7月30日开盘起至当日10:30停牌。

澜起科技:首次回购50万股A股股份,回购金额约1.03亿元

澜起科技公告,2026年7月29日,公司通过集中竞价交易方式首次回购A股股份50万股,已回购股份占公司总股本的比例为0.04%,购买的最高价为210.00元/股、最低价为192.18元/股,支付的金额总额约为人民币10276.49万元(不含佣金、过户费等交易费用)。

伊朗谴责美国沙特袭击伊拉克

据CCTV国际时讯,伊朗外交部今天(7月29日)发表声明,强烈谴责美国和沙特对伊拉克部分地区发动袭击。声明称,这些袭击侵犯伊拉克国家主权和领土完整,违反《联合国宪章》和国际法,目的是“服务于美国和以色列政权扩大西亚地区战争和冲突范围的图谋”。声明还称,袭击造成多名伊拉克民众死亡,伊朗对此表示哀悼,并重申对伊拉克政府和人民的支持。声明同时表示,美国及其地区盟友应对“这些罪恶、不人道和挑衅行为”所造成的后果承担责任。

知情人士:霍尔木兹海峡仍然完全封闭

7月29日,据伊朗媒体Fars News,一位军事知情人士表示,霍尔木兹海峡仍然完全封闭,任何船只都没有权利通过这一战略水道。任何试图通过的船只,特别是那些不理会警告的船只,将会面临果断和迅速的反应。

伊媒称美空袭伊朗与伊拉克边境地区

7月29日,据伊朗国家电视台,当地时间7月29日下午,伊朗西阿塞拜疆省皮兰沙赫尔市边境地带遭到美国空袭。

匈牙利议会投票决定取消该国关于加密货币交易验证的要求

7月29日,据The Block报道,匈牙利财政部长安德拉斯·卡尔曼(Andras Karman)表示,匈牙利议会投票决定取消该国关于加密货币交易验证的要求。这项废除措施属于一项更广泛税收方案的一部分,它取消了在进行特定加密货币兑换之前必须验证钱包所有权、资产来源及客户数据的义务。

卡布里贷款与OpenAI展开合作 将企业级AI应用于借贷业务运营

7月29日,卡布里环球资本有限公司旗下卡布里贷款与OpenAI展开合作,将企业级人工智能应用于借贷业务运营。