风险提示:理性看待区块链,提高风险意识!
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

从Token Optimization到Model Routing:AI竞争正转向经济学

摘要

硅谷的风向变了:从Capability到Economics 过去两个月,我深入走访Menlo Park闭门会议、斯坦福校园及十余家AI Native公司(Cursor、Fireworks、Cognition、Sierra等),与创始人和工程师反复对焦同一组问题。结论越...

从Token Optimization到Model Routing:AI竞争正转向经济学

硅谷的风向变了:从Capability到Economics

过去两个月,我深入走访Menlo Park闭门会议、斯坦福校园及十余家AI Native公司(Cursor、Fireworks、Cognition、Sierra等),与创始人和工程师反复对焦同一组问题。结论越来越清晰:AI的竞争重心,已悄然从模型能力(Capability)转向成本效率(Economics)。企业不再只问“哪个模型最强”,而是问“哪个模型在这件事上最划算”。

Token Optimization不是降温,而是精细化运营的开始

Token Optimization不是AI投入收缩的信号,恰恰相反——Fireworks年化收入从4亿跃至10亿美元;Cognition同比增长近7倍;Higgsfield从零起步,14个月做到5亿美元营收。增长仍在加速,但驱动逻辑变了:模型能力跃迁带来真实ROI;Copilot进化为Agent,单任务token消耗翻倍;混合计费(Subscription + Usage)让token消耗直接挂钩收入。 企业正系统性重写Workflow:识别高价值任务(需前沿模型)与低价值任务(可下沉至开源或自研模型)。微软6月起将GitHub Copilot改为按token计费,是重要催化剂——当成本第一次变得透明,管控就自然发生。这类似2022–2024年的Cloud Optimization周期:企业没放弃云,只是开始精打细算。当时AWS、Snowflake增速连续承压;今天,token成为新的优化标的,其影响值得持续追踪。

Model Routing:企业采购的不再是模型,而是一套智能调度系统

Token Optimization是目标,Model Routing是实现路径。Cognition已能将一次推理自动拆解为多个子任务,按成本、延迟、准确率、稳定性动态分配至不同模型;用户全程无感。Decagon客服平台30%的token请求已路由至开源模型;Factory平台开源模型token份额从年初0.1%升至当前10%–15%,7个月增长百倍以上。 这不是单纯图便宜。多家公司明确表示:避免被单一厂商锁定,是推动路由决策的关键动因。模型选择正从“选一个模型”升级为“部署一套路由基础设施”。去年的问题是“谁训出最好的模型?”,今年的问题是“谁能把任务路由给最合适的模型?”

模型市场走向哑铃结构:要么Great,要么Cheap

中间地带正在塌陷。一端是Frontier Labs(OpenAI、Anthropic、Google),专注不可替代的前沿智能;另一端是以DeepSeek为代表的高性价比开源模型——它已是OpenRouter上份额最大的单一模型供应商,被投资人称为“price-performance floor”:任何比它贵却未显著更强的模型,都难获市场青睐。 有趣的是,两极需求并未互斥。前沿模型仍承担最高价值任务(如法律文书生成、复杂代码调试),且随着能力提升不断解锁新场景;而开源模型则在agentic工作负载中快速渗透。Harvey团队用自有法律数据微调开源模型+自研router,效果优于直接调用Claude Opus,成本更低——这正是未来典型范式:前沿模型深度使用不减,但更多token流向task-specific开源模型。

标价失效,真正该比的是Fully Loaded Cost

每百万token报价正迅速失去参考意义。企业真正关心的是“完成一次成功任务的完全成本”(Fully Loaded Cost per Successful Task):包括retry次数、缓存命中率、输出稳定性、token效率等隐性开销。DeepSeek虽定价最低,但一线反馈集中于输出波动大、多次运行结果不一致——若重试率达3次,账面价差瞬间归零。 同样逻辑适用于本地部署:GLM 5.2 API价格看似低廉,但自建推理集群回本周期超5年;在芯片迭代快、算力紧缺背景下,云服务的综合TCO仍具压倒性优势。可用性更是现实瓶颈——Kimi曾因算力不足暂停新用户接入;多数中国模型仍依赖Together、Fireworks等第三方推理平台,尚未在主流公有云全面铺开。

对投资与基建的真实启示

Frontier Labs需重估ARR增长假设:上半年部分高增长可能来自“用Opus干杂活”,下半年这类流量将被Optimization砍掉或Routing分流。昂贵模型仍将聚焦高价值推理,但收入增长将更依赖单位token价值提升,而非token总量膨胀。 半导体与云基建反而更确定:Jevons Paradox在此成立——模型变便宜,不会减少GPU需求,只会扩大总用量。中国模型缺算力,最终要托管在算力富集地;开源模型越大,对HBM、高速互联、先进封装的需求越刚性。Databricks已公开确认:中国模型部署实际推高了云端推理负载。 AI软件机会正从模型层向调度层迁移:Routing平台、Inference Infra、Agent编排工具的价值持续上升。Fireworks这类公司不卖模型,而是卖“企业AI系统的运行效率”,这才是下一阶段的核心护城河。

接下来两个季度,盯紧四件事

1. Anthropic与OpenAI的环比增速曲线:若“贵模型干杂活”成分属实,增速斜率将率先放缓; 2. 中国模型能否走出第三方平台,实现公有云大规模、稳定供给; 3. 质量差距的演化方向:不看benchmark分数,看开发者retry rate是否持续下降; 4. Fully Loaded Cost是否成为采购语言:一旦普及,“便宜5倍”的叙事将全面重估。 AI没有减速,只是竞争函数变了——过去优化Intelligence,未来优化Intelligence per Dollar。

评论 (7)

登录 后即可发表评论
老k
老k 1周前

模型市场变哑铃结构,前沿和便宜的各有优势,以后就是好钢用在刀刃上,开源模型也有机会

0 回复
止青
止青 1周前

标价不能只看百万token报价,得算完全成本,这才是企业采购该关注的,不然容易入坑

0 回复
张计明
张计明 1周前

看来AI竞争从只看能力到更重成本了,企业会更精打细算选模型,这趋势挺明显

0 回复
炸鸡柳
炸鸡柳 1周前

对投资基建启示很大,前沿模型收入模式得变,半导体云基建需求会增加,软件机会往调度层走

0 回复
十個美梦蓋過了天空

Token Optimization是精细化运营开端,文中那些公司收入增长就说明策略有效,这是个好方向

0 回复
更多