风险提示:理性看待区块链,提高风险意识!
币界网
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

Galaxy Digital:推理算力市场与微观结构研究

摘要

作者:Vikram Singh,Galaxy Ventures投资人;来源:Galaxy Digital;编译:Shaw,币行吧财经要点速览随着开源模型普及,智能能力正在商品化。开源模型性能已接近前沿闭源模型;自 2025 年 1 月以来,调用规模暴涨 3...

Galaxy Digital:推理算力市场与微观结构研究

作者:Vikram Singh,Galaxy Ventures投资人;来源:Galaxy Digital;编译:Shaw,币行吧财经

要点速览

  • 随着开源模型普及,智能能力正在商品化。开源模型性能已接近前沿闭源模型;自 2025 年 1 月以来,调用规模暴涨 350 倍。由于开源模型推理服务无需准入许可,一个充分竞争的推理算力市场正在形成。

  • 推理“市场结构”在某种程度上类似于交易场所:存在Token买方(Cursor、Lovable、各类企业)、交易撮合平台(OpenRouter),以及Token卖方(Fireworks、Baseten、Together AI),卖方针对各模型Token挂出单边订单簿。

  • 推理服务商如同做市商:持续报价、以算力形式持有库存、赚取买卖价差,并争夺Token流量。撮合平台相当于交易所:OpenRouter 收取撮合服务费(分成比例 5.5%),未来还存在向 “做市商” 购买Token流量(订单流付费 PFOF)收取费用的空间。

  • GPU 小时是生产每一组Token的标准化投入品,同时充当对冲推理Token生产成本风险的底层标的。算力期货应运而生,用于应对 GPU 小时价格 130% 的波动率,帮助推理服务商管控主营业务成本(COGS)。

几大趋势正在同步上演:

  • 智能能力快速商品化、普惠化。自 GPT-4 问世之后,没有任何一款前沿模型能够持续领跑超过 100 天。全新模型平均每 41 天推出一款。开源模型追上头部实验室前沿模型所需时长已经从数年缩短至数月。这彻底改变前沿实验室的盈利逻辑:它们仅有约 4 个月时间摊销模型训练资本开支,之后市场需求就会大量转向开源模型。

7otguX5hl0PaHCJOGiIWrjmwI829ddN7OrGrXcfy.jpeg

3OAqAh8FnHAyVhd8hz3YoYyTvkbpV63AWAqNcgij.jpeg

  • 杰文斯悖论正在当下上演:企业切换至开源模型所节省的成本,会再度投入用于生成更多Token。因此,即便预算总额保持不变,Token消耗量仍会持续增长。OpenRouter 的数据印证了这一点:上周平台路由调度的Token总量达到 2025 年 1 月的 125 倍,其中开源模型流量占比从此前 27% 提升至 75%。

ltZnERdB9bR22cj6pDr1crZ2c54OflYhdbUxYbJf.jpeg

  • 开源模型的大量涌现,推动中短期 GPU 租赁需求上行。伴随近期多款开源模型发布,Ornn H100 算力指数覆盖范围内,算力利用率与租赁价格大幅飙升。

ahvsgbzQP3NlAUgYIJeGdO72mcxg9HeLMepGhdkG.jpeg

  • 过去三个月,推理服务商、GPU 算力租赁交易平台以及流量调度平台领域的险投资热度急剧升温。

cYv8knJlZKxwvgH1jfkjZf386GckmeUpEpfH6h1l.jpeg

随着Token流量持续向开源模型转移,Token采购方对价格愈发敏感,叠加推理服务无需许可准入,一个充分竞争的推理服务市场正在形成。竞争型市场通常会演化出成熟的市场结构。推理服务技术栈大致可类比为交易场所,深入剖析后能够发现诸多耐人寻味的细节。

推理市场结构

类比交易市场框架,推理业务存在三类核心参与主体:Token买方、Token卖方以及交易撮合平台。

uShkIz0qvYCKtSVnzjZcnHOM0vusbrXZE5DoIBEb.jpeg

Token客户/买方

和 ChatGPT 对话的终端用户、使用 Cursor 的开发人员、Lovable 与 Harvey 等内嵌大模型能力的应用程序、开展后台调研的智能代理集群,以及将大模型 API 接入生产业务流程的企业 —— 以上全部属于Token买方。这类用户对Token价格具备不同弹性,可分为几类:

  • 15% 高价格弹性:例如开发者试验场景;

  • 25% 中等价格弹性:例如面向普通用户的对话服务;

  • 40% 低价格弹性:例如企业 SaaS 业务;

  • 5% 价格无弹性:例如存在实时响应要求的业务。

FUAQhnge8H0k3Bn0938p0bfQlw00NbVdDu6oIty1.jpeg

在固定所用模型的前提下,需求弹性一定程度取决于谁在等待推理返回结果。面向人类交互的需求缺乏弹性,而由智能代理发起的批量需求具备高弹性。举例而言,如果接受 24 小时批量处理窗口、而非同步即时返回,同等Token的调用成本能够降低一半。

总量数据会夸大需求的粘性:价格下调 10% 仅能带动调用量提升 0.5%–0.7%。但这一均值是两类需求混合后的结果:一类是愿意不计成本保障核心业务的企业客户,另一类是爱好者与开发流水线,会涌向报价最低的服务商。闭源模型承接高价值、对可靠性要求高的业务;开源模型承载低成本、大流量的需求。

由此可见,存量平均Token需求弹性偏弱,但增量边际Token需求弹性极高。当前大部分流量来自等待即时结果的人类用户:聊天回复、Cursor 代码补全。这类买家对价格变化并不敏感,没有人会为节省几分钱,在对话中途切换模型。然而,下一阶段的Token需求将由软件程序驱动:智能代理循环任务、批量调研任务、持续集成流水线。这类增量需求的目标函数是兼顾效果上限与成本最小化,时延优先级更低。OpenRouter 已经针对这类未来需求做优化:默认调度策略按照「1 / 价格平方」权重,将模型流量分配至各家服务商。这意味着服务商报价减半,流量份额大致提升四倍。目前平台超过 70% 的调度Token来自命令行工具与智能代理,几乎所有新增Token需求都属于弹性需求。

推理服务商/Token卖方

也就是Token供给方(Fireworks、Baseten、Together AI 等厂商)。服务商消耗 GPU 算力小时生成Token,并在撮合平台上报Token报价。各家推理服务商在价格、性能多个维度存在差异,我们将在微观结构章节展开详述。

撮合平台/交易所

该平台对接Token买方与推理服务商,并收取服务费用。Token交易领域最典型代表即为 OpenRouter。

但Token撮合平台和传统交易所有一处关键区别:并非双边交易市场。用户可以向推理服务商购买Token,却无法将Token卖回服务商或是第三方。根源在于Token属于按需生产、交付即消耗的产品,不存在可供仓储、转售的存量。一类标的如果天然不存在买方报价盘(bid 端),价格发现机制会受到显著制约。

那么,缺少完备价格发现机制,在实际场景中表现如何?

下方是 OpenRouter 上 DeepSeek V4 Pro 的实时服务商报价面板:同一款开源模型,同时存在 18 家服务商挂出报价。

3wQwbKs8lQus39wMgQA87pBWWVreevdW8f652QjT.jpeg

有三点现象十分突出:

  • 第一,Token报价集中在一个人为锚定价位。报价列表底部共有五家服务商(Weights & Biases、Together、Fireworks、Baseten 以及 Parasail)给出完全一致的报价:输入Token 1.74 美元 / 输出Token 3.48 美元。所有主流开源模型都存在相同规律。在 Kimi K2.6 模型报价中,七家服务商报价统一为 0.95 美元 / 4.00 美元(其中包含月之暗面原生平台)。

QAqwfqt9vpc8vrCC6GOisModqDvp6yBQuz97uaB5.jpeg

而在 GLM-5.2 模型报价中,六家服务商给出完全一致的 1.400 美元报价(包含智谱 AI),另有六家服务商以该基准锚定价为基础推出促销折扣。

zrARJ5IX457ucCjpVOC0PkGtEtRfDhdCsgu75Vh1.jpeg

有意思的是,模型官方一手报价并非永远是市场底价。DeepSeek 官方提供最低价的 V4 Pro 接口,但在 Kimi K2.6、GLM-5.2 以及 V4 Flash 模型赛道,第三方服务商报价能够低于该锚定价。

  • 第二,报价区间跨度极大,交付质量参差不齐。以 DeepSeek 为例,17 家服务商报价区间为 0.435 美元至 1.74 美元,价差最高达到 4 倍。量化精度相关信息由服务商自主填报,且往往披露不全;五家报价相同的厂商里,有三家并未标注量化方案。新入场者很难区分:低价究竟源于服务商算力调度效率更高,还是模型精度被降级。

  • 第三,Token市场不存在促使价格收敛的机制。由于市场仅有单边报价盘,同时缺乏二级市场 —— Token无法转售,也就不存在可供套利的交易场所。

现阶段Token本身无法交易,但深入拆解Token交易各方的微观结构能够发现,双边市场形态转移至其他环节。

推理市场微观结构

本文所指的微观结构,聚焦Token交易底层运行机制:各参与方实际持有的标的、利润空间如何形成,以及各方账面承载的风险。

tW4b6d6n8aAcUAeHUSsQYsc7Iwkn9p8CMRezblV6.jpeg

Token买方

毛利 = 使用Token创造的价值 − Token采购成本

买方采用价值导向商业模式:消耗Token,并对外输出具备价值的产品。因此,想要最大化毛利,就必须持续压低Token成本。当前买方主要通过以下方式实现:

  • 高效模型流量调度:Coinbase 将请求调度至开源模型,Token现金支出削减 90%,在Token调用量指数级增长的同时稳住 AI 总成本。Lindy 将全部流量切换至 DeepSeek,节省数百万成本。Cognition 与 Factory 已在自研框架内内置模型调度能力;Cursor 昨日上线自研调度系统,可为用户降低 60% 成本。以上现象说明:在非高价值任务场景中,开源模型正在从闭源前沿实验室手中抢占Token流量。

  • 业务负载重构:批量任务定价仅为实时调用价格的一半;缓存机制能够将重复请求的成本降低 60%–80%。例如 Sail Research 专注于长周期后台智能代理任务,对于能够容忍分钟级延迟、无需毫秒级响应的业务,宣称每美元算力可产出最高 12 倍的Token。

  • 采购流程专业化:流量调度策略、多模型预算配比、模型替代方案正逐步成为主营业务成本管控工具。云服务行业也曾经历相似转变:当 AWS 账单规模扩大后,FinOps 团队应运而生负责成本管控。如今Token支出领域正在复刻这一历程。

撮合平台(交易所类比)

撮合平台毛利公式:毛利 = 价差 + 服务费 + 其他衍生收入

对于 OpenRouter 这类Token撮合市场而言,平台本身不存在加价价差 —— 服务商报价直接原价流转。但 OpenRouter 在用户充值时收取 5.5% 服务费;若平台总交易规模(GPV)达到 10 亿美元,可实现 5500 万美元净收入。

这 5.5% 属于便捷服务费。OpenRouter 提供模型聚合能力(单一账号即可调用 400 余款模型)、统一账单、故障容灾保障、完善交互体验,近期还上线智能自动选型功能 openrouter/auto(类似 Coinbase 内部搭建的模型调度系统)。选用 OpenRouter 的核心优势之一,是能够接入全部可用算力资源,故障兜底是核心价值点。即便应用或企业自建内部调度聚合系统,算力服务商通常也会优先承接 OpenRouter 下发的流量。

聚合平台掌握终端用户体验,理论上可以向交易两端收取收益,而非仅向买方收费。未来 OpenRouter 或许会向推理服务商抽取费用,凭借导流分成服务商毛利,模式类似于 Robinhood 向 Citadel 收取订单流付费。

与此同时,OpenRouter 存在切换成本,但并非无法逾越。1000 万美元Token支出,意味着需要向 OpenRouter 支付 55 万美元服务费。平台不承担任何风险却收取 550 个基点的交易费用,该水平偏高;想要长期维持无本金风险下的高额毛利存在难度。市场大概率会出现以低价引流的竞争者,但竞争者需要在产品体验层面展开比拼。

当然,撮合平台仍存在维持分成比例的抓手。用户采购阶段无法直观辨别Token质量,而 OpenRouter 作为买卖双方之间可信中介,统一记录各家推理服务商的量化方案、可用率、延迟、吞吐以及数据使用规则。平台可以凭借这种第三方核验与信任能力收取费用,运作模式类似评级机构。

推理服务商

Baseten、Fireworks、Together AI 这类推理服务商自有或租赁 GPU 资源,在硬件上运行模型推理。绝大多数推理服务商仅可部署开源模型;而 Anthropic、OpenAI 闭源模型推理服务仅能由原厂,以及亚马逊 Bedrock、Google Vertex 等基础设施合作伙伴提供。

推理服务商盈亏公式:盈亏 = Token销售收入 − Token生产成本

做市商持续报价、持有库存,赚取库存成本与市场订单成交价之间的价差。与之类似,推理服务商为自产Token持续报价,以GPU 算力小时作为生产Token的库存载体,赚取Token生产成本与市场售价之间的价差。

ODTpokHoESyFvwt7DW3XIIOytc6kKxCvHX2Q1fst.jpeg

不同推理服务商所能提供的Token存在不同 “品质等级”。即便运行同一款模型,各家在非价格维度上仍存在显著差异:

  • 量化精度(FP8 / FP4 / INT8):权重占用比特数越低,推理成本越低、速度越快,但会在一定程度上损失模型输出质量。

  • 首词生成时延(TTFT):从发起请求到返回首个输出Token所需时长,面向人类对话场景至关重要。

  • 每秒Token产出(TPS):流式输出的速度,对智能代理类任务尤为关键。

  • 服务可用率:业务紧急请求期间服务商发生中断会造成严重负面影响。

对于推理服务商而言,收入 = 流量规模 × Token单价。而在撮合平台上,流量会流向综合竞争力最强的报价(OpenRouter 按照 1 / 价格平方 权重分配流量)。因此想要在具备竞争力的报价水平上守住利润,就必须压低Token生产成本。在 OpenRouter 平台机制下,同等质量条件中最低报价会优先获得流量,市场或将自然演化出低价引流的竞争格局。

某种意义上,推理服务商针对 GPU 算力小时执行裂解价差(Crack Spread)策略。原油市场中,炼油商的裂解价差,即采购原油原料与销售成品油(汽油、柴油)之间的毛利。炼油商做多原油、做空成品油,依靠炼化环节赚取两端价差。与之相似:推理服务商做多远期 GPU 算力小时、做空现货Token,推理服务栈就相当于中间的炼化工厂。

我们可以写出服务商每 GPU 小时的毛利公式:m=p⋅R⋅u−c。

其中:

  • p = Token单价

  • R = 炼化产出率(每 GPU 小时可生成的Token数量)

  • u = 算力利用率

  • c = GPU 小时租赁成本

我们通过实例直观理解:固定 GPU 小时成本为 2.74 美元 / 小时(7 月 21 日 Ornn H100 算力报价)。某服务商以此价格租赁算力,Token定价 0.90 美元 / 百万Token,输出速度 1000 Token / 秒。算力满负荷运行时每小时产出 360 万Token,对应收入 3.24 美元 / 小时,扣除 2.74 美元租金,每小时价差收益 + 0.50 美元。若算力利用率降至 50%,收入减半至 1.62 美元 / 小时,价差转为亏损 −1.12 美元 / 小时。该场景下,这套 “裂解价差” 模式的盈亏平衡利用率为 85%。

A9EyFnlKnyOUKMQDeOa3R84PxQ0Jr0HpZafL4n3K.jpeg

有两点需要注意。第一,Token单价(p)与Token产出率(R)二者相互制衡。想要提升响应速度,就要缩小批处理规模;而更小的批次意味着单 GPU 小时产出的Token数量变少。更快地为用户提供服务,能够支撑更高定价,但会压低Token产出率。这也就解释了:相同模型、相同硬件条件下,吞吐 50 Token / 秒的定价为 0.56 美元 / 百万Token,而 125 Token / 秒的定价可达 4 美元 / 百万Token。服务商通常会优化自身服务栈,选择在这条权衡曲线上占据特定运营点位。

maULj8weN3oUfrJdMeQmQQyechmmFHnmsyOvKoLM.jpeg

第二,上述案例中 15% 的毛利率,远低于当下推理服务商实际披露的 45%–50% 毛利率水平。

服务商可以通过以下方式增厚利润:

  • 提高定价(p ↑):承接吞吐量 — 成本曲线远端的用户流量,支撑更高报价;

  • 压降成本(c ↓):签订长期 GPU 算力锁定协议;

  • 提升利用率(u ↑):动态调度、复用 GPU 算力集群(下文详述);

  • 拉高产出率(R ↑):对推理服务栈进行深度优化(下文详述)。

Token 单价 p 由卖方市场竞争决定,算力成本 c 由 GPU 市场行情决定。产出率 R 与算力利用率 u 是服务商能够完全自主掌控的两大变量。

因此,服务商致力于最大化 R,并依托这两个维度构建相较于同行的差异化竞争力。优化成本、提升Token产出率 R 的主流技术手段如下:

  • 模型量化(FP8 → FP4/INT4)Token:解码环节受限于内存带宽:每生成一个输出Token,都需要从高带宽内存(HBM)中持续加载模型激活权重。采用 FP4 替代 FP8 量化方案,单个权重占用字节数减半,带宽占用同步降低。生产环境中 FP4 相比 FP8 可实现 1.8 倍产出提升;搭载 FP4 量化的 B200 算力,单位成本性能最高可达 FP8 模式下 H200 算力的 3.65 倍。但量化优化需要牺牲一定模型输出质量。

  • 前缀缓存 / KV 缓存:智能代理发起的绝大多数工具调用,仅在原有提示词末尾新增少量文本,主体内容重复。服务商无需每次从头完整处理整条提示词,而是缓存上一轮的计算结果,仅增量处理新增内容。生产环境中,代码智能代理场景下提示词复用率可达 85%–97%;缓存复用率从 0 提升至 90%,GPU 算力开销大约降低 90%。针对智能代理流量,缓存命中率是决定算力成本最核心的指标。

  • 推测解码(Speculative decoding):轻量 “草稿模型” 提前预判后续多个Token,主大模型一次性批量校验全部预测结果。校验运算成本远低于从头生成Token,主模型单次读取权重资源即可产出多个Token,而非单个Token。

  • 预填充/解码任务分离:部署预填充(处理输入提示词)属于算力密集型任务,解码(生成回复内容)属于带宽密集型任务,但两类任务原本共用同一批 GPU 资源。将两类任务拆分至独立算力集群,分别针对各自瓶颈专项调优,整体性能可提升 10%–30%;机柜级集群上运行大型混合专家(MoE)模型时,单 GPU 最高可实现 4.4 倍吞吐提升。

  • MoE 专家模块并行:调度前沿混合专家模型,每生成一个Token仅激活 3%–5% 的参数。将不同专家模块分散部署在 32–144 张 GPU 上,缩减单卡所需存放的权重容量,释放 HBM 资源承载更大批次;仅依靠专家负载均衡,就能实现 1.5–2.5 倍吞吐增长。DeepSeek 自有算力集群已采用该架构(提示词预填充单元配置 32 卡,生成解码单元配置 144 卡);开源推理引擎 SGLang 已在 96 卡环境复现该部署方案,英伟达机柜级 GB200 NVL72 系统正是围绕该架构设计。

Wbt6Gj2JR7L2dV7OVBo8FDlZyTHpvi9yBkXpQwb4.jpeg

各类优化手段具备乘数效应。尽管模型参量持续扩大,GPU 小时租赁价格有所上涨,但历经多轮迭代,推理成本仍大幅走低。DeepSeek 旗舰模型输出Token报价自 2025 年 1 月以来下跌约 8 倍(R1 模型 2.19 美元 / 百万Token → V4 Flash 模型 0.28 美元 / 百万Token);同期 H100 算力指数反而上涨 17%,价格由 2.34 美元升至 2.74 美元。

sAj06Ccyedo0Fn2AXExcbrMCGzYulzHpTw4FpG3c.jpeg

推理服务商依托上述各类优化技术构建自研深度能力,以此形成差异化竞争。Fireworks 开发了定制注意力算子 FireAttention,加载相同模型权重时,推理速度达到原生 vLLM 的 4 倍,在低时延业务场景具备显著优势。Together 打造了 ATLAS 推测解码系统,该系统的草稿模型能够基于实时流量持续学习,实现提速效果随业务规模叠加放大。Baseten 为每位客户训练定制化 EAGLE-3 草稿输出头,在专属私有化部署领域表现突出。SAIL 则针对时延不敏感业务完成全栈调优,深耕长时间运行的后台智能代理任务。

但这类优化方案最终都会向 vLLM、SGLang 等开源推理引擎扩散。由此,推理服务商依靠技术优势获取的超额收益会逐步衰减,并且技术扩散、优势消退的速度还在不断加快。预填充与解码任务分离技术耗时 11–16 个月完成普及;多头隐注意力(MLA)耗时 3–8 个月;EAGLE-3 仅用时 1–2 个月;到 DeepSeek V4 发布时,官方开箱即附带当前性能领先的推理服务栈。

drfykkY9gZW6JCLbHwPQLTfACHA9wfafrAvH9Lus.jpeg

技术优势消退具备结构性特征。并非所有优化方案都会对外公开,但重大技术突破大多会以论文形式发布 —— 研发这些技术的实验室,希望自家模型一经推出就能获得广泛、低成本的推理部署支持。红帽资助 vLLM 核心维护团队,英伟达也持续向 vLLM 与 SGLang 两大开源项目贡献代码。

行业内还存在另一层运作细节:部分开源模型实验室与推理云服务商深度合作,允许服务商在模型正式开源前提前获取权重文件;作为交换,服务商需要把该模型无服务器推理业务生命周期收益的 15%–30% 分成给实验室。推理服务商相当于出让一部分未来收益,换取十天先发窗口期,提前完成算力优化、围绕新模型上线规划算力储备。服务商还可以扩容存储资源,提升缓存命中率,以此吸引更多流量。模型生命周期普遍较短,新版本发布初期的流量爆发阶段盈利空间可观,这一幕很像做市商在首次公开发行(IPO)或代币发行(TGE)期间争夺订单流量。

由此可见,推理服务栈带来的技术优势仅具备短期时效,和所有交易超额收益一样,服务商必须持续创新才能守住优势。

因此,当推理技术优化空间(产出率 R)见顶之后,主营业务成本管控重心就转向金融与资源调度层面:

  • 算力调度优化(提升利用率 u):服务商通常将算力集群划分为两类资源:专属算力(客户锁定指定 GPU 专供自身模型使用)与面向大众的共享无服务器算力池。专属算力按全天计费,但很难做到全天候满载,闲置时段具备可预测性。其中关键解法在于:绝大多数客户微调方案采用 LoRA 适配器 —— 只是叠加在基础模型之上的小型权重增量,而基础模型早已加载在显存中。当专属客户夜间业务低峰时,服务商可以卸载该客户的 LoRA 适配器,将共享无服务器流量调度至这片预留 GPU;待客户业务恢复,再切回原有适配器。通过这套模式,同一单位 GPU 小时算力基本实现两次售卖:一次作为算力预留资源,一次承接共享流量,把有效算力利用率从 50% 推高至 120%。这和航空公司超售机票逻辑相似:航司预判部分乘客不会登机,而此处的 “空座” 就是专属客户的算力闲置时段。

  • 算力成本管控(压降成本 c):算力是整条Token交付供应链中占比最高的成本项。每创造 100 美元价值的Token,大约有 50 美元消耗在 GPU 算力租赁上。GPU 小时是生产任意Token的标准化投入品,贯穿Token全生命周期,处于核心地位。自建 H100 算力的综合总成本构成如下:

bGC7Ch0cSVnlIf1M98tXNHoX3Xx5DffjBpaQaYOk.jpeg

现阶段,推理服务商依靠长期合约与短期租赁协议管控算力成本 c,同时独自承担全部资产折旧、价格波动风险。GPU(以及显存)期货、远期曲线这类金融衍生品,能够帮助推理服务商转移风险、高效管控成本。

换言之,当推理服务商软硬件优化空间逐步趋近上限,其经营模式会愈发趋近于交易账户。

算力期货:双边交易市场

一类可交易标的需要满足两大条件:标准化(单位标的之间可相互替代)、稳定性(当下签订的合约,到期交割对应同一种商品)。

目前Token无法满足以上两点:

  • 标准化不足:Token是由「模型 × 量化方案 × 上下文窗口 × 时延等级」共同构成的组合产品。即便锁定同一模型,也会衍生出大量品质组合:3 种量化方案 × 2 种上下文配置 × 3 档时延等级,单款 “同款” 模型就能形成 18 种互不通用、不可互换的产品。

  • 稳定性不足:新型模型的市场存续窗口持续收缩。当前平均每 41 天就有新模型发布,往往会让一整批旧模型丧失竞争力,相关需求断崖式下跌。

能否依靠Token指数解决该问题?作用有限。Token定价由模型实验室自主决定,机制本身存在被操纵的空间。即便是 SIT 提案,也仅标准化了输入条件、针对模型本身打分,而非面向实际推理服务环节 —— 而品质差异恰恰产生在服务侧(相同模型权重,不同服务商运行下工具调用能力得分区间可达 76%–100%)。

因此,Token指数仅适合作为参考价格,无法实现风险转移。风险转移必须下沉一层,落在具备同质性的生产要素:GPU 算力小时。

GPU 算力小时领域已经诞生用于标准化价格发现的行业指数,例如 Ornn 算力价格指数;同时也出现具备双边流动性的交易平台,如 Architect Innovation Exchange。

Z2R6qUHubOWzb47XgsEODeiCfEgfGyTZGdnjgN9W.jpeg

推理服务商为何必须管理 GPU 价格风险?推理服务商全部成本端,只依赖一项波动剧烈的现货投入品 —— 算力采购成本。在公式 m=p⋅R⋅u−c 中,服务商能够掌控产出率R与算力利用率u,Token售价p由市场竞争决定;而算力成本c随行就市,现货市场年化实际波动率均值高达 130%,当前实际波动率已达到 312%。

VZHMdSPShcr3RZFohqFUM4QgmqcT2VhZuaclrAnh.jpeg

实际上,供应商的资产组合包括自有 GPU 库存、1-3 年期合约以及价格接近现货指数的短期租赁。如果不进行对冲,这种组合在价格波动中会遭受损失。

当租金飙升时(2026 年 5 月:比谷底上涨 101%),现货交易的成本翻倍,而 Token 价格保持停滞(到目前为止,Token 价格一直在单调下降),因此每一分每一秒的 GPU 服务都会造成亏损。

gAAE1ql7tV2VLNerwt5OkSzNTIyQ4sJSnZTOXaIj.jpeg

而当算力租金大幅回落(最低触及 1.63 美元)时,长期算力合约的采购成本高于现货市场价;竞争对手采用现货算力租赁,能够给出低于该服务商成本线的Token报价。

EUjRjKL49z0eH6qcIdFVj4aWpxRpIQHCOqHER0ni.jpeg

引入对冲机制后,毛利公式更新为:m=p⋅R⋅u−(F0+f)其中:F0 = 对应锁定期限的期货价格;f = 持仓资金成本(占用作初始保证金的担保资金,外加逐日盯市变动保证金成本)。

和所有期货品种一样,市场存在正向市场(升水)与反向市场(贴水)两种结构。我们借助一组模拟远期曲线举例说明:

  • 正向市场(Contango,F0>cspot):远期曲线向上倾斜,买方需要承担持有成本。毛利表达式写作:m=p⋅R⋅u−(cspot+持有成本+f)。回顾 2 月算力供给过剩阶段:现货价格跌至 1.63 美元,而本次模拟期货报价高于现货 ——5 月交割合约报价 2.05 美元,更远期合约报价 2.20 美元。背后逻辑是市场预期算力租金将会均值回归。当时开展对冲的服务商,需要相比现货溢价 0.40–0.60 美元锁定期货价。等到 5 月算力紧张推动现货价格飙升至 3.28 美元时,完成对冲的服务商仍只需按 2 美元成本结算,锁定了 1.28 美元的成本价差。

vz5oUEuHKxhTC9W0DQGM1qzTk923OALLf0bnppk1.jpeg

  • 反向市场(Backwardation,F0<cspot):远期曲线向下倾斜,买方能够获得折价收益(正向展期收益),毛利公式:m=p⋅R⋅u−(cspot−折价+f)。以 5 月算力紧缺行情为例:现货价格冲高至 3.28 美元,但模拟远期合约两个月后交割报价仅 2.90 美元,市场预判算力短缺局面终将缓解。当周急需算力的主体只能承担 3.28 美元的现货高价;而提前买入下个季度算力小时的服务商,则得以低于恐慌行情下的现货价格锁定算力。

ZwuKDWVnpc5FrMjZeDzqbELZbloDhyqwlAtuDniJ.jpeg

无论何种行情,敞口的价格风险都会转化为确定的合约成本,以此实现毛利稳定。服务商最终仅剩下两项自身能够掌控的风险:Token产出率R与算力利用率u。

上述对冲模式仍存在几点局限:

  • 第一,基差风险无法完全消除。合约以指数标准规格的 H100 算力小时作为结算标的,但真实算力集群由不同代际硬件、不同地域、不同互联方案构成,价格走势无法与指数完全同步。对冲工具只能覆盖市场整体波动,无法对冲服务商自有算力组合相对指数的价差。

  • 第二,锁定算力成本不等于锁定业务需求。如果服务商对冲的算力规模超出最终实际用量,原本的成本对冲头寸就转变为算力多头投机敞口。因此,对冲比例一定程度取决于服务商对未来算力利用率u预测的信心。

评论 (10)

登录 后即可发表评论
顺其自然88
顺其自然88 1小时前

推理市场微观结构复杂,各方都得找准自己定位,控制好成本和风险才能盈利。

0 回复
呀,兔子、

算力调度优化能提高利用率,这方法和航空公司超售机票类似,还挺巧妙的。

0 回复
山哥
山哥 1小时前

Token需求弹性挺复杂,增量边际需求弹性高,服务商得好好研究定价策略。

0 回复
清醒温柔知进退

开源模型带动GPU租赁需求上升,投资热度也高,感觉未来这方面竞争会很激烈。

0 回复
@一米阳光@光到之处皆是繁华@9527

OpenRouter服务费有点高,以后估计会有低价竞争者,平台得靠服务稳住用户。

0 回复
更多