一个被广泛误解的问题
2024—2025年,“随着规模增长,自建比API更便宜”几乎成为AI基础设施领域的默认共识。这个结论看似逻辑严密:API厂商要盈利,定价必然高于成本;自建省去中间利润,自然更划算。
但这一推导隐含一个关键前提——你的GPU利用率必须≥API厂商的利用率。而现实是:头部API厂商通过超大规模调度,集群平均利用率稳定在90%以上;中等规模AI创业公司的真实利用率,普遍落在30%–50%区间。
问题在于:你省下的那部分“厂商毛利”,很可能远不足以覆盖自身因低利用率导致的GPU折旧浪费。这才是“自建更便宜”共识最致命的逻辑断层。
一个真实的决策转折点
2026年Q1,一家月流水50万美元的AI客服创业公司找到我。其日均处理50万次对话,API调用成本高达18万美元/月,占营收36%。CTO计划采购8张H100自建推理服务,理由是“肯定更省钱”。
我只问了三个问题:
- “当前日均请求量?” → “50万次。”
- “准备部署多少GPU?” → “8张H100。”
- “预计GPU利用率能达到多少?” → “……没算过。”
这个回答代表了绝大多数技术决策者的现状:接受共识,却从未验证它是否适用于自身场景。
代入五维成本模型与盈亏平衡公式后,结果明确:按其实际负载特征,自建方案的千Token成本为$0.045,远高于当前API均价$0.002。不仅不省钱,还需额外承担硬件折旧、电力、制冷与运维人力等刚性支出。CTO当场中止采购计划。
五维成本模型:首次系统量化“空闲待机损耗”
传统成本测算常忽略一个核心项:GPU空转时仍在持续折旧。我们构建了推理成本五维模型,将年化总成本拆解为:
- GPU折旧(占比最大,且与利用率强负相关)
- 服务器其他硬件(电源、主板、内存等)
- 电力消耗(含PUE加成)
- 网络带宽成本
- 机房与制冷支出
- 专职运维人力(含SRE、MLOps工程师)
其中,“空闲待机损耗”被首次显性量化——买4张H100,年折旧$40,000;若利用率仅30%,则$28,000折旧成本实质上被浪费在空转上。这笔钱足以再购置一张H100。
这意味着:即使自建的理论单Token成本更低,只要利用率不足,GPU折旧的沉没浪费就会彻底吞噬全部成本优势。
52%:自建与API的成本分水岭
通过建立标准化成本函数,我们推导出自建方案跑赢API的临界利用率公式:
设API单价为P_api($/千Token),自建单位成本为C_self($/千Token),则自建更优的充要条件为:
C_self(U) ≤ P_api
其中U为GPU实际利用率。经参数校准与多轮迭代,该不等式解出唯一稳定交点:U = 52%。
即:只有当你的GPU利用率持续稳定≥52%,自建才真正具备成本优势。低于此值,所有“自建省钱”的直觉都是错觉。
蒙特卡洛敏感性分析进一步验证:在95%置信度下,该临界点区间为48%–56%,均值52%,结论稳健可靠。
API厂商的结构性套利:卖的不只是算力,更是调度效率
API厂商实际销售的是两样东西:
- 客户明确认知的——物理算力
- 客户普遍忽视的——跨客户动态调度能力
你支付的每一分钱,既包含自身请求消耗的资源成本,也隐含了API厂商将你空闲时段的GPU调度给其他客户的“时间差套利”。这种商业模式成立的前提,正是客户无法精确测量自身利用率。
一旦52%临界点被广泛认知和工具化验证,信息不对称消失,API厂商的定价权将实质性削弱。这不是降价压力,而是定价逻辑的根本重构。
决策指南:四层利用率分级法
基于实测与建模,我们提出可直接落地的决策框架:
- <30% → ❌ 绝对不要自建(成本劣势显著,风险集中)
- 30%–52% → ⚠️ 不建议自建(需优先优化调用链路、缓存策略、请求合并)
- 52%–80% → ✅ 可以考虑自建(启动技术评估与POC验证)
- >80% → ✅✅ 强烈建议自建(已进入高性价比区间,长期成本优势明确)
配套提供Python开源工具包,支持一键导入历史调用日志,自动计算真实利用率、盈亏平衡点,并运行蒙特卡洛模拟输出95%置信区间。
三个反直觉但已被验证的核心结论
结论一:70B以下模型,API普遍更便宜。 主流API服务已将千Token成本压至$0.0002–$0.01区间,较同配置自建低20%–50%。
结论二:52%是真正的“生死线”。 大多数AI创业公司正处30%–50%区间——他们不是“还没到自建时机”,而是正在为低利用率持续支付隐性亏损。
结论三:国产硬件重塑成本结构。 华为昇腾910B在中国区部署,综合成本仅为H100方案的1/3,临界利用率同步下探至38%,形成区域性结构性优势。
行业终局:当成本触达物理下限
推理成本的终极天花板由两项硬约束决定:硬件折旧 + 电费。代入典型参数(4×H100,70B模型,FP8精度),理论下限约为$0.0014/千Token。当前主流API报价$0.002,仅剩约30%降价空间。
这意味着:2026年Q4起,API价格将进入“底部区间”;2027年年中,成本竞争基本终结。此后,市场焦点将转向三个新维度:
- 价值锚点从“每Token多少钱”转向“每美元买到多少智能”
- 全球供应链裂变为美、中、欧三大独立成本体系
- 架构范式从纯云端API调用,演进为端云协同——90%轻量推理将在终端完成
52%不仅是一个数字,它是AI推理市场从信息不对称走向完全竞争的认知分水岭。越过它,决策才有依据;未及它,节省只是幻觉。
(10)
原来70B以下模型用API更便宜,还给出利用率分级决策法,挺实用的。
推理成本有物理下限,以后API降价空间不大,市场竞争会变方向。
API厂商靠调度效率赚钱,等52%临界点被广泛认知,定价权估计得变。
文章把自建和API成本分析得很透,还提到未来市场焦点转变,有前瞻性。
很多AI创业公司在低利用率区间还想自建,得好好看看这文章。
这文章说得挺有道理,自建AI推理得看GPU利用率,低于52%就别想省钱了,很多公司都忽略这点。
52%是关键,没达到这利用率,自建省钱就是错觉。
给出的Python工具包能算利用率和盈亏平衡点,挺方便做决策的。
行业终局说得有道理,以后市场会从成本竞争转向其他维度。
国产硬件优势明显,昇腾910B成本低,临界利用率也低,能省不少钱。