你花一块钱,巨头补贴五块六,也盖不住几千块成本黑洞
摘要
这不是理财广告,是我用两天实测亲手算出来的数字。 腾讯WorkBuddy,70块月费,含4000积分。按我的实测兑换率(1积分≈4100 Token)和Kimi K3 API均价折算,4000积分可调动1640万Token,API价值约394元——补贴约...
这不是理财广告,是我用两天实测亲手算出来的数字。
腾讯WorkBuddy,70块月费,含4000积分。按我的实测兑换率(1积分≈4100 Token)和Kimi K3 API均价折算,4000积分可调动1640万Token,API价值约394元——补贴约5.6倍。
隔壁阿里千问办公,78块月费,含8000积分,按实测兑换率和Qwen3.8-Max均价折算,8000积分可调动1280万Token,API价值约169元——补贴约2.2倍。
需要说明的是,以上算的是旗舰模型API公开价。如果用户不自主选择,平台后台实际调用简单任务用便宜模型,复杂任务才上旗舰,这是行业通行做法。平台的真实算力成本可能远低于我算的这个数。
从补贴力度可以看到腾讯对桌面AI入口的投入强度以及战略决心,但是,千问办公用的是阿里自研的Qwen3.8-Max,混合均价大概13.2元/百万Token。WorkBuddy用的是第三方的Kimi K3,混合均价24元/百万Token,贵了约82%。
这意味着,WorkBuddy"5.6倍补贴"里相当一部分,可能不是腾讯主动让利,而是Kimi K3价格带来的被动价差。如果两个平台用同一个模型,补贴差距未必这么夸张。
而且,在2026年7月的SuperCLUE中文大模型综合评测中,Qwen3.8-Max以71.48分排名第一,Kimi K3以70.68分紧随其后,差距仅0.8分,意味着千问办公用更低的价格调动了与WorkBuddy调动的实力相当,甚至更优的模型,这也意味着:补贴力度更大可能是为了弥补在基础大模型上的竞争力短板,而非在用户侧的优势,相反,谁把模型成本做低,谁可能就不那么需要靠大额补贴来维持竞争力了。
但是总体而言,腾讯的补贴力度带来的市场价值(或者说价格)是更大的,如果用户要用到K3,在WorkBuddy调用,显然划算些。
毕竟相比,"平台定价体系内"的补贴倍数,用户真正关心的,是另一笔账:如果平台不补贴,我两天实测消耗的算力值多少钱?
千问办公这边,两天约900万Token,按Qwen3.8-Max API牌价,95%输入+5%输出结构,混合均价13.2元/百万Token:900万÷100万×13.2元≈119元。(Agent任务中上下文重传占绝对大头,Token消耗绝大部分是"输入"而非"输出",输入输出比通常可达20:1甚至更高,5%输出是保守估计)
WorkBuddy这边,两天约700万Token,按Kimi K3 API牌价,同样95%输入+5%输出结构,混合均价24元/百万Token:700万÷100万×24元=168元。
两笔加在一起,两天约287元。按这个强度外推一个月,约4300元。这是我这个"定时任务+长文修订+品牌共创"重度用法的真实算力成本。158元的订阅档根本包不住,我只是在用积分包填坑。
但拆开账单之后,我发现了三个问题。每一个都让我觉得,这钱没那么好省。
跑完之后,我对着账单坐了二十分钟。不是因为数据太复杂。是因为我发现,这场巨头们烧钱补贴的赌局里,我可能是他们最不想见到的那种用户。
这篇文章,就是我把账拆开之后看到的全部真相。
01 先交代全貌
千问办公这边,两天,约900万Token。拆开看:简报第一次跑111分钟,烧掉约200万;简报第二次20分钟,约70万;值班日报约180万;长文四轮修订约300万,是最大单项;调研与杂项合计约150万。
WorkBuddy那边,品牌共创全流程,约700万Token,折合1500到1900积分。
账单的结构里藏着三个事实。
第一,最贵的不是思考,是记忆。
为什么这么重?因为Agent模式下,每一轮对话都要把完整上下文——系统指令、工具定义、全部历史交互——重新喂给模型。第30轮的成本大约是第1轮的10倍。生成的新Token只占总消耗的5%左右,剩下95%全是上下文的重复输入。
这不是浪费,是架构代价。Agent每走一步都要"回头看"自己走过的所有路,走一步看一路,任务越长,回头看越贵。你付的钱,大部分不是在买"新想法",是在买"它别忘掉之前的事"。
第二,定时任务是后台的成本炸弹。两个定时任务占掉两天消耗的一半,而且是固定开支,每天准点烧,不看也不停。
第三,这笔账单有真实的刻度。两天里我的千问办公账户实际消耗了五千多积分。第一天我拿到官方定向赠送的一万积分,注册赠送两千,两天登录又入账两百,总积分一万两千两百,全部任务跑完,还剩六千出头。用系统核算的900万Token除以这五千多积分,能倒推出一个官方没有公布的兑换率:1积分约合1500-1600Token。免费档每天送100积分,而我日均消耗两千五以上,是免费额度25倍的重度用户。
对官方而言,我不是什么被赠送积分覆盖的用户,而是一个纯亏损用户。Microsoft 365 Copilot的3000万付费席位里,周活只有两到三成,留下来的人,恰恰是烧得最狠的人。巨头们抢的入口之战,最终都要落在少数重度用户与赔率表之间的拉锯上。
02 定时任务:后台沉默的成本炸弹
用千问办公设置了两个定时任务。一个是自媒体每日简报:投研、AI、互联网、硬件共53个账号,每篇约500字摘要,生成Word,每天中午交付。另一个是AI行业值夜班日报:十个板块,中英对照原声,HTML、Markdown、Word三版输出。
两个任务,两天,三份日报级交付。
第一次跑简报,111分钟,烧掉约200万Token。第二次跑,20分钟,约70万。成本差近三倍。
变量不是模型,不是智力,是路径。第一次撞上成片拒绝直连的站点,Agent不断重试、绕行、换源,每绕一次都要把全部历史重读一遍;第二次它已经记得哪些路走不通,直奔正确的路,账单直接砍掉三分之二。
定时任务的另一个特征是固定开支。两个定时任务占掉两天消耗的一半,每天准点烧,不看也不停。按这个强度外推,仅定时任务每月约1亿Token,裸算力成本每月约千元级别。定时任务越多,账单越沉重。
03 长文修订:最大的单项
最重的一项,是一篇二万字长文的四轮修订,实际上,这篇稿子最主要的部分、花了最多时间的交互打磨,都是用别的模型完成的。
四轮修订,约300万Token,是千问办公这边最大的单项消耗。从结构调整到论据补强,从语言打磨到定稿校对,每一轮都在压缩、补全、重排。但第三轮跑偏了——AI过度压缩,把核心论证链砍断了一环,输出方向偏离了原意。靠我手动掰回,重写了那个段落。其余三轮顺利落地,Markdown与Word双版本交付。
Agent的现阶段就是这样:它能交付,但中途需要人看着;它不能全信,但已经值得算账。
04 WorkBuddy的另一笔账
千问办公的账单是"定时任务+长文修订"的重度样本,那WorkBuddy这边就是"品牌共创"的完整切片。
两个自媒体品牌,从零开始:起名、slogan、三十个logo、几十张渲染图。系统实时核算的Token账单约700万,折合1500到1900积分。
交付物摆在桌面上:三十个logo里,真正能用上的只有一个(其实就是探花AI飞刀这个号的logo)。账号名最终是自己想的。整个过程中最核心的思考——品牌调性判断、slogan方向取舍、视觉风格审美决策——还是靠人。长文修订也一样。它能压缩、能补数据、能调结构,但一旦涉及"核心论证链是否成立""逻辑推进是否有说服力",它就会跑偏——就像第三轮修订那样,需要人手动掰回。
半自动化,但是也已经够用了。
WorkBuddy高级版140元买9000积分,每积分合一分六厘;而按市场算力价,这一积分背后的成本是6分到2毛4。倒挂五到十倍。
用户烧得越狠,平台亏得越多,这也引出了最致命的问题:如果明天补贴停了,我还会为这820块的算力买单吗?
05 同一个任务,三倍方差
同一个简报,同样的53个账号,同样的交付要求:第一次111分钟,第二次20分钟,成本差近三倍。方差,而不是智力,才是这条赛道眼下的真正分水岭。
这也是全行业的共同赌注所在。第三方实测显示,字节扣子空间的任务成功率约70%,仍不及Manus官方宣称的85%;网页操作类基准从14%爬到60%,人类是78%,而单步成功率60%,连续8步全对的概率只剩25%。
Agent = 基础模型 + Harness。基础模型没变,价格差三倍,差的全在Harness那层薄薄的东西里——路径记忆、失败规避、任务路由。微软的CodeAct用这套编排里的模型路由,把Token消耗砍了64%:简单活给便宜模型,硬骨头才上旗舰。模型不再是信仰,是零件。智力的上限由模型决定,账单的下限由管控决定。
我也见到了Harness的反面。值班日报跑到第62分钟,报了一个错:模型流超时,120秒无响应。Agent没有睡着,它是在原地空转着烧钱,直到保险丝熔断。我手动接续,日报才跑完。
那一刻我突然理解了生死账里引用的那张亚马逊账单——AI请求空转五个月,烧出180万美元,超预算860%。大厂的灾难与我的一次超时,是同一门物理学,只是量级不同:该装的熔断、该记的重试、该避的路径,都属于Harness层的功课。Agent的成本管控,从来不是财务问题,是工程问题。
好在这一层真的会积累。用到第三天,它已经记得我要Word交付、中午交付、改稿只留一条主线;给我融新素材前,会先分级、问我确认范围,再动手;动我的原文件前,会先备份。Harness层沉淀着最稀缺的数据资产,落到个人体验里,就四个字:越用越顺。
06 定价:订阅是一场赌局
先摆我自己的数字。算力口径:按两天样本外推,我这个用法如果按API市场价实付,每月裸算力成本约4300元——已经快要顶得上一个实习生的月薪了。积分口径更直接:两天烧掉五千多积分,照这个强度跑一个月,大约七万五到八万积分,而千问办公个人高级版158元月产能上限不过六万四。我这个用法,任何订阅档都包不住。
平台都在赌大多数用户不会像我这样用。
而我两天烧掉五千多积分、外推月均4300元算力消耗——这不是平台的补贴承诺,是我的实测账单。当然,平台不会并不会每月按这个强度补贴我,这是用户自己的账单。
算到这里,不妨把账再放大一层。
按两天实测外推,我这个用法的月均算力成本约4300元,已经快要顶得上一个实习生的月薪了。
但这是"重度用法"。如果我降一半强度——日报只跑一份,不做四轮长文修订,品牌共创只做单品牌——月均成本就落到2000元上下。这个数,比任何人力都便宜,交付物虽然需要人审核,但省掉的是最耗时的"从零到一"。
所以真正的判断是:重度用,算力成本逼近人力;适度用,碾压级性价比。
它的定位从来不是"替代人",是"放大人的效率"。你把30%的活交给它,它省你一半的时间;你把80%的活交给它,它可能拉出你一整份工资的账单。
关键不是AI贵不贵,是你怎么用。更深一层:如何看待这份账单。 纳德拉6月播客给出的框架是:Token不是消费品,而是"Token资本"。用户要回答的不是花了多少钱,而是每花一块钱Token,累积了多少属于自己的AI能力。
订阅制的本质是一场赌局:赌大多数用户买了不用。Copilot的3000万席位、两三成周活,是庄家的赢利面;我是反面,庄家最怕的那种用户,付158,烧掉的是远超订阅费的算力。而且这个悖论是结构性的:最愿意买高价套餐的,恰恰是调用最多、服务成本最高的人。用户从资产变成成本项,这是互联网商业史上罕见的倒挂。
Anthropic和Cursor已经先踩了这道雷——封杀额度复用、撤回、被诉、转向按量计费,订阅制的裂缝早在去年就裂开了。a16z的判断不留情面:订阅已触天花板,走向十亿用户,按量计费或广告是必经之路。
PPIO创始人姚欣说得最狠:今年Agent兴起,跑一个任务轻松消耗上百万Token,Agent消耗的Token量已超过人类,行业要从按Token计价转向为任务结果付费,而Token计价的宿命,是每年跌价十倍。
那赌局能不能打平?高盛五月的报告说得清楚,Token定价已经止跌,底层算力成本还在以每年六成到七成的速度压缩;价格止跌,成本续降,剪刀差就是利润。Anthropic的ARR从90亿美元冲到600亿,有望在三季度GAAP转正。拐点,就这两年。
订阅买工具使用权,按量买水电,结果买劳动。眼下行业正在发生的,就是从第一阶段向第二阶段的大迁徙。而千问办公的积分制,其实就是第二阶段的封装——赠送、充值、月度额度,都是按量计费的元件,只是套了一层游戏化的外壳。
补贴填不了的成本黑洞,最终只能靠技术迭代去填上。谁先能把4300元的用户成本,打成430元,谁才是真正能够留下用户的平台。但是真正做到这种迭代的模型最终可能不只是迭代了技术,还会迭代掉靠补贴辛辛苦苦维持的所谓“入口”
07 账本缺页
积分与Token的兑换率是多少?官方没说。应用的用量页只有一个汇总,没有逐任务消耗明细接口。但我的实测把它逼出了一个近似值:五千多积分,约900万Token,1积分约合1500-1600Token。这样逼出来的兑换率当然不精确,但它是普通用户眼下唯一能抓住的锚。
拿WorkBuddy的账单再对一次,问题更清楚了:700万Token折1500-1900积分,1积分约含4000多Token。同样叫"积分",两边的含金量差了大约两到三倍。积分根本不是通用度量衡,跨平台连比价都做不到。黑箱不是一层,是两层。
这不是一家公司的问题,是整个行业的集体不成熟。卖水电的有水表,卖燃气的有燃气表,卖Agent的,还在用一张只写总金额的餐厅小票。Gartner预测超四成的Agentic AI项目会在2027年底前被取消,成本失控是重要原因;企业想给Agent批预算,先要向财务解释单价,而厂商连一张逐任务的价目表都拿不出来。谁先把明细表做进产品主界面,谁就先完成从"卖盲盒"到"卖水电"的转身。
08 附:两套积分制的算力账
上面的账,算的是"我烧了多少"。下面这笔账,算的是"平台给我的是多少",把积分的黑箱撬开一条缝。
Qwen3.8-Max混合均价13.2元/百万Token的推算
阿里云官方API定价为:输入12元/百万Tokens,输出36元/百万Tokens。
实测中Agent任务上下文重传占绝对大头,输入Token约占95%,输出Token约占5%:
12元 × 95% + 36元 × 5% = 11.4 + 1.8 = 13.2元/百万Token
Kimi K3混合均价24元/百万Token的推算
月之暗面官方API定价为:输入20元/百万Tokens(缓存未命中),输出100元/百万Tokens。按同样95%输入、5%输出的任务结构计算:
20元 × 95% + 100元 × 5% = 19 + 5 = 24元/百万Token
实测兑换率:
千问办公:5,500+积分,约900万Token,每积分约1,600 Token。
WorkBuddy:1,500-1,900积分,约700万Token,每积分约4,100 Token。
同样叫"积分",含金量差约2.6倍。
验证:
千问办公个人标准版78元/月,月均8,000积分,可调动1,280万Token,按Qwen3.8-Max混合均价13.2元/百万Token折算,API价值约169元——补贴约2.2倍。
WorkBuddy标准版70元/月,月得4,000积分,可调动1,640万Token,按Kimi K3混合均价24元/百万Token折算,API价值约394元——补贴约5.6倍。
09 写在最后
两天高强度实测,我的判断分三层。
内容工作者与研究者,是眼下桌面Agent性价比最高的客群。定时日报加长文修订这套组合,一天数百万Token,几十元算力,换回的是两三千字的成品简报和三版日报。对比雇一个实习生,是碾压级的正收益。
企业用户,先装熔断再谈规模。Uber四个月烧光全年预算、亚马逊空转烧出180万美元,不是段子。
重度用户,先上高级档,再备好积分包。只跑定时任务的话,日均约一千九百积分,高级版每天两千的赠送刚好够;一旦叠上单次重任务,月消耗直接破十万,任何订阅档都包不住。庄家赌我不常用,我赌它扛得住。
Token会越来越像水电煤,便宜、按量、夜间打折;Agent会越来越像员工,按岗位计价,按结果付费。
但如果成本不降呢?
虽然这些都是日常需求,但是在没有补贴的情况下,我大概率不会选择这样使用——4300元的月账单,不是每个人都能闭着眼续的。
得成本者得天下。事实上成本正在高速率走低,但是这种走低在各个厂商主导的大模型并不是均匀分布的。
如果没有快速持续压降算力成本的能力,所有补贴、工作流、生态位、入口,最后可能都不过是给别人培育用户习惯。
2026年桌面Agent战争的走向,不写在巨头的资本开支表里。
它写在每个用户的账单上。
评论 (10)
腾讯补贴高可能是模型贵导致,阿里千问性价比好像更高点,这补贴差距有点虚啊。
Token以后会像水电煤一样,按量计费说不定是趋势,这行业变化快。
用AI得看怎么用,适度用性价比高,重度用成本快赶上请人了,得把握好度。
内容工作者用桌面Agent挺划算,能省不少事和钱,这是个好工具。
成本降不下来,补贴也没用,最后可能就是给别人培养用户习惯,厂商得重视成本。
积分制太乱了,不同平台积分含金量不一样,这行业太不成熟,得有个标准。
定时任务成本炸弹太坑了,每天准点烧钱,这谁顶得住,得控制下。
大模型成本下降不均匀,谁先解决成本问题,谁就能在桌面Agent战争中胜出。
重度用户先上高级档备积分包是对的,不然订阅档根本包不住消耗。
企业用AI得先装熔断,不然像Uber、亚马逊那样烧钱,谁也受不了。