字节为何拒绝蒸馏:一家AI巨头的八重逻辑
摘要
一、政治账:被点名一次,赔掉的不是面子,是主营收入2026年上半年,中国头部AI实验室接连被美方点名:Anthropic指控DeepSeek、月之暗面、MiniMax发动工业级蒸馏攻击;美国参议院银行委员会收到来信,直指阿里巴巴;...
一、政治账:被点名一次,赔掉的不是面子,是主营收入
2026年上半年,中国头部AI实验室接连被美方点名:Anthropic指控DeepSeek、月之暗面、MiniMax发动工业级蒸馏攻击;美国参议院银行委员会收到来信,直指阿里巴巴;白宫科技政策办公室主任在社交平台公开点名月之暗面;财政部长表态将调查知识产权窃取并准备制裁。半年之内,四家主流实验室全部进入美方监管视野。
字节跳动不在任何一份名单上。这不是侥幸,而是精算。TikTok USDS合资公司股东包括甲骨文(美国联邦核心供应商)、银湖资本、MGX(阿联酋主权基金)、General Atlantic等全球顶级机构。董事会由美国人主导,算法授权与审计机制完全嵌入美国合规框架。一旦Seed被证实蒸馏,当天就会触发合资方的合规质询、审计介入甚至合同重审。
对比损失结构:DeepSeek承受舆论压力,月之暗面失去海外开发者信任,阿里面临实体清单与诉讼成本。而字节要保护的是——数百亿美元级的美系硬件订单、受控于美方的算法主权、以及TikTok在美国市场的存续基础。用2025年预估净利润380–450亿美元作分母,‘榜单上升三位’带来的边际收益趋近于零;而一次制裁调查或董事会质询,动辄牵涉百亿量级资产。这不是长期主义,是风险收益比驱动下的理性克制。
二、赚钱效应:份额不是利润,蒸馏买分数,自研买成本曲线
火山引擎数据显示,豆包大模型日均Token调用量达180万亿,占国内MaaS市场49.5%;视频生成领域,Seedance市占率超80%。但这些数字背后是真实成本结构:2024年主力模型定价仅为同行1%,两年间调用量增长1500倍,单位价格却始终在地板线上徘徊。
视频生成是全行业算力密度最高的负载,一次生成消耗的FLOPs是普通对话的数个数量级。80%的市占率,意味着字节承担了全行业最昂贵品类中80%的成本。与此同时,2026年资本开支上调至300亿美元以上,其中140亿用于采购英伟达GPU;全行业算力已进入全面通胀周期——阿里百度提价、智谱三度涨价仍供不应求、DeepSeek登顶OpenRouter后亦预告‘涨幅较大’。
决定这门生意能否盈利的核心变量,从来不是榜单排名,而是单位智能的成本。蒸馏能提升评测分数,却无法压缩FLOPs消耗、显存占用或Token长度。第三方评测显示,Seed 2.1 Pro在高档位下平均Token用量达65K,比第二名高出25%,定价也近乎翻倍。这是成本信号,而非能力信号。真正压降成本曲线的,只能是架构创新与训练方法突破——蒸馏解决不了,反而会把教师模型的冗余习惯一并继承。
三、要素禀赋:蒸馏是穷人的替代品,而字节样样都不缺
蒸馏的本质,是以他人算力与数据,替代自身稀缺资源。判断一家公司是否该蒸馏,首先要看它缺什么。字节的家底清晰可见:
算力:2026年资本开支超300亿美元,140亿专用于GPU采购;同步测试华为950PR等国产芯片;泰国250亿美元、芬兰12亿美元数据中心在建。
人:前Google DeepMind研究副总裁吴永辉2025年入职;Seed团队从2024年200人扩至2025年300人以上;2026校招研发岗需求同比增23%。
数据:旗下产品全球月活超40亿;抖音月活破10亿;豆包2026年6月月活3.82亿;每日数十亿次真实交互。
场景:豆包、即梦、TRAE、火山引擎全部基于Seed模型构建;MaaS日均180万亿Token的真实反馈闭环。
四者齐备,蒸馏对字节而言,不是补短板,而是花钱购买自己已拥有的东西,并付出三重不可逆代价:能力上限被锁死在教师模型天花板;教师模型从未见过短视频运镜、直播电商意图匹配、中文长链路Agent任务等真实负载;归因体系被污染——三个月后指标上涨,无法拆解是新数据配比、RL改进,还是单纯搬来了教师能力。对一家年投三百亿美元算力的公司,失去归因能力,等于永久丧失判断投入是否有效的能力。
四、竞争终局:蒸馏的尽头是同质化,同质化的尽头是价格战
若国内头部实验室普遍以同一波美国模型为教师,则能力必然收敛:推理轨迹、工具调用格式、代码风格趋于一致。国产模型在主流基准上的分差已压缩至个位数,许多任务肉眼难辨。
差异化消失后,唯一变量只剩价格。火山引擎2024年打到同行1%的价格,智谱三次涨价仍供不应求,MiniMax与智谱ARR虽达1.5亿–2.5亿美元,但在数百亿美元算力账单面前,这个量级反映的实则是行业整体利润率的塌陷。
上游GPU、内存、电力持续涨价,下游价格触底,终局就是血汗工厂形态:越努力,越替英伟达和电网打工。但这一逻辑对字节不成立——抖音月活覆盖中国70%人口,豆包月活3.82亿,全球产品月活超40亿。字节不需要用低价换流量,它本身就是流量入口。参与价格战,等于主动压低自家商品售价,换取本就免费拥有的用户规模。更深层看,选择蒸馏即接受结构化跟随者身份:能力来自同一源头,只能靠价格竞争,利润率被天然锁定在零附近。字节过去最擅长的,恰恰是在别人打价格战的市场里,用完全不同路径绕开红海。
五、路线孤例:全闭源,让蒸馏的收益没有兑现渠道
字节是国内主要AI公司中,唯一一家大语言模型几乎全部为专有模型的企业。这句话不是背景,而是关键钥匙——它决定了蒸馏收益能否变现。
开源厂商蒸馏后,权重一放,Hugging Face下载量、OpenRouter调用量、GitHub star、硅谷创业公司联名信立刻兑现为政治资本与全球话语权。Kimi K3发布后,近200家硅谷公司致信特朗普政府,黄仁勋公开表态支持使用中国模型,OpenAI总裁承认其水准。一次能力跃升,直接换来规则制定权的再分配。
闭源厂商蒸馏后呢?收益只能缓慢渗透至豆包体验或火山引擎企业客户稳定性中。用户不会因SWE-Bench涨三分多用两小时,客户不为LMArena名次买单,只认单位成本与服务SLA。你冒了同等风险,却拿不到那份可兑换政治保护的声量。更关键的是,检测手段已从前端权重转向API行为层:Anthropic可记录请求元数据与硬件特征,交叉比对定位具体员工与产品节奏。闭源不再是护城河,风险相同,收益更少——这笔账,在任何成本敏感组织里都无需计算。
六、国家层面:蒸进来的不只是能力,还有价值观
蒸馏传递的不仅是答题能力,更是教师模型输出分布的全部隐性特征:拒答边界、中立表述、历史叙述框架、‘有帮助’的判定标准、争议立场倾向。这些不写在权重某一层,却弥散于每一次输出中,学生模型学的正是这个分布。
美国模型的这套倾向,源自其训练语料、标注团队与对齐规范,具有明确文化立场。当中国模型系统性以之为训练目标,继承的就不只是推理能力,还有一整套未经本土化适配的价值判断。工程上可通过安全微调打补丁,但底层倾向难以根除——尤其在长对话、多轮Agent任务、边缘场景中,教师底子必然浮现。而中国模型需通过《生成式人工智能服务管理暂行办法》备案,安全评估正聚焦此类行为。一个底层倾向来自外部的模型,合规成本将持续存在且高度不稳定。
更宏观看,中国正加速推进算力自主:字节与阿里同步测试华为AI芯片,国家数据局数据显示日均Token调用量两年增长超千倍。若硬件与基建走向自主,顶层智能却仍依赖外部蒸馏,则体系形态变为‘硬件自主、基建自主、智能依赖’——最核心的能力来源仍在他人手中,且随时可能被切断。Kratsios对蒸馏的区分(合法创新 vs 秘密工业化)本身即是政策工具,每个被证实蒸馏的模型,都是出口管制阵营手里的证物。此时,一家无蒸馏记录、能力纯自研的中国实验室,其战略价值远超榜单第一:它证明中国模型的能力,不必非靠蒸馏才能获得。
七、技术天花板:能复制答案,复制不了产生答案的机制
在出口管制下,堆规模已无超车可能。唯一机会,在于架构、数据配方或训练方法上找到单位算力效率更高的路径。而这类真实突破,恰恰是蒸馏无法复制的。
DeepSeek的MLA架构与MoE路线整体压降成本结构;月之暗面Kimi K3采用稀疏混合专家架构,运行时从896个专家中激活16个,并引入Delta Attention与Attention Residuals,官方称计算资源转化效率比K2提升约2.5倍。这种结构性效率提升,源于对计算本质的理解与重构,而非模仿答案分布。你能蒸出它的输出,蒸不出它为何能用更少算力达成同样效果。
蒸馏优化的是‘每月分数涨多少’,而非‘每张卡产出多少智能’。对不缺卡的字节,前者可有可无;对缺卡的公司,前者只是止痛药——它制造差距缩小的幻觉,推迟真正必须做的事。更远的问题是:当教师模型自身撞上能力边界,蒸馏一方将彻底丧失方向感。它从未练习过自己找路,只习惯沿着别人趟出的轨迹前行。今年Agent时代已初现端倪:真正的难点不是单点能力,而是长链路稳定性、工具调用可靠性、超长上下文一致性——这些能力只能来自模型与真实场景的反复交互,来自在自己土壤里踩过的坑。教师模型没在你的场景里摔过跤,给不了这部分答案。
八、组织与人:这套配置是按‘自己走到前沿’搭的
听创始人说什么,不如看他把时间与人放在哪里。张一鸣将约50%精力投入Seed,自2024年下半年起每月参加核心技术复盘;角色被类比为回归后的谢尔盖·布林,专注前沿技术判断。
人才配置更具指向性:前Google DeepMind研究副总裁吴永辉2025年加盟;Seed团队2024年突破200人,2025年超300人;2026校招研发岗需求激增;张一鸣个人设立知春创新中心,从预备研究员开始培养长周期AI人才。
组织演进路径清晰:2023年2月独立组建,年底即升格为与抖音、TikTok平级的一级BU;2023下半年AI Lab NLP组整体并入;2024年PixelDance视频团队转入;2025年集团级AI Lab全部并入;2026年7月飞书产品团队并入豆包,销售团队划归火山引擎——一个曾经的一级BU,一夜之间不再独立。
这套配置指向一个明确目标:自己走到前沿。若最优解是搬运他人输出,三年招的人、开的会、设的团队,逻辑上全是浪费。没有创始人会允许这个结论在自己的组织内成立。张一鸣在管理层已解释后仍亲自开口,恰恰说明这不是一次对外宣示,而是一次对内的强制共识统一。它之所以流出外媒,本身已是信号:一个真正统一的共识,通常不会成为记者的消息源。
评论 (8)
赚钱得看成本,蒸馏提升不了性价比,字节有自己的技术路,算是比较有远见的决策。
张一鸣这么重视亲抓,组织配置也朝着自研,蒸馏不符合字节发展方向,肯定不搞。
国家层面,蒸馏引入价值观问题还影响自主,字节不蒸馏,符合整体发展大势。
资源咱不缺,蒸馏还锁上限,字节有这个家底,不搞蒸馏是对的,能把自身优势最大化。
闭源蒸馏收益难变现,风险还大,字节的选择很实际,没去做这种不划算的事。
竞争上蒸馏会导致同质化价格战,字节流量不愁,没必要趟这浑水,走自己的差异化路线。
技术上蒸馏有天花板,复制不了核心,字节靠自己钻研才能突破,不能依赖蒸馏。
字节不蒸馏挺明智,政治风险大,还不如保主营和市场,蒸馏那点收益跟损失比不值一提。