风险提示:理性看待区块链,提高风险意识!
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

“大力出奇迹”!报道:字节讨论训超5万亿参数模型,争取领先位置

摘要

《晚点 LatePost》独家了解到,字节跳动正在讨论训练一个参数规模超 5 万亿的模型,它超过阿里的 Qwen 3.8-Max(2.4 万亿参数)和月之暗面的 K3(2.8 万亿参数),也是目前国内已知参数规模最大的模型。通常而言,...

“大力出奇迹”!报道:字节讨论训超5万亿参数模型,争取领先位置

《晚点 LatePost》独家了解到,字节跳动正在讨论训练一个参数规模超 5 万亿的模型,它超过阿里的 Qwen 3.8-Max(2.4 万亿参数)和月之暗面的 K3(2.8 万亿参数),也是目前国内已知参数规模最大的模型。通常而言,模型规模越大,智能水平往往越高。不过该计划仍处于早期阶段,并不代表模型最终一定会发布。

新模型将由 Seed Foundation 负责人项亮主导,与大语言模型预训练数据负责人沈科合作。为此,Seed 正在重新梳理组织,划分职责,分配资源。

项亮与沈科均是字节跳动人工智能及大模型研发体系内的核心骨干,均出自字节的 “搜广推” 体系。项亮本科毕业于中国科学技术大学,博士就读于中科院自动化所,2016 年加入字节,曾负责机器学习中台 AML 团队,后调任豆包大模型 Foundation 团队任负责人。沈科 2018 年清华毕业后,加入字节跳动,现主要负责 LLM 预训练数据。

自字节入局大模型以来,Seed 一直被视为国内最有希望的团队之一。豆包有今天超过 2 亿日活的用户体量,很大程度上也归功于 Seed 。但今年,质疑声开始出现。

2 月中旬,吴永辉执掌 Seed 后推出的关键模型 Seed 2.0 正式发布,但市场反响有限。几乎同一时间,智谱开源的 GLM-5 被市场视为国内第一个能与 Anthropic Opus 系列比肩的模型;7 月,月之暗面的 Kimi K3 发布,多项第三方评测认为,它已接近海外闭源旗舰。

多位字节人士告诉我们,上半年,Seed 许多团队也在不断反思。这是字节讨论训练超 5 万亿参数模型的原因之一,与其在现有尺寸上继续追赶,不如把参数规模一次推到同行的数倍,争取领先位置。“像一场赌博。” 一位接近 Seed 人士说。

就在两周前,字节跳动创始人张一鸣与 Seed 负责人吴永辉共同召开了一场 Seed 全员会(All Hands)。久未露面的张一鸣也表达了自己对 seed 的支持。我们独家了解到:

  • 张一鸣在会上安抚了 Seed 的成员。他认为,训大模型本就是一件很难的事,团队不必过度焦虑。他明确一段时间内可接受模型落后于行业,希望大家以追求智能上限为目标,期待 Seed 模型能力能跻身世界第一梯队。
  • 他认可编程(Coding)是当前的关键方向,所以要把火山引擎、飞书和豆包的资源整合到一起,只有这样才能构筑在算力和数据上的优势。但他也提醒,编程只是眼下的热点之一,不应该完全被它牵着走,编程之外还有更多更大的机会。
  • 他表扬了 Seedance,认为这个模型在市场上很特别,也有领先的技术优势。相比追随其它领先模型的既有路线,他更鼓励 Seed 做出有自己特色的模型。
  • 张一鸣还谈到了自己对模型蒸馏的看法。他反对蒸馏,认为蒸馏能在短期内改善模型表现,但本质上仍是在复制 Claude 已有的能力。沿着这条路走,最多只能不断逼近对方,很难真正实现超越。他也希望 Seed 可以从更底层的维度去构建自己在 AGI 上的壁垒。
  • 过去几年,字节已经在 AI 方向投入了很多;未来,还会投入更多。

过去半年的 Seed:多模态领先、大语言追赶

过去半年,Seed 的多模态模型取得了显著成绩:今年 2 月上线的视频生成模型 Seedance2.0 和图片生成模型 Seedream 5.0 Lite 声量一度超过业内其他同类模型,迅速引发关注。Seedance2.0 成为火山引擎 MaaS 业务营收的基本盘。

同期发布的语言模型 Seed 2.0,市场反响却较为有限。它一度因较好承接春节期间涌入的 C 端需求,在内部获得好评。但春节大战中,Anthropic 凭借 Opus 系列的 Coding 能力迅速打开程序员和 B 端市场,ARR 很快逼近并反超 OpenAI。中国大厂这才意识到,自己错过了 Coding 的窗口期。与此同时,GLM-5 和 Kimi K2.5 的 Coding 能力也已明显领先。

模型能力的落后影响到了收入端。据我们了解,火山引擎目前是国内最大的模型 API 卖家,市场份额约占一半。火山引擎 2025 年的收入在 150 亿元左右,今年内部定下的目标是超 400 亿元。目标虽大,但并非没有隐忧。

火山引擎的 token 消耗能反应商业化的增长。多位接近火山引擎人士告诉我们,豆包大模型的 token 消耗中,超过一半来自 Seedance 和 Seedream 两个多模态生成模型系列,语言模型占比不高。

二季度以来,随着短剧行业增长见顶、经济大环境的变化,Seedance 的 token 消耗和收入增速放缓,并影响了火山 MaaS 的整体 token 增长——豆包大模型的 token 消耗,3 月为 120 万亿,6 月为 180 万亿,低于原计划的 250 万亿至 300 万亿目标。

智谱和月之暗面凭借持续提升的 Coding 能力,ARR 分别突破 10 亿美元和 3 亿美元。

为补课 Coding 能力,张一鸣亲自邀请,高薪吸引 DeepSeek 核心研究员郭达雅加入 Seed,负责模型 Coding 能力的专项训练。字节将 Coding 相关的研发资源收拢整合,统一划归给郭达雅。同期阿里千问基模团队也投入更多资源和人力专攻 Coding 训练。

训练好的模型更重要的是数据。大公司可以凭借推动内部业务线使用自研模型做开发,形成真实场景反馈数据。但仅有这些还不够。

我们了解到,Seed 内部曾激烈讨论过蒸馏路线的可行性,字节高层则担心蒸馏对 Seed 和技术带来的危害。据 The information,张一鸣在 Seed 的 all hands 会议上明确表示,即使不蒸馏意味着公司在技术上会短暂落后国内竞争对手,也不会采用这一捷径来推进其 AI 模型能力。

8 月 6 日,字节跳动举行公司全员会。豆包负责人赵祺在会称,大模型的市场潜力很大,因此不担心经济回报,但收入还是重要的。

在模型研发上,字节拥有国内最充足的算力储备、业内领先的基础设施能力和高密度的人才队伍,这些构成了它的底气。Seedance 的成功也让字节看到,模型能力一旦领先,便能迅速转化为商业护城河。

一位字节人士说,Seedance 证明,用户会自然流向能力最强的产品。只要能在关键节点做到行业第一,就有机会快速抢占市场,因此不必过度焦虑于短期的排名落后。

继续大力出奇迹

字节自成立一直以来推崇 “大力出奇迹”:进入一个领域时,通常会成立不止一个团队,投入大量资源,同时推进多个项目。

2012 年,字节跳动刚成立时,上架了 13 个应用,最后内涵段子、今日头条获得大量用户,推动整个公司增长。2015 年开始,字节跳动陆续推出 20 多个应用进入海外市场;2016 年用 “火山”、“抖音”、“西瓜” 三路齐下短视频。最后,字节跳动在收获了今日头条后的增长曲线——抖音及 TikTok。后来的游戏和教育业务也延续了这个模式,推出数十款游戏和应用。

AI 上,字节也是投入最坚决的一家公司,资本开支最大、拥有最多的卡、招聘了最多的顶尖人才,穷尽所有业务方向,不放过任何可能性。

2025 年,视频生成领域的主流判断是:沿传统 DiT 架构(扩散式 Transformer)继续扩大预训练,提升空间已经不大,多数团队把重心转向后训练。据我们了解,快手可灵也曾尝试训练更大的模型,但没有做到极致,中途退了回去。

Seedance 选择反着来。他们决定投入更多资金和算力,把预训练做到极致。经过近一年优化,Seedance 2.0 成为第一个完整采用 MoE 架构的视频生成模型,参数 2000 亿。2026 年 2 月上线后,它迅速被公认为全球性能最强的视频模型。

今天,做大模型尺寸成为行业共识:7 月,月之暗面发布了 2.8 万亿参数的 Kimi K3,是国内迄今最大的开源模型;马斯克的 xAI 把 Grok 底座从 5000 亿参数扩到 1.5 万亿,并称下一代要做到 6 万亿;OpenAI 与 Anthropic 也曾传出要训练更大尺寸的模型。在语言模型上落后的字节,想用同样的方式赌一把弯道超车。

这不是件容易的事。视频模型整体所需的资源不算多,比如对推理芯片的要求低、研发人力也更便宜——Seedance 核心算法成员仅十余人。但更大参数的语言模型涉及到除了算法层面的创新之外,团队还要面临处理完全不同量级的系统工程,更大量、更多样的数据,以及需要组织各个部门之间深度配合。

不过变化正在发生。字节高层在 Seed 内部极力推动取消赛马机制,收拢在同一个方向上的资源,即使工作上有重合的地方也尽力明确划分职责。Seed 也尝试打破部门墙,让不同部门之间的人合作起来。

一位曾在 Seed 的人士提到:“字节的文化可能不适合创新,但非常擅于解题。”Seedance 解开了第一道题,字节现在想用同样的方法解下一道。

来源:晚点 LatePost

评论 (4)

登录 后即可发表评论
孟龙
孟龙 42分钟前

字节这是下血本了,搞这么大参数模型,虽说有机会领先,但难度也不小,就看能不能成了。

0 回复
初见
初见 42分钟前

训练超5万亿参数模型这事儿有点激进,系统工程、数据啥的都得跟上,不然容易搞砸。

0 回复
XIA
XIA 47分钟前

字节一直靠大力投入出成果,这次在AI上再赌一把,就看能不能突破了。

0 回复
可可西里
可可西里 48分钟前

之前多模态还行,语言模型落后了,现在赌大参数模型超车,希望能大力出奇迹吧。

0 回复
更多