谷歌正在研发一款代号为「Frozen v2」的专用AI服务器芯片。它并非运行Gemini模型,而是将Gemini的底层计算架构——包括关键数据流路径、算子调度逻辑与内存访问模式——直接固化进硬件电路中。模型不是跑在芯片上,而是‘长’在芯片里。
当前主流AI芯片,无论是英伟达GPU还是谷歌自研TPU,本质都是通用计算架构:通过软件动态调度,适配不同模型。这种灵活性带来巨大开销——每一次推理都要反复搬运数据、解析指令、判断分支路径,就像一个全能厨师每次炒菜都得重读菜谱、重选锅具、重调火候。
Frozen v2彻底反其道而行之。它只为Gemini服务,把该模型最核心的执行逻辑‘浇铸’进硅片:哪些张量该走哪条通路、哪类计算该用哪种单元、缓存如何预取、权重如何分片加载……全部由物理连线决定。没有运行时决策,没有冗余搬运,没有动态调度。每一步都省下来,最终转化为实打实的能效提升。
最初的Frozen构想更为激进:由Jeff Dean团队提出,计划将Gemini的权重参数直接写入芯片ROM。但这条路被放弃——权重一旦固化,模型更新即意味芯片报废,生命周期过短,无法支撑迭代节奏。
Frozen v2是务实的演进:不固化权重,只固化计算架构。这意味着只要Gemini保持主干结构稳定(如MoE路由机制、注意力块组织方式、token处理流水线等),新版本参数仍可载入运行。芯片寿命不再绑定某一次模型发布,而取决于架构演进的步调。
谷歌正面临真实的算力瓶颈。Google Cloud已开始拒绝部分外部客户订单;6月,谷歌与SpaceX签下9.2亿美元/月的长期协议,租用11万张英伟达GPU——一家云计算巨头向火箭公司租算力,本身就是行业失衡的明证。
全行业都在加速走向专用化:亚马逊有Inferentia与Trainium,微软推出Maia,OpenAI内部组建芯片团队,初创公司如d-Matrix、SambaNova持续融资加码。英伟达去年斥资200亿美元收购Groq技术,也印证了推理效率已成为生死线。
内部测算显示,Frozen v2在单位功耗下的Token吞吐量,预计达最新TPU的6–10倍。但这份高效背后,是明确的取舍:芯片仅适配特定架构范式。若后续Gemini转向全新范式(例如抛弃Transformer主干、改用动态图神经网络或非冯·诺依曼结构),Frozen v2将迅速失去价值。
因此,它不是替代TPU的大规模量产产品,而是一次高精度工程验证:小批量部署,聚焦真实业务负载,检验‘架构固化’在延迟、能效、运维成本上的真实收益。成败不在于是否量产,而在于能否验证这条路径的技术可行性与商业阈值。
从TPU到Frozen v2,谷歌的芯片战略从未偏离同一主线:让软件定义硬件,再让硬件重塑软件。当模型复杂度逼近物理极限,竞争就不再停留在算法或数据层面,而下沉至晶体管排布、金属层走向、信号传播延时——AI战争,正式进入物理世界。
(7)
从软件到硬件深度融合,AI竞争进入物理世界,这趋势挺明显的
谷歌这是被算力逼得没办法了,只能搞这种物理级解法
之前固化权重不行,现在固化架构,路越走越务实了
十倍能效很诱人,但赌未来这事谁也说不准,就怕最后竹篮打水一场空
这思路挺独特,不搞通用搞唯一,就是不知道实际效果咋样
全行业都在搞专用化,谷歌这步棋走得不算意外,就看能不能成功验证了
把架构固化进芯片确实能提升能效,但只适配Gemini风险不小,未来Gemini一变它就可能废了