风险提示:理性看待区块链,提高风险意识!
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

AI Infra破局:当模型膨胀撞上国产算力崛起

摘要

模型架构膨胀与国产算力崛起,正重塑AI基础设施的底层逻辑 模型不再只是Transformer堆叠——MoE结构迭代加速,Index机制、压缩层、多模态融合持续加码;从LLaMA到DeepSeek-V4,从千问三模态到Cosmos V全模态,模型已...

AI Infra破局:当模型膨胀撞上国产算力崛起

模型架构膨胀与国产算力崛起,正重塑AI基础设施的底层逻辑

模型不再只是Transformer堆叠——MoE结构迭代加速,Index机制、压缩层、多模态融合持续加码;从LLaMA到DeepSeek-V4,从千问三模态到Cosmos V全模态,模型已从单一文本生成器,演变为可接收任意输入(图像、音频、视频、传感器信号)、输出任意形式(文本、波形、动作指令、机器人控制流)的跨域智能体。与此同时,昇腾、寒武纪、昆仑芯、天数智芯、沐曦等国产加速卡规模化落地,异构硬件不再是边缘选项,而成为生产环境的刚性现实。 这一双重演进,让AI Infra的核心矛盾彻底暴露:工具链的抽象能力,已严重滞后于模型复杂度的爆炸式增长;调度系统的统一性,正被硬件生态的碎片化持续瓦解。推理工程不再只是“把模型跑起来”,而是要在架构不可预测、硬件不兼容、工作负载非线性的前提下,保障SLA、控制成本、维持可维护性。

多模态推理:从流水线到解耦式Stage编排

千问3、Cosmos V等全模态模型,本质是多个异构子系统协同运行:AR主干负责语言理解与生成,需KV Cache与连续token调度;隐状态转换模块负责语义到表征的映射;Codec Wave或DiT模块则承担音视频生成,依赖高吞吐编解码与帧级时序建模。三者计算特征迥异——AR强调低延迟高并发,Codec追求高带宽确定性,DiT需要长序列内存管理。 vLLM Omni的诞生,正是对这种复杂性的回应:它放弃“单仓统管”思路,将AR核心保留在vLLM主干,其余模块剥离为独立可插拔Stage。每个Stage拥有专属调度策略、内存视图与通信协议。例如,在codec输出过程中,AR仍可并行接收新请求;不同Stage间通过异步P2P传输衔接,而非阻塞式串行等待。但当前仍有约20%性能未打满,瓶颈集中于跨Stage通信的“bubble”——即GPU间P2P带宽未被充分饱和,部分数据包在传输路径中空转等待。 这种解耦并非银弹。它带来新的技术债:vLLM每升级一次接口,Omni侧需同步重构数千行适配代码;Diffusion、VLA、Action Controller等新模块接入时,需重复设计Stage生命周期与资源契约。长期看,Stage应具备动态扩缩容能力——prefill节点按请求峰谷弹性伸缩,decode节点依KV长度自适应分片——但当前Infra层尚无法感知Stage级语义,更无法驱动底层调度器响应。

异构算力:从设备插件到拓扑感知调度

国产卡的普及,让“NVIDIA兼容性”神话彻底失效。同一张卡在特定tensor shape下输出错误、不同厂商对FP16精度实现存在微小偏差、编解码器硬件单元缺失或性能断层……这些不是偶发bug,而是异构现实的常态。 Kubernetes原生Device Plugin已无法应对。HAMi尝试以CRD+Scheduler扩展方式,将显存、算力、编解码能力抽象为多维ResourceName,支持跨厂商设备描述;DRA(Device Resource Allocation)虽进入GA阶段,但其表达能力受限于key-value型ResourceClaim,难以刻画PCIe拓扑亲和性、IB网络带宽约束、NUMA节点绑定等关键维度。一个典型困境是:某客户需将GPU与InfiniBand网卡严格绑定调度,但DRA无法声明“该GPU必须与同PCIe Root下的IB端口共置”,最终只能绕过K8s,用裸机脚本硬编码部署。 更深层的挑战在于碎片化。小模型(如Qwen2.5-27B)在国产卡上部署时,因显存分配粒度不匹配,极易产生“半卡闲置”;大模型PD分离后,prefill与decode节点对网络延迟敏感度不同,若跨交换机调度,性能陡降。此时LWS、Volcano、Koordinator等增强调度器才真正发挥作用——但它们的前提,是集群规模已达百卡以上,且运维团队具备跨栈调优能力。

Agent时代:时间感知缺失催生新型异构需求

大模型本身无时间概念——训练目标是静态概率分布,而非时序因果建模。龙虾、Hermes等Agent框架,本质是借CPU时钟注入时间轴:通过循环调用、状态轮询、外部事件触发,人为构造执行节拍。这带来三类新型Infra压力: 第一,CPU瓶颈重现。多模态Agent常需前置预处理(图像resize、音频重采样、视频关键帧提取),大量数据在CPU与GPU间搬运,导致GPU利用率不足70%,CPU反成瓶颈; 第二,存储压力激增。Agent任务链产生海量中间状态(思维链快照、工具调用日志、多轮对话缓存),共享存储IOPS与吞吐面临指数级冲击; 第三,沙箱开销失控。为安全隔离sub-agent,每个进程需独立JavaScript runtime与sandbox环境,单台服务器仅能承载有限数量Claude Code实例,OOM风险随并发线性上升。 这些场景天然呼唤异构协同:CPU专注轻量预处理与状态编排,GPU聚焦密集计算,FPGA/ASIC加速特定编解码,NVMe SSD承担高频状态缓存——Infra需从“资源池化”转向“能力编排”。

未来三年:Infra将从实现层退向决策层

软件工程的“屎山”有望被逆转。模型能力提升正改变开发范式:过去需手动优化CUDA kernel、手写调度策略、反复调参的环节,正逐步被模型自动完成。Fable-5已验证:模型可一夜重构CI/CD流水线,性能提升10倍且稳定性反超人工配置。 Infra工程师的角色将发生位移——不再深陷于kernel编写与参数调优,而是定义清晰的SLA(如P99延迟≤200ms)、SLO(首token延迟<150ms)、成本预算(单请求GPU小时成本≤$0.03),并将约束条件喂给模型。模型则负责生成部署方案、选择最优框架组合、动态调整batch size与并行策略、甚至生成patch修复硬件兼容问题。 开源项目因此获得结构性优势。vLLM、HAMi等项目积累的PR流程、review风格、测试模式,已成为大模型的重要训练语料。模型越熟悉这些项目的演进逻辑,越能精准hack适配;社区越活跃,模型对该生态的“亲和度”越强,形成马太效应。闭源魔改终将让位于开放协作——因为单点优化无法跟上模型迭代速度,而集体智慧可被模型高效吸收与放大。

结语:AI Infra的终极形态,是消失的基础设施

当模型能自主理解业务语义、拆解计算图、匹配硬件能力、闭环验证结果时,“Infra”一词将逐渐退隐。它不再是一堆待维护的组件清单,而内化为一种服务契约:开发者声明意图,系统交付结果。真正的挑战,已从“如何让模型跑得更快”,转向“如何让模型理解我们要它做什么”。这恰是Infra进化最艰难也最根本的一跃。

评论 (6)

登录 后即可发表评论
深蓝_1
深蓝_1 1周前

模型和算力发展挺快,但工具链和调度问题太麻烦,解耦也有新问题,异构算力调度难,Agent时代又有新压力,未来还得变

0 回复
欧巴时刻

国产算力起来是好事,可异构硬件的兼容性和调度太让人头疼,这得赶紧解决

0 回复
怪我太年轻

未来三年Infra退到决策层是趋势,模型自动完成部分工作能省不少事

0 回复
深圳脑残研究院智障科主任医生

现在模型复杂了,工具链跟不上,调度系统也乱,得想办法改进

0 回复
暮日
暮日 1周前

Agent框架带来的CPU、存储和沙箱问题不小,异构协同是方向,但做起来不容易

0 回复
更多