风险提示:理性看待区块链,提高风险意识!
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

GPT-5.6 Sol:750 tokens/s背后的全栈重构逻辑

摘要

推理速度不是堆卡出来的,而是重写出来的 过去我们总以为,提升大模型推理速度靠的是更多GPU、更快互联、更大显存。但GPT-5.6 Sol给出的答案截然不同:它不迁就硬件,而是让硬件为模型服务——甚至把模型拆开,一层一...

GPT-5.6 Sol:750 tokens/s背后的全栈重构逻辑

推理速度不是堆卡出来的,而是重写出来的

过去我们总以为,提升大模型推理速度靠的是更多GPU、更快互联、更大显存。但GPT-5.6 Sol给出的答案截然不同:它不迁就硬件,而是让硬件为模型服务——甚至把模型拆开,一层一层铺在晶圆上运行。 这不是参数竞赛的延续,而是一次底层范式的迁移:从‘模型适配硬件’转向‘硬件定义模型’。

每秒750 tokens,意味着什么?

不是简单地快了一点,而是交互逻辑的根本重置。一个完整Agent流程——比如读取邮件、解析日程、调用API、生成会议纪要、再发回确认——过去需数分钟;现在可在2秒内端到端完成。用户感知不到“等待”,只留下“刚想到,它就做了”的体验。 这已超出传统LLM服务范畴,进入实时智能操作系统层级:键盘敲击未落,补全已就位;语音指令出口,执行动作已启动;多模态输入尚未结束,跨模态响应已在生成。

3万亿参数,如何部署?

关键不在“塞进去”,而在“摊开来”。 GPT-5.6 Sol并非压缩或裁剪后的轻量版,而是具备完整多模态能力的原生架构。其核心部署策略是:一整张Cerebras晶圆级芯片,专用于运行神经网络中的一层。 按70–90层估算,实际部署横跨约100张晶圆。每一层独立计算、片上直连、零NVLink跳转。这种“层即设备”的设计,消除了传统分布式推理中的通信墙,使吞吐率不再随层数增加而衰减,仅对首token延迟(TTFT)产生可控影响。

KV缓存被重构,而非被优化

晶圆上的SRAM极其宝贵。若沿用标准Transformer的KV缓存机制,带宽将在毫秒级耗尽。OpenAI没有选择妥协精度或降低序列长度,而是彻底放弃传统缓存范式。 其路径有三:一是采用类似DeepSeek-V4的极简KV设计,将缓存开销压至百字节级;二是引入SSM(状态空间模型)模块,在关键路径替代注意力,规避KV存储;三是注意力与前馈网络解耦——前者由通用算力单元处理,后者交由晶圆集群暴力并行。 这不是工程调优,而是架构级手术。

Jalapeño不是终点,而是起点

OpenAI自研芯片Jalapeño的发布,标志着其技术主权正式落地。它不是对标H100的通用加速器,而是专为大模型推理定制的ASIC:无图形管线、无通用缓存层级、无兼容包袱,所有晶体管只为激活、量化、流式调度服务。 更关键的是,它的设计周期仅9个月——背后是OpenAI主导架构、博通负责物理实现、Celestica完成系统集成的垂直闭环。这不是采购合作,而是产业链级的协同共建。

真正的革命,藏在飞轮里

OpenAI正在构建一个自我强化的超级飞轮:用更强AI训练更优编译器;用更优编译器驱动定制芯片;用定制芯片支撑更大模型;更大模型反哺下一代基础设施设计。 GPT-5.6 Sol不是一代产品,而是这个飞轮首次高速咬合的声响。当750 tokens/s不再是实验室数据,而成为企业级服务的基线,AI就不再是一种工具,而成为像电力一样的实时基础设施。 它不预告未来,它正在重写实时性的定义。

评论 (7)

登录 后即可发表评论
天策上将

这思路挺牛啊,从模型适配硬件到硬件定义模型,底层范式改了,后面发展潜力大

0 回复
周围不远

每秒750 tokens太猛了,交互逻辑都变了,以后用AI就跟用自己手一样顺

0 回复
野心家゛

GPT - 5.6 Sol这是要重新定义实时性,以后AI应用得翻天覆地

0 回复
三昧真火

KV缓存直接重构,不搞优化那套,大公司就是有魄力,架构级手术厉害

0 回复
对面楼的老李

Jalapeño芯片专为推理定制,产业链协同搞起来,后面肯定还有新东西

0 回复
更多