风险提示:理性看待区块链,提高风险意识!
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

谷歌在不损失准确率的情况下缩小了人工智能内存——但这其中另有隐情

摘要

币界网报道: 谷歌研究院发布 TurboQuant 周三,一种压缩算法问世,该算法在保持准确性零损失的同时,将主要的推理内存瓶颈缩小了至少 6 倍。 该论文计划在 ICLR 2026...

谷歌在不损失准确率的情况下缩小了人工智能内存——但这其中另有隐情
币界网报道:

谷歌研究院发布 TurboQuant 周三,一种压缩算法问世,该算法在保持准确性零损失的同时,将主要的推理内存瓶颈缩小了至少 6 倍。

该论文计划在 ICLR 2026 上发表,并立即在网上引起了反响。

Cloudflare首席执行官马修·普林斯称之为 谷歌的DeepSeek时刻 包括美光、西部数据和希捷在内的存储器类股票价格当天下跌。

所以这是真的吗?

量化效率本身就是一项巨大的成就。但“零精度损失”需要结合具体情况来看。

TurboQuant 的目标是 KV 缓存——GPU 内存的一部分,用于存储语言模型在对话过程中需要记住的所有内容。

随着上下文窗口增长到数百万个令牌,每个会话的缓存也会膨胀到数百GB。这才是真正的瓶颈所在,而不是计算能力。 原始内存 .

传统的压缩方法试图通过向下取整来缩小缓存——例如,将 32 位浮点数向下取整到 16 位,再向下取整到 8 位,最后向下取整到 4 位整数。为了更好地理解这一点,可以想象一下将一张 4K 图像缩小到全高清,再缩小到 720p 等等。很容易看出整体图像是一样的,但 4K 分辨率包含更多细节。

但问题在于:为了防止模型出现故障,他们必须在压缩数据旁边存储额外的“量化常数”。这些常数会为每个值增加 1 到 2 位,从而部分抵消压缩带来的优势。

TurboQuant 声称它可以完全消除这种开销。

它通过两个子算法来实现这一点。PolarQuant 将向量的大小与方向分离,而 QJL(量化 Johnson-Lindenstrauss) 将剩余的微小残余误差简化为单个符号位(正或负),存储的常数为零。

谷歌表示,其结果是为驱动 Transformer 模型的注意力计算提供了一个数学上无偏的估计器。

在使用 Gemma 和 Mistral 的基准测试中,TurboQuant 在 4 倍压缩下达到了全精度性能,包括在高达 104,000 个标记的大海捞针任务中实现了完美的检索精度。

为了解释这些基准为何重要, 在不损失质量的前提下扩展模型的可用上下文 一直是LLM部署中最棘手的问题之一。

现在,来看细则。

“零精度损失”指的是推理过程中键值缓存压缩,而不是模型权重压缩。权重压缩是一个完全不同且更复杂的问题,TurboQuant 并不涉及权重压缩。

它压缩的是存储会话中注意力计算的临时内存,这种内存容错性更高,因为理论上这些数据可以重建。

此外,干净的基准测试与处理数十亿次请求的生产系统之间也存在差距。TurboQuant 是在开源模型(Gemma、Mistral、Llama)上进行测试的,而不是在大规模的 Google 自家 Gemini 堆栈上进行测试的。

与……不同 DeepSeek的效率提升 TurboQuant 从一开始就融入了深层次的架构设计,无需重新训练或微调,并且声称运行时开销极低。理论上,它可以直接集成到现有的推理流程中。

正是这一点让内存硬件行业感到恐慌——因为如果它在生产环境中有效,那么每个主要的 AI 实验室都可以在他们已经拥有的相同 GPU 上运行得更加精简。

这篇论文将提交给 ICLR 2026。在投入生产之前,“零损失”这个概念还停留在实验室阶段。

评论 (0)

登录 后即可发表评论

暂无评论

更多