电话:
关闭
您当前的位置:首页 > 职场资讯 > 社保

谷歌内存压缩算法冲击存储巨头 900亿美元市值蒸发

来源:网络整理 时间:2026-03-28 作者:佚名 浏览量:

AI从“算力时代”步入“推理时代”,对内存的需求急剧增加,极大地提升了全球存储公司的业绩,也使股价大幅上涨。

然而,一篇出自谷歌的文章,致使美国的内存巨头市值在一天之内蒸发掉超过900亿美元,这900亿美元约合人民币6200亿元,同时韩国的内存巨头市值也在同一天出现了如此规模的蒸发。

于当地时间3月24日,谷歌研究院即Google Research,发布了一篇文章,此文章是介绍一种名为TurboQuant的算法的,该算法是向量量化压缩算法。其宣称在不造成准确率损失的前提之下,把大模型运行时的关键方面内存占用,压缩成了3比特,而这3比特是原有内存占用的1/6。

有市场观点认为,这一算法将减少AI对内存的需求。

但也有分析师称,市场的反应说明,很多人对技术“一窍不通”。

谷歌发布新算法,存储巨头市值蒸发逾6200亿元

在当地时间三月二十四日的时候,谷歌发布了一种名为TurboQuant的内存压缩算法,谷歌称,TurboQuant能够在不造成准确性损失的状况下,把大型语言模型运行时的关键部分,也就是键值缓存,简称为KV Cache的内存占用,降低为原来的六分之一,同时在英伟达H100GPU上进行的特定测试里,性能能够提升至高达八倍。

这一消息迅速触发市场重估逻辑。

富国银行的分析师Andrew Rocha觉得,这项技术有对未来内存容量规格需求判断产生影响的可能性,并且他在报告之中写下了这样的话语,市场很快就会展开重新评估,关于AI到底还需要多少内存容量这件事。

第一个美股交易日,是消息发布后的那个当地时间3月25日,存储芯片板块在盘中集体跳水。闪迪(SanDisk)股价一度大幅度跌了6.5%,收盘的时候跌幅缩小到3.5%,市值损失了36.3亿美元。同一日,美光科技,也就是Micron Technology,出现了下跌情况,跌幅为3.4%,其市值因而损失了151.66亿美元;西部数据,即Western Digital,下跌了1.63%,市值损失达16.64亿美元;希捷科技,也就是Seagate Technology,跌幅为2.76%,市值损失了21.4亿美元。

迅速扩散至亚洲市场的负面情绪中,3月26日之时,韩国SK海力士股价出现下跌计6.23%,市值遭受损失算44.18万亿韩元,此数值约合293.8亿美元;,三星电子股价同样出现下跌,跌幅为4.71%,市值损失达57.83万亿韩元,该数值约合384.5亿美元。

全球范围内,主要的内存巨头们,它们的市值损失加起来,总计超过了900亿美元,这900亿美元大约折合人民币6200亿元。

直击大模型“成本痛点”:KV缓存占用减少83%

TurboQuant引发震动,其核心之处在于,它精准地击中了大模型的关键成本痛点,这个痛点就是KV缓存,也就是Key-Value Cache。

于大模型展开推理进程的时候,模型得留存历史上下文信息进而构建成KV缓存,以此来防止出现重复计算的情况。然而伴随上下文窗口不断增长,KV缓存呈现出线性膨胀态势,从而占用诸多GPU内存。

比如,有一个具备700亿参数的模型,在存在512个用户、输入2048个Token的场景当中,仅仅是KV缓存这一项,就需要大约512GB的内存,这个内存量大概是模型本体的4倍,这已然成为商业化部署过程里最大的成本之一了。

有一种传统的解决方案,它是“量化”,也就是采用低精度的数据,去替代高精度的浮点数,然而这样做常常会牺牲准确率,并且还需要额外存储量化参数,以此来抵消部分压缩收益。

TurboQuant通过两步优化解决这一问题。

第一步,运用名为PolarQuant的办法,把数据从笛卡尔坐标转变为极坐标,就如同“向东行走3米,再向北行走4米”这样的指令,简化成“以37度角行进5米”,借由随机旋转使得数据分布具备可预测性,进而无需额外的量化参数,直接削减内存开销。

其次,运用一项称作QJL(量化约翰逊 - 林登施特劳斯变换)的技术,借助仅有1个比特去校正第一步压缩后进而产生的细微误差,以此保证最终结果具备准确性。

谷歌表示,通过该组合方案:

KV缓存能够被压缩到3比特,内存占用降低为原来的1/6,降幅约莫83%。

在Gemma模型测试里,性能跟未做压缩的该模型一样,不需要进行额外的训练或是微调,在Mistral等其他模型测试中,情况也是如此。

在针对NVIDIA H100所开展的测试当中,4比特TurboQuant注意力的计算速度,达成了32位未量化时速度的8倍。

华尔街激辩:节省缓存等于减少内存总需求吗?

尽管市场短期剧烈反应,但机构观点明显分化。

其一,此项技术并不是头一回被披露,与之相关的论文早在2025年4月的时候就已经公开了。

其次,有分析表明,谷歌所宣称的“8倍性能提升”,乃是与32位未量化模型相比而得到,然而目前主流情况是已普遍运用4位量化,实际上其提升或许会低于所宣传的值。

市场分析机构Citrini Research的分析师Jukan,十分直接地表明一件事,即由TurboQuant引发内存股跌至低谷,这显示出市场对于技术完全没有任何了解,这一情况正如丰田推出混动发动机后石油公司股价大幅下跌那般。

摩根士丹利指出,TurboQuant技术影响范围有限,它仅作用于推理阶段的KV缓存,不影响模型权重,也不涉及训练环节,因此,这并非意味着整体存储需求下降到原来的1/6,而是提升单位硬件效率,使相同硬件能处理更长上下文或服务更多用户。

另外,摩根士丹利引用了“杰文斯悖论”(Jevons Paradox),这个理论讲的是,效率提高通常不会使资源消耗减少,相反会因为成本降低而促使需求增加。就如同瓦特改进蒸汽机提升了煤炭燃烧效率,结果却是全球煤炭需求急剧上升那般。摩根士丹利觉得,借助大幅削减单次查询的服务成本,TurboQuant能够使原本只能在云端昂贵集群上运行的模型转移到本地,切实降低AI规模化部署的难度,这或许反倒会进一步刺激整体需求。

Cloudflare的首席执行官Matthew Prince把TurboQuant称作谷歌的“DeepSeek时刻”,这类情况在DeepSeek发布之际发生过,当时市场一度担心算力需求会降低,不过最终AI应用出现爆发,反倒提升了硬件需求。起初股价下跌的英伟达后来再度创造出历史最高纪录。

按照行业规律之中“内存帕金森定律”来讲,TurboQuant节省出的内存并非闲着未用,转而迅速被消耗掉啦:在每一轮硬件实行升级或者软件开展优化释放出的存储余量,很快就会被更长的上下文窗口、再大一些的批处理规模、更复杂的进行推理需求给吞并掉哟。也就是说,节省下来的空间会被用来服务更多的并发请求、处理更长的文档,或者运行原本基于内存不足而没办法加载的大模型,甚至有可能推动更强大的AI应用在手机等移动设备上变成现实呢。

分享到:
客服服务热线
24小时服务
微信公众号
手机浏览

Copyright C 2025 All Rights Reserved 皖ICP备2024052706号-7

地址: EMAIL:1210524564@qq.com

Powered by PHPYun.

用微信扫一扫