在今年7月对几乎全线产品上调约30%价格之后,英伟达据报道正准备进一步将服务器价格上调15%,涉及搭载Vera Rubin和Grace Blackwell芯片的系统,原因是内存价格急剧攀升。
据彭博社及其他财经媒体报道,此次15%的涨价适用于2027年初交付的系统,被视为AI基础设施部署成本持续上涨趋势的一部分。
Info-Tech Research Group咨询研究员斯科特·比克利(Scott Bickley)认为,英伟达此举不过是将自身成本上涨转嫁给客户。但他的测算显示,英伟达并未借助其近乎垄断的市场地位进行暴利收割,实际上企业自身承担了部分成本上涨,只将一小部分转嫁给了大客户。
他同时指出,并非所有AI相关成本都在上涨——每Token的处理价格实际上正在下降。这为CIO提供了一条潜在的成本管控路径:推行能够降低对内存依赖的技术方案。
"每Token的工作负载成本在下降,而底层硬件和基础设施成本却在上升,"比克利说,"如果你自己搭建集群,这相当于在一个本就贵得离谱的方案上再叠加成本。如果你是直接采购硬件,那只能硬扛——谈判解决不了这个问题。"
他也补充道,CIO可以通过模型路由、压缩和批处理等技术,从现有集群中榨取更多价值。
Gartner副总裁分析师高拉夫·古普塔(Gaurav Gupta)指出,英伟达涨价折射出AI全链条中普遍存在的成本上行压力。
"内存价格在涨,尤其是HBM和LPDDR5,但还有前沿代工晶圆、先进封装以及其他零部件短缺等因素,"古普塔说,"这些问题会拉长交货周期,而交期延长通常就意味着价格上涨。"他预计这一局面短期内不会好转。
"在需求强劲、供给有限的当前环境下,我们预计这种情况将在中近期持续,"他说,"这意味着,无论是自建服务器集群还是租用云端算力的企业——包括软件厂商、模型构建者等——都将面临更高成本。"
LexisNexis风险解决方案集团首席信息安全官弗拉维奥·维拉努斯特(Flavio Villanustre)对此表示认同。
"这是供需失衡的问题,等内存产能扩张到足以满足AI驱动的需求时,情况可能会趋于平稳并逐步改善,但我认为这不会在未来几个月内发生,"他说,"CIO眼下必须应对当前的市场现实。"
他同样认可通过技术手段提升现有内存利用率的建议。"一些AI模型供应商正在优化模型,使其在内存受限环境下运行得更好,"维拉努斯特指出,"例如,谷歌的Gemma E4B等模型采用了分层架构,可以只将模型所需的部分加载到内存中,而非将整个模型驻留在RAM里。这类模型的有效参数量远超其实际内存占用。"
Aikido Security企业首席信息安全官迈克·威尔克斯(Mike Wilkes)则认为,英伟达涨价或许也能带来一定积极效果——倒逼企业在AI部署上采取更审慎的策略。
"过去几年,企业几乎把前沿模型的Token当成无限弹性的公共资源来使用,不管任务是否真的需要前沿级别的推理能力,都往最大的模型上送,"他说,"更高的基础设施和Token成本应该能促使企业更好地区分工作负载。"
他认为,正确的企业AI架构正日益呈现混合形态:将约10%的算力预留给真正需要前沿能力的任务,同时将分类、抽取、摘要、常规智能体操作等有边界的工作负载,推向企业自主掌控的基础设施上运行的小语言模型(SLM)和开放权重模型。
"这样CIO才有筹码,不至于在涨价或单方面定价面前毫无还手之力,"他说。
Q&A
Q1:英伟达为什么要在7月涨价30%之后再度上调15%?
A:主要原因是内存价格急剧上涨,尤其是HBM和LPDDR5等高端内存,叠加前沿代工晶圆、先进封装及其他零部件短缺,导致交货周期延长、采购成本上升。分析人士指出,英伟达此举是将自身成本压力向下游传导,且并未借垄断地位进行暴利收割,部分成本实际由英伟达自行消化。
Q2:面对英伟达持续涨价,CIO有哪些应对办法?
A:主要有两类策略:一是通过模型路由、压缩和批处理技术提升现有集群效率;二是采用混合AI架构,将真正需要前沿模型的任务控制在少数,把分类、摘要、常规智能体操作等工作转移至小语言模型或开放权重模型,降低对高价算力的依赖,从而在与供应商谈判时掌握更多主动权。
Q3:谷歌Gemma E4B模型是如何降低内存占用的?
A:Gemma E4B采用了分层架构,运行时只将模型当前所需的部分加载进内存,而不是像传统方式那样将整个模型常驻RAM。这意味着该模型的有效参数量远超其实际内存占用,能在内存资源受限的环境下实现更高性价比的推理,是应对内存成本上涨的一种技术路径。