摘要
受存储芯片价格高企和供应短缺影响,英伟达大幅削减Vera Rubin NVL72机架级AI系统的内存配置。SOCAMM内存模块容量从192GB降至96GB,CPU内存总量从54-55TB砍至28TB,GPU侧的HBM4显存保持不变。成本压力巨大,若不调整,内存成本将占物料成本的29%。调整后,LPDDR5X成本从120万美元降至58.6万美元。Vera Rubin NVL72仍是目前最强AI系统之一,实测性能比Blackwell平台提升10倍。
英伟达Rubin NVL72内存配置大幅削减
受存储芯片价格高企和供应短缺影响,英伟达将大幅削减Vera Rubin NVL72机架级AI系统的内存配置。机架中的SOCAMM内存模块容量从192GB直接减半到96GB,Vera CPU配套的内存总量从54-55TB砍到28TB,CPU机架部分同样改用96GB SOCAMM。唯一没动的是GPU侧的HBM4显存,每个机架依然保持20.7TB。
成本压力是主因
英伟达这么做,直接原因是LPDDR5X市场供应紧张,受内存涨价影响,一套Rubin NVL72机架的成本可能高达910万美元,早先780万美元的估算已经过时,而HBM4的价格到2027年可能涨到每GB 53美元。如果不做调整,内存成本将占到VR200整机物料成本的29%、约210万美元,远超20%的理想水平。
调整后成本立竿见影
配置砍掉一半之后,效果立竿见影:VR200的LPDDR5X成本从早先估算的120万美元降到58.6万美元,如果进一步压缩到原来的四分之一,甚至可以压到29.3万美元。英伟达此前靠着提前签下的存储长期协议,已经是这波涨价潮里最能扛的公司,如今连它都要动刀,足见存储市场的压力有多大。
性能依然强悍
需要说明的是,Vera Rubin NVL72本身就是目前最强悍的AI系统之一,今年1月刚刚发布。根据实测数据,在处理MoE大模型负载时,Blackwell平台每兆瓦功耗的吞吐量为8万token/s,Vera Rubin NVL72则达到80万token/s,整整提升10倍。