现在很多 AI 服务器会采用 8 张 GPU 的配置,尤其是用于大模型训练和推理的高性能服务器。原因并不是“GPU 越多越好”,而是单张 GPU 的显存和计算能力有限,8 张 GPU 可以通过高速互联共同完成更大规模的 AI 计算任务。
首先是显存容量的问题。
前面我们提到,70B 模型如果使用 FP16,仅模型参数理论上就需要大约 140GB 显存。如果使用单张 80GB 显存的 GPU,显然无法直接装下完整模型。这时候就需要多张 GPU,把模型参数分布到不同 GPU 上运行。
例如 8 张 80GB GPU,总显存容量达到 640GB。实际可用容量还需要考虑系统开销、KV Cache 和其他运行数据,但整体上可以支持更大模型的部署。
第二个原因是计算能力。
AI 模型在训练和推理过程中需要进行大量矩阵计算。单张 GPU 的计算能力有限,多张 GPU 可以同时参与计算,从而提高整体处理能力。
不过,多张 GPU 并不是简单地把性能直接相加。GPU之间需要频繁交换数据,如果通信速度不够快,就会影响整体效率。因此,高性能 AI 服务器通常会使用 NVLink、NVSwitch 等高速互联技术,让多张 GPU 之间能够进行高速数据传输。
第三个原因是AI 训练本身就需要多 GPU 协同。
训练大型模型时,不仅需要保存模型参数,还需要保存梯度、优化器状态以及大量中间计算数据。实际训练所需要的显存,往往远高于只加载模型参数所需要的显存。因此,大模型训练通常需要几十张、几百张甚至更多 GPU。
第四个原因是服务器硬件设计和扩展性。
8 GPU 已经成为很多高性能 AI 服务器常见的标准配置。CPU、PCIe、GPU、高速网卡、电源以及散热系统可以围绕多 GPU架构进行统一设计。企业后续还可以通过增加服务器数量,组成更大规模的 GPU 集群。
当然,并不是所有 AI 业务都需要 8 张 GPU。
如果只是运行 7B、14B 等中小模型,一张或者几张 GPU 可能就够了。如果需要运行 70B 以上的大模型,或者需要高并发推理、大规模模型训练,那么多 GPU 配置的优势就会更加明显。
所以,8 张 GPU 的核心价值,是提供更大的显存容量、更强的并行计算能力以及更高的整体吞吐能力。
对于企业来说,选择 AI 服务器时不能只看“有几张 GPU”,还需要重点关注单卡显存、GPU 型号、GPU 互联带宽、CPU、内存、网络带宽以及服务器功耗。
最终需要几张 GPU,还是要根据模型规模、精度、并发量和具体业务需求来确定。