先说结论:原本一个虚拟机里堆了3张GPU,后来拆成两个虚拟机(一张独享,两张共用),折腾额外虚拟机的功夫完全值得
跑分对比:
Qwen3.8:27b 从 12.2 tok/s 提升到 33.91 tok/s
muse-glimmer:30B 从约 14.3 tok/s 提升到 22.61 tok/s
硬件是 2张 RTX PRO 4000 和 1张 RTX PRO 2000
详细经过:
之前我把三张卡都放在同一个虚拟机里,因为这样测大模型更方便我还一直安慰自己“速度差不了多少,别动了,省得维护麻烦”结果证明我想错了
给 Qwen3.8:27b 单独分一张卡,吞吐量差不多翻了三倍;另外两张卡继续共用,相比之前三张卡一起跑单个模型,性能也快了一倍左右
这结果其实不算意外,但就是因为一直想保持架构精简,我才没早点发现