首页
学习
活动
专区
圈层
工具
发布

把GPU拆分到不同虚拟机后,Ollama性能涨了约3倍

先说结论:原本一个虚拟机里堆了3张GPU,后来拆成两个虚拟机(一张独享,两张共用),折腾额外虚拟机的功夫完全值得

跑分对比:

Qwen3.8:27b 从 12.2 tok/s 提升到 33.91 tok/s

muse-glimmer:30B 从约 14.3 tok/s 提升到 22.61 tok/s

硬件是 2张 RTX PRO 4000 和 1张 RTX PRO 2000

详细经过:

之前我把三张卡都放在同一个虚拟机里,因为这样测大模型更方便我还一直安慰自己“速度差不了多少,别动了,省得维护麻烦”结果证明我想错了

给 Qwen3.8:27b 单独分一张卡,吞吐量差不多翻了三倍;另外两张卡继续共用,相比之前三张卡一起跑单个模型,性能也快了一倍左右

这结果其实不算意外,但就是因为一直想保持架构精简,我才没早点发现

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OROs89J2nbqKXb9wOL2cFWeA0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。
领券