本地部署了Hy-MT2-30B-A3B这个模型,我的部署环境是一张A100/80G显卡,部署工具是xinference,推理引擎时transformers,用来做翻译。现在发现翻译速度非常慢,一份20页的文档翻译完要25分钟,而且完全没有并发量,单批次送入的长度100-900toekn不等,用在线的api尝试,Hy-mt2-pro,90秒就翻译完了,同样的配置下。想知道本地部署的模型要怎么优化。
相似问题