首页
学习
活动
专区
圈层
工具
发布

AMD用户试过llama.cpp的AMD生态分支吗?提示处理速度最高翻倍

AMD有自己的llama.cpp分支,虽然页面上有弃用警告,但实际上一直在维护,后续改动也会并回官方主线

我用自己的Strix Halo实测下来,这个分支里有一些挺有意思的新补丁(基于ROCm/Hip的话能用到)在稠密模型上,提示处理速度有时能比官方版快一倍以上:同样是14B稠密模型,这里能跑到大概550 tokens/s,官方版只有230左右不过文本生成速度比Vulkan版慢了差不多15%

MoE模型的速度则和官方版差不多

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OIxq_DqTvzP2aGVJZES8c3NA0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。
领券