首页
学习
活动
专区
圈层
工具
发布

Llama.cpp 推出自适应推测解码,推理速度更快

我们一直在针对 Qwen3.8 等模型做性能优化

这次主要新增的功能,是 Llama.cpp 的自适应推测解码

简单说一下背景:MTP 和 DFlash 在加速推理方面表现不错,尤其是稠密模型但不同类型的内容需要不同的参数设置,而原版 Llama.cpp 只支持单一数值

这个分支版本引入了自适应推测解码你只需要设定最小和最大范围,引擎就会自动调整每次建议的 token 数量相比原版,token 生成速度最高可提升 50%,在 Qwen3.8 上效果尤其明显比如在 Strix Halo 上,结构化内容的生成速度从 44t/s 提升到了 65t/s

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OztumsRXuyk1L5xIuqscYa6A0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。

相关快讯

领券