首页
学习
活动
专区
圈层
工具
发布

按Token计费的AI定价模式,正在走向终结

让两个团队使用完全相同的基础设施——相同的GPU、相同的模型、相同的配置,但承载不同的工作负载。最终,他们得出的经济账会截然不同。

这让很多人感到意外,但业界对此其实早有预判。在最初的热潮过后,AI落地的核心难题在于判断它能在哪些业务场景中创造价值。值得庆幸的是,这个阶段基本已经过去了。

如今,各类模型已全面进入生产阶段,承载着真实业务、面对切实后果。生产环境意味着持续运营,而不仅仅是完成一次部署上线。因此,技术选型的核心标准已转变为实际创造的业务价值,真实的产品路线图就建立在这一判断之上。

当前,业内最流行的指标是每Token成本,因为它易于讨论、方便跨供应商比较。公开的每Token定价往往源于一次"理想测试":硬件状态良好、负载平稳、批次大小经过精心调配,目的是让数据图表好看。然而,这对于管理者来说几乎没有参考价值,因为同样的配置在截然不同的环境中,表现会大相径庭。

回到开头那两个团队:相同的模型、相同的硬件,任务不同,经济账也就不同。随着瓶颈的转移,决策的复杂度会迅速提升。

以大批量短提示词进行推理时,系统是计算瓶颈,GPU全力运转;而切换到长上下文场景时,同一模型就变成了内存瓶颈,键值缓存的加载速度决定了整体节奏,芯片大量时间花在等待带宽传输而非实际计算上。

如果为实时应用设置了严格的延迟上限,那么一个在基准测试中每秒能生成数千个Token的系统,实际能交付的吞吐量可能只有这个数字的一小部分。

可供调节的参数没有放之四海而皆准的设置。GPU的选择、量化策略、注意力计算内核、键值缓存布局、批处理策略、推测性解码——每一项都在速度、成本,乃至模型质量之间进行取舍。而这些权衡完全取决于具体的工作负载。

这正是那两个团队走向不同结果的原因:硬件没有任何变化,只是运行的任务不同而已。

那么,一个单一指标如何能涵盖这一切?答案很简单:不能。每Token成本本身并没有问题,它只是在回答一个比企业真正应该追问的问题小得多的问题。

我一直试图将对话从账单层面引向系统层面。我建议客户不要问每个Token的成本是多少,而是问:我为每个GPU小时付出的费用中,有多少真正转化为了有效工作?

以下几个问题,能帮助决策者更清晰地理解算力定价的本质:

有多少算力时间转化为了有效输出?一个团队如果发现三分之一的GPU时间白白浪费在"拖后腿"的任务上,光是优化自身集群就能释放出更多算力,这远比更换供应商更有价值。

问题能多快被发现和修复?在规模化运营中,某处出现性能下降几乎是常态。真正的成本不在于问题是否发生,而在于问题发生后有多久未被察觉。故障发现时间是一个实实在在的经济变量,即便没有任何定价页面为此单独列一列。

当需求不均匀时,基础设施的代价是什么?真实的生产流量远不像基准测试那样平稳。推理请求随用户行为波动,智能体随时触发,微调任务集中爆发。如果平台无法应对这种不规律的负载,客户要么为大多数时间都处于空闲状态的峰值算力买单,要么在请求最关键的时刻遭遇丢包。而弹性能力的代价,永远不会出现在每Token的报价中。

算力需要定制化适配

生产级AI基础设施的选型,不能像挑选标准商品规格一样简单。

基准测试只是门槛,不是上限;参数指标描述的是芯片在孤立状态下的性能,而非在约束条件下处理真实负载时的表现。唯一可靠的验证方式,是用自己的工作负载在真实条件下实际运行,然后观察结果——包括成本、延迟、精度,以及某个组件宕机时会怎样、队列积压时会发生什么。这个过程往往还能回答一个更根本的问题:哪个模型才真正适合这个任务?做出正确判断的团队,都将评估视为一次实验。

这也正是供应商关系正在发生转变的原因。优秀的供应商,如今看起来与其说是一份菜单,不如说是一段联合工程攻关。他们深入了解客户的真实应用,找到工作负载的潜在断裂点,在任何合同签署之前就完成针对性调优。在这个过程中,你会发现很多数据表上永远找不到的东西。

Q&A

Q1:每Token成本这个指标有什么局限性?

A:每Token成本反映的是理想测试条件下的结果,通常基于硬件状态良好、负载平稳的环境得出,并不能反映真实生产场景中的复杂情况。不同工作负载会导致完全不同的计算瓶颈,例如短提示词批量推理是计算瓶颈,长上下文场景则变成内存瓶颈,而实时应用的延迟限制又会大幅压缩实际吞吐量。因此,这个指标回答的问题太小,远不足以支撑企业级的技术选型决策。

Q2:企业评估AI算力时应该关注哪些更关键的指标?

A:企业应该从三个维度来衡量:一是有效算力利用率,即多少GPU时间真正转化为有效输出,而不是浪费在低效任务上;二是问题响应速度,即基础设施出现性能下降时,能多快被发现和修复,故障持续时间直接影响经济成本;三是弹性能力,即平台能否应对真实生产中不均匀的流量波动,避免为闲置峰值算力买单或在关键时刻丢失请求。

Q3:选择AI基础设施时应该如何做决策?

A:最可靠的方式是用自己的真实工作负载进行实际测试,而非仅凭基准测试和规格参数来判断。测试过程中要观察成本、延迟、精度,以及组件故障和队列积压时的系统表现。同时,优秀的供应商应该能够深入理解客户的具体应用场景,在合同签署前就完成针对性调优,而不是单纯提供一份标准化的产品菜单。

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OhKKMpIB_prZDJXpLxDMgisw0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。
领券