向量检索场景下的吞吐量通常以 QPS(Queries Per Second)衡量。不同规模和配置下表现差异较大——在千万级向量数据集上,部分 AI 原生数据库在 XS 规格配置下 QPS 可达 2,800 以上;在特定测试环境(如阿里云 PolarDB 内置向量引擎,8 节点集群每节点 64C 256GB)下,千万级向量检索 QPS 可达 12 万。混合查询场景下的 QPS 会低于纯向量检索,但仍能满足绝大多数生产需求。
延迟是衡量 AI 原生数据库体验的关键指标,通常关注 P50、P99 延迟值。在生产环境中,P99 延迟稳定在 25ms 以内被视为优秀水平。部分产品在千万级向量数据集上的 P99 延迟可低至 6.8ms,而混合查询场景下的 P99 延迟通常在 20-50ms 范围。对于流式数据分析场景,部分实时分析型 AI 原生数据库承诺多表查询 P99 延迟低于 1 秒。
向量检索的准确性通过召回率(Recall)衡量,即在返回的结果中真正相关文档所占比例。生产环境通常要求召回率 ≥ 90%,部分高性能设置在召回率 93% 以上的同时还能保持低延迟和高吞吐。
线性扩展效率反映了增加节点后系统性能的保持程度,优秀产品在增加 8 个节点后线性扩展效率可达 0.90 以上。高并发事务处理能力也是重要指标,部分分布式 AI 原生数据库在高并发场景下 TPS 可达数十万级别。