ADK 内置了系统化的智能体评估框架,支持从工具调用轨迹匹配到基于 LLM 的响应质量评估等多种评估维度。开发者可以定义测试用例集,自动运行评估并生成量化指标。
ADK 提供的内置评估指标包括:tool_trajectory_avg_score(工具调用轨迹的精确匹配度)、response_match_score(与参考答案的 ROUGE-1 相似度)、final_response_match_v2(LLM 评判的语义匹配度)、rubric_based_final_response_quality_v1(基于评分标准的最终响应质量)、hallucinations_v1(响应相对于上下文的可靠性)、safety_v1(响应的安全性)以及 multi_turn_task_success_v1(多轮对话中任务目标达成率)。
ADK 提供 adk conformance 命令用于一致性测试。开发者先通过录制插件生成基线交互数据,后续每次代码或模型更新后运行回归测试,将实时行为与基线进行对比,及时发现意外偏差。
通过 adk web 启动的开发界面内置评估运行器,可以在浏览器中直观地查看智能体在测试用例上的表现,包括每一步的工具调用、推理过程和最终得分,便于快速定位问题。