Guardrails 是与智能体执行并行的安全防护层,对输入和输出进行实时验证,一旦触发安全边界便立即快速失败,而非事后补救。触发时会抛出类型化的异常,而非静默改变智能体行为。
输入防护在用户消息进入智能体时运行,默认与模型调用并行执行以最小化延迟,适用于主题限制、越权拦截等场景。
输出防护在智能体生成最终回复后运行,始终在完成后执行,适用于敏感信息检测、合规筛查等需要查看完整回复后再放行的场景。
工具级防护是最细粒度的选项,直接附加在具体函数工具上,无论多智能体工作流中由哪个智能体调用该工具都会触发,适合拦截密钥泄露、越权操作等风险。