Guardrails 通过拦截和评估用户提示和模型响应中的有害内容,帮助你安全部署 AI 应用。作为应用与模型提供商(如 OpenAI、Anthropic、DeepSeek 等)之间的代理,AI Gateway 的 Guardrails 确保整个 AI 生态系统中一致且安全的体验。
Guardrails 主动监控用户与 AI 模型之间的交互,为你提供:
- 一致的审核:跨模型和提供商的统一审核层。
- 增强的安全性和用户信任:主动保护用户免受有害或不适当的交互。
- 对允许内容的灵活性和控制:指定要监控的类别,并选择标记或彻底阻止。
- 审计和合规能力:通过用户提示、模型响应和执行 Guardrails 的日志,接收有关不断发展的监管要求的更新。
AI Gateway 通过根据预定义的安全参数评估内容,实时检查所有交互。Guardrails 的工作方式如下:
-
拦截交互: AI Gateway 代理请求和响应,位于用户和 AI 模型之间。
-
检查内容:
- 用户提示:AI Gateway 根据安全参数(例如暴力、仇恨或色情内容)检查提示。根据你的设置,提示可以在到达模型之前被标记或阻止。
- 模型响应:处理完成后,检查 AI 模型响应。如果检测到有害内容,可以在交付给用户之前被标记或阻止。
-
应用操作: 根据你的配置,标记的内容会被记录以供审查,而阻止的内容会被阻止继续。