跳转到内容
搜索文档

支出限制

最后更新 查看 MarkdownAgent 设置

支出限制允许你在 AI Gateway 上设置基于成本的预算。当累计支出在时间窗口内达到限制时,AI Gateway 会阻止进一步请求并返回 429 响应,直到窗口重置。

与限制请求数量的速率限制不同,支出限制根据模型定价跟踪每个请求的实际美元成本。你可以将限制范围限定为模型、提供商或用户 ID、团队、应用等自定义元数据维度的任意组合。

支出限制适用于具有已知定价的模型的 Unified Billing 请求和 BYOK 请求。

在网关上配置的支出限制规则

工作原理

每个支出限制规则在滚动或固定时间窗口内定义预算(美元)。AI Gateway 根据 token 使用和模型定价计算每个请求的成本,然后实时跟踪累计支出与限制的比较。

在向提供商发送请求之前,AI Gateway 一次性评估所有适用的支出限制规则。如果任何单个规则超出预算,请求将被阻止并返回 429 响应。

支出限制是最终一致的。当前请求的成本在完成后记录,因此并发请求突发可能在 enforcement 赶上之前短暂超出限制。

使用维度限定范围

每个规则可以按模型、提供商或自定义元数据维度限定范围。每个维度可以配置为以下两种模式之一:

模式 行为 示例
Split by value 每个不同值获得独立的预算桶。 metadata.user_id 分割为每个用户提供独立预算。
Filter by value 规则仅在维度等于特定值时适用。 metadata.team 过滤为 engineering 仅限制来自 engineering 团队的请求。

如果规则上未配置维度,所有值共享一个预算桶。例如,没有 provider 维度的规则一起跟踪所有提供商的支出。

维度示例

给定 model=openai/gpt-5.5metadata.user_id=u_42 的请求:

场景 维度 预算桶
所有人的全局预算 一个共享桶
按用户预算 metadata.user_id:split by value 每个用户独立桶
按提供商、按用户 metadata.user_id:split by value,provider:split by value 每个用户+提供商组合独立桶
仅特定模型 model:filter by value openai/gpt-5.5 仅适用于 openai/gpt-5.5 请求
按用户、按模型 metadata.user_id:split by value,model:split by value 每个用户+模型组合独立桶

配置支出限制

支出限制通过仪表板或 API 在 gateway 上配置。每个 gateway 最多可定义 20 条规则。

添加支出限制规则表单

要按用户 ID 或团队等自定义维度限定支出限制范围,请为请求附加自定义元数据

达到限制时的行为

超出支出限制时,AI Gateway 返回 429 Too Many Requests 响应。你有两个选项:

  • Block requests(默认)- 请求被拒绝,直到预算窗口重置。
  • Fall back to a cheaper model - 创建带有主要模型和回退的动态路由(例如 anthropic/claude-opus-4.7 回退到 @cf/moonshotai/kimi-k2.6)。然后使用此功能对主要模型设置支出限制。当主要模型预算超出时,AI Gateway 自动将请求路由到回退模型,而不是阻止它们。

监控支出

你可以在分析仪表板上按模型、提供商或任何自定义元数据属性跟踪支出。使用此功能了解使用模式并设置合理的预算。

限制

  • 成本跟踪是基于 token 数量和模型定价的最佳努力估算。请参阅提供商仪表板获取准确的计费金额。
  • 每个 gateway 最多可配置 20 条支出限制规则。

这篇文档对您有帮助吗?