跳转到内容
搜索文档

多厂商 AI 可见性与控制

最后更新 查看 MarkdownAgent 设置

介绍

AI 领域正在迅速发展,每天都有新的模型、服务和应用程序涌现。许多开发人员和组织寻求通过选择像 Workers AI 这样的推理即服务(inference-as-a-service)解决方案来提高敏捷性,而不是自己开发或管理模型。

推理即服务(Inference-as-a-Service)是一种基于云的模型,允许用户在不管理底层基础设施的情况下部署和执行 AI。该平台处理模型服务的所有方面,包括根据需求扩展资源,通常同时支持实时推理和批量推理。用户可以通过 API 调用向模型发送输入 data,由服务提供商管理服务器、扩展和维护任务。推理服务通常采用按需付费模式,简化了模型的部署和扩展,使组织能够利用 AI 功能而无需面对基础设施的复杂性。

随着该领域的快速演变,开发人员和组织面临着若干挑战:

  • 碎片化:许多推理服务提供商仅提供有限范围的模型和功能。不同的使用案例可能需要多个厂商,从而导致碎片化。
  • 可用性:随着需求的增加和技术的快速进步,推理服务提供商难以维持高 API 可用性。
  • 缺乏可见性:提供商通常仅提供有限的分析和日志记录功能,且各厂商之间存在差异。获得 AI 使用情况的统一视图面临挑战。
  • 缺乏安全控制:组织在维持适当的安全措施方面遇到困难。
  • 缺乏成本控制:了解使用情况见解可能具有挑战性,并且在面向公众的 AI 使用案例中,缺乏自定义速率限制会带来风险。

使用正向代理可以缓解这些挑战。正向代理位于发起推理请求的服务与推理服务平台之间,充当可见性和控制的单一节点。通过将速率限制、缓存和错误处理等功能移至代理层,组织可以跨服务和推理服务提供商应用统一配置。

AI 正向代理设置

以下架构展示了 AI Gateway 作为正向代理,部署在服务与一个或多个 AI 推理提供商(如 Workers AI)之间的设置。

图 1:多厂商 AI 架构
多厂商 AI 架构
  1. 推理请求:向您的 AI 网关发送 POST 请求。
  2. 请求代理:将 POST 请求转发给 AI 推理提供商,或从缓存(如果已启用且可用)中提供响应。在此过程中,将同时收集分析数据日志。此外,还会强制执行速率限制等控制措施。
  3. 错误处理:若发生错误,则根据配置重新尝试请求或回退到其他推理提供商。

相关资源

这篇文档对您有帮助吗?