跳转到内容
搜索文档

分析 AI 流量

最后更新 查看 MarkdownAgent 设置

AI Crawl Control 指标让您能够深入了解 AI 爬虫如何与您的网站(即 Cloudflare 区域 (Zone))进行交互。

要查看 AI Crawl Control 指标:

  1. 登录 Cloudflare 仪表板,然后选择您的账户和域名。

  2. 前往 AI Crawl Control(AI 爬网控制)

    Go to AI Crawl Control ↗

您可以在 Overview(概述)、**Crawlers(爬虫)**和 **Metrics(指标)**选项卡中找到有用的信息。

查看“概述”选项卡

**Overview(概述)**选项卡提供了 AI 爬虫活动的快照:

组件 您可以做什么
Executive summary(执行摘要) 审查总请求量、请求量变化、最常见的状态码、最受欢迎的路径以及高吞吐量爬虫活动。
托管的 robots.txt 状态 检查是否为您的区域启用了 Cloudflare 托管的 robots.txt
带有趋势图的指标 监控总请求数、允许的请求数、不成功的请求数以及总引流数 (referrals)(仅限付费计划)。
按运营商分组的爬虫 探索按公司(OpenAI、Microsoft、Google、ByteDance、Anthropic、Meta)组织的爬虫,包括允许的请求数、引流数(仅限付费计划)和活动变化百分比。选择爬虫或运营商可在 **Crawlers(爬虫)**选项卡中进一步向下钻取。
Filters(筛选器) 按日期范围、爬虫、运营商、主机名或路径自定义您的视图。所有指标都会动态更新。

查看“爬虫”选项卡

**Crawlers(爬虫)**选项卡提供了有关单个 AI 爬虫的详细信息,并允许您设置 **Block(阻止)**或 **Allow(允许)**控制:

列名 描述
Crawler(爬虫) AI 爬虫的名称。
Operator(运营商) 运营该爬虫的公司。
Data transfer(数据传输) 该爬虫请求所消耗的总带宽。格式为 KB、MB 或 GB。
Requests(请求数) 来自该爬虫的请求总数。
Action(操作) 当前的访问控制设置(允许或阻止)。

有关管理爬虫访问的详细信息,请参阅管理 AI 爬虫

查看“指标”选项卡

**Metrics(指标)**选项卡提供详细的分析和图表,以帮助您了解 AI 爬虫如何与您的网站进行交互。

请求随时间的变化

可视化选定时间段内的爬虫活动模式。使用视图选择器在以下指标之间进行切换:

视图 描述
All requests(所有请求) 总请求数,包括被阻止的和错误的响应。
Allowed requests(允许的请求) 收到成功响应(状态码 200-299)的请求。
Data transfer(数据传输) 允许的请求随时间的带宽消耗情况,格式为 KB、MB 或 GB。

您可以按不同的维度对数据进行分组:

维度 描述
Crawler(爬虫) 跟踪来自单个 AI 爬虫(例如 GPTBot、ClaudeBot、Bytespider)的活动。
Category(类别) 按其用途或类型分析爬虫。
Operator(运营商) 了解哪些公司(例如 OpenAI、Anthropic、ByteDance)正在爬取您的网站。
Host(主机) 细分跨多个子域的活动。

状态码分布

状态码分布图表显示随时间推移 AI 爬虫请求的 HTTP 响应代码:

  • 2xx — 成功的响应
  • 3xx — 重定向
  • 4xx — 客户端错误(包括 403 阻止和 402 需要付款)
  • 5xx — 服务器错误

使用此图表可以识别您网站对 AI 爬虫作出响应时的模式,包括错误代码的分布和重定向的数量。

内容格式 (Content Format)

内容格式图表显示 AI 系统请求的内容类型与您源站提供的内容类型的对比。这种可见性有助于您了解内容协商模式,并优化您向 AI 系统交付内容的方式。

该图表包含三个视图:

视图 描述
Comparison(对比) 一个分组条形图,对比了请求的内容类型与提供的内容类型
Request Type(请求类型) 按 Accept 标头细分的请求
Response Type(响应类型) 按 Content-Type 标头细分的响应

热门引流源 (Top referrers)

通过引流源分析识别流量来源,以了解来自 AI 运营商的发现模式和内容受欢迎程度。

视图 描述
Referral sources(引流来源) 向您的网站发送 AI 驱动的引流流量的热门域名(例如 chatgpt.comperplexity.ai)。
Destination patterns(目标模式) 哪些网站区域接收的 AI 驱动的引流流量最多,按模式分组(例如 /blog/*/api/*)。

使用“热门引流源”部分中的选项卡在视图之间进行切换。

引流随时间的变化

跟踪您选定时间段内的引流流量趋势。分组依据:

维度 描述
Operator(运营商) 堆叠面积图,显示按公司(OpenAI、Anthropic 等)划分的引流情况。
Source(来源) 驱动流量的热门引流 URL。
Total(总计) 汇总的引流量。

最受欢迎的路径

最受欢迎的路径表显示了 AI 爬虫最频繁请求的您网站上的页面。

列名 描述
Path(路径) 被请求的页面路径。
Hostname(主机名) 被请求页面的主机名。
Referrals(引流数) 来自 AI 平台的针对该路径的引流访问次数。
Allowed requests(允许的请求) 对该路径的成功请求次数。

要查看每个路径按爬虫细分的情况,请使用顶级筛选器。

使用模式分组分析网站区域

选择 **Patterns(模式)**选项卡可以查看按 URI 模式(例如 /blog/*/api/v1/*/docs/*)分组的请求。这有助于您快速识别 AI 爬虫最常针对您网站的哪些区域。

模式分组将单个路径聚合到网站区域中:

  • 模式最多包含 2 层深度(例如 /api/*/api/v1/*
  • 根模式 /* 显示您网站上的总流量
  • 模式不会跨主机名进行聚合
  • 单路径模式不带通配符显示(例如 sitemap.xml,而不是 sitemap.xml/*

其他选项卡包括:

  • All(全部) — 合并的内容和媒体请求(单个路径,而非模式)
  • Content(内容) — HTML、JSON 和文本内容
  • Media(媒体) — 图像、视频和其他媒体文件

筛选和导出数据

使用筛选栏可根据多个标准缩小您的分析范围:

筛选器 描述
Date range(日期范围) 选择要分析的时间段。
Crawler(爬虫) 筛选特定的 AI 爬虫。
Operator(运营商) 筛选特定的公司。
Hostname(主机名) 筛选特定的子域。
Path(路径) 筛选特定的 URL 路径或模式。

组合多个筛选器进行复杂分析。所有指标和图表都会根据您的筛选选择进行动态更新。

要导出数据,请选择 **Download CSV(下载 CSV)**或 Download image(下载图片)。下载将包含所有已应用的筛选器和分组。

针对每个爬虫的钻取

**Crawlers(爬虫)**选项卡中包含了每个爬虫的操作菜单,具有以下选项:

操作 描述
View Metrics(查看指标) 将 **Metrics(指标)**选项卡筛选为选定的爬虫。
View on Cloudflare Radar(在 Cloudflare Radar 上查看) 在 Cloudflare Radar 上了解更多关于每个已验证爬虫的信息。
View in Security Analytics(在安全分析中查看) 在安全分析中按检测 ID 筛选(针对 Bot Management 客户)。
Copy User Agent(复制 User Agent) 复制 user agent 字符串,以便在 WAF 自定义规则重定向规则或 robots.txt 文件中使用。
Copy Detection ID(复制检测 ID) 复制检测 ID,以便在 WAF 自定义规则中使用(针对 Bot Management 客户)。

编程方式访问

要以编程方式访问 AI Crawl Control 分析,请使用 GraphQL Analytics API。该 API 提供了访问仪表板中可用相同数据的通道,包括检测 ID、引流数据和数据传输指标。

相关资源

这篇文档对您有帮助吗?