AI Crawl Control 指标让您能够深入了解 AI 爬虫如何与您的网站(即 Cloudflare 区域 (Zone))进行交互。
要查看 AI Crawl Control 指标:
-
登录 Cloudflare 仪表板 ↗,然后选择您的账户和域名。
-
前往 AI Crawl Control(AI 爬网控制)。
Go to AI Crawl Control ↗
您可以在 Overview(概述)、**Crawlers(爬虫)**和 **Metrics(指标)**选项卡中找到有用的信息。
**Overview(概述)**选项卡提供了 AI 爬虫活动的快照:
| 组件 | 您可以做什么 |
|---|---|
| Executive summary(执行摘要) | 审查总请求量、请求量变化、最常见的状态码、最受欢迎的路径以及高吞吐量爬虫活动。 |
| 托管的 robots.txt 状态 | 检查是否为您的区域启用了 Cloudflare 托管的 robots.txt。 |
| 带有趋势图的指标 | 监控总请求数、允许的请求数、不成功的请求数以及总引流数 (referrals)(仅限付费计划)。 |
| 按运营商分组的爬虫 | 探索按公司(OpenAI、Microsoft、Google、ByteDance、Anthropic、Meta)组织的爬虫,包括允许的请求数、引流数(仅限付费计划)和活动变化百分比。选择爬虫或运营商可在 **Crawlers(爬虫)**选项卡中进一步向下钻取。 |
| Filters(筛选器) | 按日期范围、爬虫、运营商、主机名或路径自定义您的视图。所有指标都会动态更新。 |
**Crawlers(爬虫)**选项卡提供了有关单个 AI 爬虫的详细信息,并允许您设置 **Block(阻止)**或 **Allow(允许)**控制:
| 列名 | 描述 |
|---|---|
| Crawler(爬虫) | AI 爬虫的名称。 |
| Operator(运营商) | 运营该爬虫的公司。 |
| Data transfer(数据传输) | 该爬虫请求所消耗的总带宽。格式为 KB、MB 或 GB。 |
| Requests(请求数) | 来自该爬虫的请求总数。 |
| Action(操作) | 当前的访问控制设置(允许或阻止)。 |
有关管理爬虫访问的详细信息,请参阅管理 AI 爬虫。
**Metrics(指标)**选项卡提供详细的分析和图表,以帮助您了解 AI 爬虫如何与您的网站进行交互。
可视化选定时间段内的爬虫活动模式。使用视图选择器在以下指标之间进行切换:
| 视图 | 描述 |
|---|---|
| All requests(所有请求) | 总请求数,包括被阻止的和错误的响应。 |
| Allowed requests(允许的请求) | 收到成功响应(状态码 200-299)的请求。 |
| Data transfer(数据传输) | 允许的请求随时间的带宽消耗情况,格式为 KB、MB 或 GB。 |
您可以按不同的维度对数据进行分组:
| 维度 | 描述 |
|---|---|
| Crawler(爬虫) | 跟踪来自单个 AI 爬虫(例如 GPTBot、ClaudeBot、Bytespider)的活动。 |
| Category(类别) | 按其用途或类型分析爬虫。 |
| Operator(运营商) | 了解哪些公司(例如 OpenAI、Anthropic、ByteDance)正在爬取您的网站。 |
| Host(主机) | 细分跨多个子域的活动。 |
状态码分布图表显示随时间推移 AI 爬虫请求的 HTTP 响应代码:
- 2xx — 成功的响应
- 3xx — 重定向
- 4xx — 客户端错误(包括 403 阻止和 402 需要付款)
- 5xx — 服务器错误
使用此图表可以识别您网站对 AI 爬虫作出响应时的模式,包括错误代码的分布和重定向的数量。
内容格式图表显示 AI 系统请求的内容类型与您源站提供的内容类型的对比。这种可见性有助于您了解内容协商模式,并优化您向 AI 系统交付内容的方式。
该图表包含三个视图:
| 视图 | 描述 |
|---|---|
| Comparison(对比) | 一个分组条形图,对比了请求的内容类型与提供的内容类型 |
| Request Type(请求类型) | 按 Accept 标头细分的请求 |
| Response Type(响应类型) | 按 Content-Type 标头细分的响应 |
通过引流源分析识别流量来源,以了解来自 AI 运营商的发现模式和内容受欢迎程度。
| 视图 | 描述 |
|---|---|
| Referral sources(引流来源) | 向您的网站发送 AI 驱动的引流流量的热门域名(例如 chatgpt.com、perplexity.ai)。 |
| Destination patterns(目标模式) | 哪些网站区域接收的 AI 驱动的引流流量最多,按模式分组(例如 /blog/*、/api/*)。 |
使用“热门引流源”部分中的选项卡在视图之间进行切换。
跟踪您选定时间段内的引流流量趋势。分组依据:
| 维度 | 描述 |
|---|---|
| Operator(运营商) | 堆叠面积图,显示按公司(OpenAI、Anthropic 等)划分的引流情况。 |
| Source(来源) | 驱动流量的热门引流 URL。 |
| Total(总计) | 汇总的引流量。 |
最受欢迎的路径表显示了 AI 爬虫最频繁请求的您网站上的页面。
| 列名 | 描述 |
|---|---|
| Path(路径) | 被请求的页面路径。 |
| Hostname(主机名) | 被请求页面的主机名。 |
| Referrals(引流数) | 来自 AI 平台的针对该路径的引流访问次数。 |
| Allowed requests(允许的请求) | 对该路径的成功请求次数。 |
要查看每个路径按爬虫细分的情况,请使用顶级筛选器。
选择 **Patterns(模式)**选项卡可以查看按 URI 模式(例如 /blog/*、/api/v1/* 或 /docs/*)分组的请求。这有助于您快速识别 AI 爬虫最常针对您网站的哪些区域。
模式分组将单个路径聚合到网站区域中:
- 模式最多包含 2 层深度(例如
/api/*、/api/v1/*) - 根模式
/*显示您网站上的总流量 - 模式不会跨主机名进行聚合
- 单路径模式不带通配符显示(例如
sitemap.xml,而不是sitemap.xml/*)
其他选项卡包括:
- All(全部) — 合并的内容和媒体请求(单个路径,而非模式)
- Content(内容) — HTML、JSON 和文本内容
- Media(媒体) — 图像、视频和其他媒体文件
使用筛选栏可根据多个标准缩小您的分析范围:
| 筛选器 | 描述 |
|---|---|
| Date range(日期范围) | 选择要分析的时间段。 |
| Crawler(爬虫) | 筛选特定的 AI 爬虫。 |
| Operator(运营商) | 筛选特定的公司。 |
| Hostname(主机名) | 筛选特定的子域。 |
| Path(路径) | 筛选特定的 URL 路径或模式。 |
组合多个筛选器进行复杂分析。所有指标和图表都会根据您的筛选选择进行动态更新。
要导出数据,请选择 **Download CSV(下载 CSV)**或 Download image(下载图片)。下载将包含所有已应用的筛选器和分组。
**Crawlers(爬虫)**选项卡中包含了每个爬虫的操作菜单,具有以下选项:
| 操作 | 描述 |
|---|---|
| View Metrics(查看指标) | 将 **Metrics(指标)**选项卡筛选为选定的爬虫。 |
| View on Cloudflare Radar(在 Cloudflare Radar 上查看) | 在 Cloudflare Radar 上了解更多关于每个已验证爬虫的信息。 |
| View in Security Analytics(在安全分析中查看) | 在安全分析中按检测 ID 筛选(针对 Bot Management 客户)。 |
| Copy User Agent(复制 User Agent) | 复制 user agent 字符串,以便在 WAF 自定义规则、重定向规则或 robots.txt 文件中使用。 |
| Copy Detection ID(复制检测 ID) | 复制检测 ID,以便在 WAF 自定义规则中使用(针对 Bot Management 客户)。 |
要以编程方式访问 AI Crawl Control 分析,请使用 GraphQL Analytics API。该 API 提供了访问仪表板中可用相同数据的通道,包括检测 ID、引流数据和数据传输指标。