跳转到内容
搜索文档

爬虫提示(Crawler Hints)

最后更新 查看 MarkdownAgent 设置

Crawler Hints 使用 Cloudflare 缓存信号告知搜索引擎您的内容何时可能已变更,使其在正确的时间抓取您的站点,而不是盲目猜测。

背景

搜索引擎和类似服务运营着庞大的爬虫网络,在互联网上抓取内容以识别与用户查询最相关的内容。然而,Web 上的内容始终在变化,搜索引擎爬虫必须持续在互联网上漫游并猜测应以何种频率检查站点以获取内容更新。

借助 Crawler Hints,Cloudflare 可以主动告诉爬虫索引的最佳时间或内容何时变更。此外,Crawler Hints 支持 IndexNow,允许网站在内容创建、更新或删除时通知搜索引擎。Crawler Hints 使用缓存状态 MISS 来确定内容何时可能已更新,并将其发送给 IndexNow 的爬虫。如果资源的响应 HTTP 状态码大于 4xx,Crawler Hints 不会将其报告给 IndexNow

优势

Crawler Hints 帮助搜索引擎和其他由机器人驱动的服务提供最新版本的内容,这可以提高搜索排名。

Crawler Hints 还减少了不必要的爬虫流量到您的源站,降低资源消耗并提升站点性能。

可用性

FreeProBusinessEnterprise

Availability

Yes

Yes

Yes

Yes

启用 Crawler Hints

  1. 在 Cloudflare 仪表板中,前往 Configuration(配置) 页面。

    Go to Configuration ↗
  2. 启用 Crawler Hints(爬虫提示)

启用 Crawler Hints 后,Cloudflare 将开始向搜索引擎发送有关何时应抓取您网站特定部分的提示。

阻止特定页面被索引

启用后,Crawler Hints 是您整个网站的全局设置。您可以通过以下方式阻止特定页面被索引:

  • 让源站服务器在任何不应被索引的页面上发送 X-Robots-Tag: noindex 标头。
  • 在任何不应被索引的页面的 HTML 中包含 <meta name="robots" content="noindex, nofollow" />
  • 在 Cloudflare 中创建响应标头 Transform Rule 以添加 X-Robots-Tag: noindex 标头,而不是从源站服务器执行此操作。

这篇文档对您有帮助吗?