跳转到内容
搜索文档

Always Online

最后更新 查看 MarkdownAgent 设置

启用带 Internet Archive 集成的 Always Online 时,请遵循以下最佳实践。

  • 允许来自 Internet Archive IP 地址的请求。 源站服务器会收到来自 Internet Archive IP 的请求。请确保未阻止来自 Internet Archive IP 范围的请求:207.241.224.0/20208.70.24.0/21
  • Internet Archive 不考虑源站服务器的 cache-control 标头。 Internet Archive 爬取网站时,无论 cache-control 如何都会爬取,因为 Internet Archive 不会缓存资源,而是归档它们。
  • 考虑与转换 URI 的 Cloudflare 功能可能产生的冲突。 由于 Internet Archive 爬取页面进行归档的方式,带 Internet Archive 集成的 Always Online 可能与 Cache Rules 和其他转换 URI 的 Cloudflare 功能产生问题。具体来说,在边缘发生的一些重定向可能导致 Internet Archive 爬虫无法归档目标 URL。启用 Origin Cache Control 之前,请查看 Cloudflare 默认如何缓存资源以及您配置的任何 Cache Rules,以避免这些问题。如果遇到问题,请禁用 Always Online。
  • 不要通过 WAF 自定义规则阻止 Known Bots 或 Verified Bots。 如果阻止这些 bot 列表,Internet Archive 将无法爬取。

请勿将 Always Online 用于:

  • API 流量。
  • 阻止美国或的 IP Access ruleWAF custom rule
  • Bypass Cache cache rules。Always Online 忽略 Bypass Cache cache rules 并提供 Always Online 缓存资源。

限制

Always Online 功能存在以下限制:

  1. 对于最近添加的网站,Always Online 不会立即生效,原因包括:
    • DNS 记录传播可能需要 24-72 小时
    • Always Online 尚未初始爬取网站
  2. 如果源站 Web 服务器离线,Cloudflare 无法显示登录后的私有内容或处理表单提交 (POSTs)。

Always Online 不会针对 404503500 等 HTTP 响应码触发,例如数据库连接错误或内部服务器错误。这是因为这些状态码表示源站可达且正在响应——Always Online 仅在 Cloudflare 完全无法连接到源站时激活(产生 Cloudflare 生成的 520–527 状态码)。如果源站返回 5xx 错误,按定义源站在线,Always Online 不会介入。

常见问题

  1. 如何知道页面是否已被爬取?

  2. 为什么页面 x、y 和 z 未被爬取?

    • 由于 Cloudflare 仅请求爬取网站上最受欢迎的页面,可能会有缺失页面。如果您确实想归档某个页面,可以访问 Internet Archive save page 并要求他们爬取特定页面。
  3. 我们需要 allowlist 哪些 IP 地址以确保爬取正常工作?

    • IP 范围:207.241.224.0/20208.70.24.0/21。请注意,此 IP 范围属于 Internet Archive 而非 Cloudflare,因为是 Internet Archive 执行爬取。
  4. 源站应预期看到什么 user agent?

    • 目前 Internet Archive 使用:Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/605.1.15 (KHTML, like Gecko) Chrome/89.0.4389.82 Safari/605.1.15

这篇文档对您有帮助吗?