跳转到内容
搜索文档

Logpush 运行状况仪表板

最后更新 查看 MarkdownAgent 设置

Logpush 运行状况仪表板(Logpush Health Dashboards)可让您清晰了解 Logpush 作业的性能与可靠性。您可以监控日志投递状态、诊断问题,并了解发送到已配置目标的数据量。这有助于确保用于安全、合规和可观测性的关键日志数据始终按预期流动。

通过运行状况通知保持知情

配置 Logpush 运行状况通知,以便在 Logpush 作业被禁用或出现错误时接收提醒。尽早检测至关重要,因为 Logpush 无法回填日志——数据一旦丢弃,将永久丢失。

运行状况通知与运行状况仪表板配合使用,为 Logpush 作业性能提供实时提醒和历史分析。


访问运行状况仪表板

  1. 在 Cloudflare 仪表板中,前往账户或域名(zone)级别的 Logpush(日志推送) 页面。
  2. 前往 Health(运行状况) 选项卡。
  3. 选择要分析的作业。
  4. 指定要查看的时间范围。
  5. (可选) 从 Jobs(作业) 选项卡中,找到要分析的作业。
  6. 将鼠标悬停在该作业的 Job Health (24h)(作业运行状况(24 小时)) 列上,然后选择 View Health(查看运行状况)。
  7. 您将被重定向到 Health(运行状况) 选项卡,可在其中选择所需的分析时间范围。

数据可用性与 API 访问

  • 运行状况仪表板在 Cloudflare 仪表板中为每个 Logpush 作业显示最多 30 天的运行状况指标。
  • 可通过 GraphQL API 中的 logpushHealthAdaptiveGroups 数据集查询原始运行状况指标。
  • 您可以使用 Cloudflare GraphQL Explorer ↗ 探索或测试查询。

作业运行状况中的关键概念

日志行(Log line)

Cloudflare 生成的单条日志条目,例如 HTTP 请求、DNS 查询或 Access 事件。

批次(Batch)

Cloudflare 作为单个文件或请求一并上传到您目标的一组日志。批次也称为文件。

上传(Upload)

将一批日志上传到目标的单次尝试。如果首次尝试失败,Cloudflare 会自动重试,直到上传成功或达到重试上限。每次上传可能有三种结果之一:Successful(成功)、Retry attempts(重试) 或 Failed(失败)。

Successful

表示一批日志已成功上传到您的目标,没有错误或超时。上传成功后,该批次被标记为已投递,不再进行进一步重试。

Retry attempts

在初始失败后进行的额外上传尝试。计数包括首次失败的尝试。重试会持续进行,直到批次成功投递或达到重试上限。

Failed

表示某批次的所有上传尝试均已用尽且未成功。当批次失败时,Cloudflare 无法将其日志投递到您的目标,该批次中的所有日志都会被丢弃。这些日志将永久丢失。

运行状况仪表板流程

Logpush 运行状况仪表板提供两个互补视图,帮助您监控和排查日志投递:Upload Health(上传运行状况) 和 Upload Reliability(上传可靠性)。

每个视图突出显示作业性能的不同方面——已投递的内容以及投递的可靠程度。

Upload Health(上传运行状况)

Upload Health(上传运行状况) 帮助您了解有多少数据已成功上传,以及在何处上传失败或数据被丢弃。此视图回答的问题是:上传是否成功,日志是否到达目标?

图表与指标

  • Batch Upload Success vs. Failure(批次上传成功与失败):显示成功上传与失败的批次数。

    • Successful Uploads(成功上传) - 成功上传的批次总数。
    • Failed Uploads(失败上传) - 由于连接或目标问题而未能上传的批次总数。
  • Log Lines Uploaded(已上传日志行):跟踪成功上传到目标的日志行总数。

    • Uploaded Log Lines(已上传日志行) - 成功投递的日志行总数。
    • Dropped Log Lines(已丢弃日志行) - 在所有重试尝试后仍无法投递的日志行总数。
  • Data Volume(数据量):显示已上传日志数据的总体积(以字节为单位),包括压缩和未压缩。

    • Uncompressed Data (raw)(未压缩数据(原始)) - 压缩前日志数据的总大小。
    • Compressed Data (uploaded)(已压缩数据(已上传)) - 压缩后日志数据的总大小,表示实际传输的字节数。

何时使用

从这里开始评估整体数据投递运行状况:

  • 高上传成功率和稳定的数据量表明 Logpush 作业运行状况良好。
  • 丢弃、尖峰或失败的上传表明存在投递问题——请前往 Upload Reliability(上传可靠性) 调查根本原因。

Upload Reliability(上传可靠性)

Upload Reliability(上传可靠性) 帮助您识别影响所有上传尝试(包括重试和失败)的可靠性、稳定性和延迟的因素。此视图回答的问题是:上传是否稳定且高效?

图表与指标

  • Uploaded Logs by Status Code(按状态码分类的已上传日志) 按状态码分类显示成功、失败或重试的批次数。

    • Success Rate(成功率) - 成功上传的批次百分比。
    • Successful Uploads(成功上传) - 成功完成的批次总数。
  • Upload Duration(上传持续时间):显示完成每批上传所需的平均时间,按状态码细分。

    • Destination Availability(目标可用性) - Cloudflare 成功连接到您的目标并完成上传的频率。
    • Average Upload Duration(平均上传持续时间) - 日志生成后上传所需的平均时间。
  • Retry Attempts(重试次数):显示失败上传后的重试次数,按状态码细分。

    • Retry Attempts(重试次数) - 在先前失败后进行的上传尝试总数(包括首次失败的尝试)。

何时使用

使用此视图排查可靠性问题:

  • 高延迟、频繁重试或低目标可用性表明目标端点或网络可能存在不稳定。
  • 结合 Upload Health(上传运行状况) 指标,将投递成功情况与潜在的可靠性模式关联起来。

故障排除指南

Logpush 运行状况仪表板可帮助您监控 Logpush 作业的状态、可靠性和性能。使用本指南解读每个图表、识别异常的根本原因并采取纠正措施。

图表名称 症状 含义 可能原因 建议操作
Batch Upload Success vs Failure(批次上传成功与失败) 上传失败 Cloudflare 在所有重试尝试后仍无法投递批次。这些批次被标记为 failed,其中的所有日志行都会被丢弃。 - 目标端点不可用或拒绝连接(凭据过期、停机)。
- 由于批次过大或网络延迟导致上传超时。
- 目标限流或速率限制。
- 验证目标凭据和端点运行状况。
- 在 Logpush 作业配置中减小批次大小。
- 确保目标能够处理预期的上传速率。
- 如果失败持续存在,请联系 Cloudflare 支持。
Log Lines Uploaded(已上传日志行) 丢弃的日志行或投递量减少 投递的日志少于预期,通常由于上传失败或批次丢弃。 - 失败上传激增。
- 目标摄入限制或部分上传。
- 比较 Log Lines Uploaded(已上传日志行) 和 Data Volume(数据量) 图表中的下降。
- 检查目标是否有摄入错误或速率限制。
- 审查最近的 Logpush 作业配置更改。
Data Volume (Compressed & Uncompressed)(数据量(压缩与未压缩)) 数据量意外下降 已投递数据量低于预期,表明压缩效率低下或批次丢弃。 - 上传失败或不完整的投递。
- 目标因大小或配额限制拒绝上传。
- 审查压缩设置和批次大小。
- 验证目标存储容量。
- 检查失败上传或重试是否有尖峰。
Uploaded Logs by Status Code(按状态码分类的已上传日志) 大量重试或失败状态码 上传在首次尝试时失败,但在重试时成功。 - 目标临时停机或限流。
- Cloudflare 与目标之间的网络不稳定。
- 按状态码审查重试和失败分布。
- 与 Destination Availability(目标可用性) 比较以关联。
- 减小批次大小。
Retry Attempts(重试次数) 频繁的重试活动 上传反复失败并多次重试。 - 目标不稳定或瞬态错误。
- 高延迟或目标确认缓慢。
- 验证目标正常运行时间和摄入速率。
- 确保目标未对请求进行限流。
- 偶发重试是预期的;持续尖峰需要审查。
Avg. Upload Duration(平均上传持续时间) 上传时间过长 上传耗时超过预期,表明延迟或批次过大。 - 大批次或未压缩的负载。
- 网络或区域延迟。
- 目标处理延迟。
- 审查 Avg. Upload Duration(平均上传持续时间) 趋势。
- 减小批次大小以加快上传。
- 验证目标吞吐量和速率限制设置。
Destination Availability(目标可用性) 可用性低或不稳定 Cloudflare 无法持续连接到您的目标。 - 目标停机、DNS 错误或身份验证问题。
- 防火墙或网络限制阻止 Cloudflare。
- 检查 Destination Availability(目标可用性) 是否有下降。
- 确认目标凭据和端点正常运行时间。
- 审查允许列表或网络访问设置。

理解重试行为

Logpush 通过自动重试来处理目标的临时问题。当目标暂时不可用时,Logpush 大约会在五分钟内重试约五次。但是,如果 Cloudflare 持续从目标收到错误,且无法跟上传入的批次,Logpush 最终会丢弃日志。

如果错误持续较长时间,Logpush 会假定目标永久不可用,并禁用您的推送作业。目标问题解决后,您可以重新启用该作业。

要监控重试行为和目标可用性,请使用运行状况仪表板指标,特别是 Retry Attempts(重试次数) 和 Destination Availability(目标可用性) 图表。

这篇文档对您有帮助吗?