Logpush 运行状况仪表板(Logpush Health Dashboards)可让您清晰了解 Logpush 作业的性能与可靠性。您可以监控日志投递状态、诊断问题,并了解发送到已配置目标的数据量。这有助于确保用于安全、合规和可观测性的关键日志数据始终按预期流动。
配置 Logpush 运行状况通知,以便在 Logpush 作业被禁用或出现错误时接收提醒。尽早检测至关重要,因为 Logpush 无法回填日志——数据一旦丢弃,将永久丢失。
运行状况通知与运行状况仪表板配合使用,为 Logpush 作业性能提供实时提醒和历史分析。
- 在 Cloudflare 仪表板中,前往账户或域名(zone)级别的 Logpush(日志推送) 页面。
- 前往 Health(运行状况) 选项卡。
- 选择要分析的作业。
- 指定要查看的时间范围。
- (可选) 从 Jobs(作业) 选项卡中,找到要分析的作业。
- 将鼠标悬停在该作业的 Job Health (24h)(作业运行状况(24 小时)) 列上,然后选择 View Health(查看运行状况)。
- 您将被重定向到 Health(运行状况) 选项卡,可在其中选择所需的分析时间范围。
- 运行状况仪表板在 Cloudflare 仪表板中为每个 Logpush 作业显示最多 30 天的运行状况指标。
- 可通过 GraphQL API 中的
logpushHealthAdaptiveGroups数据集查询原始运行状况指标。 - 您可以使用 Cloudflare GraphQL Explorer ↗ 探索或测试查询。
Cloudflare 生成的单条日志条目,例如 HTTP 请求、DNS 查询或 Access 事件。
Cloudflare 作为单个文件或请求一并上传到您目标的一组日志。批次也称为文件。
将一批日志上传到目标的单次尝试。如果首次尝试失败,Cloudflare 会自动重试,直到上传成功或达到重试上限。每次上传可能有三种结果之一:Successful(成功)、Retry attempts(重试) 或 Failed(失败)。
表示一批日志已成功上传到您的目标,没有错误或超时。上传成功后,该批次被标记为已投递,不再进行进一步重试。
在初始失败后进行的额外上传尝试。计数包括首次失败的尝试。重试会持续进行,直到批次成功投递或达到重试上限。
表示某批次的所有上传尝试均已用尽且未成功。当批次失败时,Cloudflare 无法将其日志投递到您的目标,该批次中的所有日志都会被丢弃。这些日志将永久丢失。
Logpush 运行状况仪表板提供两个互补视图,帮助您监控和排查日志投递:Upload Health(上传运行状况) 和 Upload Reliability(上传可靠性)。
每个视图突出显示作业性能的不同方面——已投递的内容以及投递的可靠程度。
Upload Health(上传运行状况) 帮助您了解有多少数据已成功上传,以及在何处上传失败或数据被丢弃。此视图回答的问题是:上传是否成功,日志是否到达目标?
-
Batch Upload Success vs. Failure(批次上传成功与失败):显示成功上传与失败的批次数。
- Successful Uploads(成功上传) - 成功上传的批次总数。
- Failed Uploads(失败上传) - 由于连接或目标问题而未能上传的批次总数。
-
Log Lines Uploaded(已上传日志行):跟踪成功上传到目标的日志行总数。
- Uploaded Log Lines(已上传日志行) - 成功投递的日志行总数。
- Dropped Log Lines(已丢弃日志行) - 在所有重试尝试后仍无法投递的日志行总数。
-
Data Volume(数据量):显示已上传日志数据的总体积(以字节为单位),包括压缩和未压缩。
- Uncompressed Data (raw)(未压缩数据(原始)) - 压缩前日志数据的总大小。
- Compressed Data (uploaded)(已压缩数据(已上传)) - 压缩后日志数据的总大小,表示实际传输的字节数。
从这里开始评估整体数据投递运行状况:
- 高上传成功率和稳定的数据量表明 Logpush 作业运行状况良好。
- 丢弃、尖峰或失败的上传表明存在投递问题——请前往 Upload Reliability(上传可靠性) 调查根本原因。
Upload Reliability(上传可靠性) 帮助您识别影响所有上传尝试(包括重试和失败)的可靠性、稳定性和延迟的因素。此视图回答的问题是:上传是否稳定且高效?
-
Uploaded Logs by Status Code(按状态码分类的已上传日志) 按状态码分类显示成功、失败或重试的批次数。
- Success Rate(成功率) - 成功上传的批次百分比。
- Successful Uploads(成功上传) - 成功完成的批次总数。
-
Upload Duration(上传持续时间):显示完成每批上传所需的平均时间,按状态码细分。
- Destination Availability(目标可用性) - Cloudflare 成功连接到您的目标并完成上传的频率。
- Average Upload Duration(平均上传持续时间) - 日志生成后上传所需的平均时间。
-
Retry Attempts(重试次数):显示失败上传后的重试次数,按状态码细分。
- Retry Attempts(重试次数) - 在先前失败后进行的上传尝试总数(包括首次失败的尝试)。
使用此视图排查可靠性问题:
- 高延迟、频繁重试或低目标可用性表明目标端点或网络可能存在不稳定。
- 结合 Upload Health(上传运行状况) 指标,将投递成功情况与潜在的可靠性模式关联起来。
Logpush 运行状况仪表板可帮助您监控 Logpush 作业的状态、可靠性和性能。使用本指南解读每个图表、识别异常的根本原因并采取纠正措施。
| 图表名称 | 症状 | 含义 | 可能原因 | 建议操作 |
|---|---|---|---|---|
| Batch Upload Success vs Failure(批次上传成功与失败) | 上传失败 | Cloudflare 在所有重试尝试后仍无法投递批次。这些批次被标记为 failed,其中的所有日志行都会被丢弃。 | - 目标端点不可用或拒绝连接(凭据过期、停机)。 - 由于批次过大或网络延迟导致上传超时。 - 目标限流或速率限制。 |
- 验证目标凭据和端点运行状况。 - 在 Logpush 作业配置中减小批次大小。 - 确保目标能够处理预期的上传速率。 - 如果失败持续存在,请联系 Cloudflare 支持。 |
| Log Lines Uploaded(已上传日志行) | 丢弃的日志行或投递量减少 | 投递的日志少于预期,通常由于上传失败或批次丢弃。 | - 失败上传激增。 - 目标摄入限制或部分上传。 |
- 比较 Log Lines Uploaded(已上传日志行) 和 Data Volume(数据量) 图表中的下降。 - 检查目标是否有摄入错误或速率限制。 - 审查最近的 Logpush 作业配置更改。 |
| Data Volume (Compressed & Uncompressed)(数据量(压缩与未压缩)) | 数据量意外下降 | 已投递数据量低于预期,表明压缩效率低下或批次丢弃。 | - 上传失败或不完整的投递。 - 目标因大小或配额限制拒绝上传。 |
- 审查压缩设置和批次大小。 - 验证目标存储容量。 - 检查失败上传或重试是否有尖峰。 |
| Uploaded Logs by Status Code(按状态码分类的已上传日志) | 大量重试或失败状态码 | 上传在首次尝试时失败,但在重试时成功。 | - 目标临时停机或限流。 - Cloudflare 与目标之间的网络不稳定。 |
- 按状态码审查重试和失败分布。 - 与 Destination Availability(目标可用性) 比较以关联。 - 减小批次大小。 |
| Retry Attempts(重试次数) | 频繁的重试活动 | 上传反复失败并多次重试。 | - 目标不稳定或瞬态错误。 - 高延迟或目标确认缓慢。 |
- 验证目标正常运行时间和摄入速率。 - 确保目标未对请求进行限流。 - 偶发重试是预期的;持续尖峰需要审查。 |
| Avg. Upload Duration(平均上传持续时间) | 上传时间过长 | 上传耗时超过预期,表明延迟或批次过大。 | - 大批次或未压缩的负载。 - 网络或区域延迟。 - 目标处理延迟。 |
- 审查 Avg. Upload Duration(平均上传持续时间) 趋势。 - 减小批次大小以加快上传。 - 验证目标吞吐量和速率限制设置。 |
| Destination Availability(目标可用性) | 可用性低或不稳定 | Cloudflare 无法持续连接到您的目标。 | - 目标停机、DNS 错误或身份验证问题。 - 防火墙或网络限制阻止 Cloudflare。 |
- 检查 Destination Availability(目标可用性) 是否有下降。 - 确认目标凭据和端点正常运行时间。 - 审查允许列表或网络访问设置。 |
Logpush 通过自动重试来处理目标的临时问题。当目标暂时不可用时,Logpush 大约会在五分钟内重试约五次。但是,如果 Cloudflare 持续从目标收到错误,且无法跟上传入的批次,Logpush 最终会丢弃日志。
如果错误持续较长时间,Logpush 会假定目标永久不可用,并禁用您的推送作业。目标问题解决后,您可以重新启用该作业。
要监控重试行为和目标可用性,请使用运行状况仪表板指标,特别是 Retry Attempts(重试次数) 和 Destination Availability(目标可用性) 图表。