可用率 99.9% 还老是断?统计粒度在捣鬼

2026年08月30日

13 次

供应商给的可用率报告写着 99.9%,可你实际用起来还是三天两头断线。问题不一定出在供应商造假,更常见的原因是统计粒度太粗——99.9% 是”月平均”还是”每天平均”,是按连接次数算还是按时长算,差别天壤之别。这篇把可用率报告里的门道拆开。

99.9% 是怎么算出来的

同样的 99.9%,算法不同含义完全不同。按”月内成功连接数 ÷ 总连接数”算,一次高峰期的集中失败会被大量成功请求稀释;按”可用天数 ÷ 月天数”算,一天里只挂了十分钟也算作当天不可用,数字反而偏保守。更隐蔽的是统计范围:只统计了线路侧的成功率,还是把业务侧的重试也算进去了?范围不同,数字直接对不上。

粒度 统计口径 数字表现 掩盖的问题
月粒度 全月成功比例 通常很高 集中故障被摊平
天粒度 每日达标比例 波动明显 单日异常天数
小时粒度 每小时可用性 最真实 时段性故障规律
请求粒度 逐请求成功失败 最细 单点偶发失败

粒度太粗会掩盖什么

最典型的坑是”月粒度摊平效应”:某个地址在晚上高峰期连续失败三天,但白天大量成功请求把分母撑大了,月末一算还是 99.8%。你看到的是好看的月报,业务感受到的是连续三天的定时故障。另一个坑是统计样本错位:报告统计的是线路连通率,你实际跑的是特定目标的访问——线路通、目标站拒,报告上照样是”可用”。

怎么拿到可信的可用率

不依赖供应商的单一日报,自己建立小时粒度的观测。按小时统计成功率,连续 24 小时就能看到故障的时段分布;同时记录”失败集中在哪些目标站”,把连通率和业务成功率分开算;最后拿供应商报告和自测数据对一下口径,两边数字长期对不上,说明有一方统计有问题,需要坐下来对齐。

  • 自建小时观测:按小时统计成功率,连看 24 小时找时段规律
  • 分开算两种率:线路连通率与业务成功率分开统计
  • 对口径再对比:自测数据与供应商报告长期对不上就要追查
  • 盯异常时段:同一时段连续失败三天,比月报数字更值得重视

可用率像成绩单上的平均分:一科满分一科挂科,平均分照样好看——但业务要的不是平均分,是每天都不挂科。

与 IP 代理的关系:代理出口的可用率是选型与运维的核心指标,统计粒度直接决定数字是否可信;在遵守平台规则与法律法规的前提下,建立自己的小时级观测,才能不被漂亮的月报误导,把真正的问题找出来。

相关咨询请联系QQ/微信:157069302