为什么有了性能监控,还需要测量用户体验?
·
探索与观点
服务器CPU正常、数据库没有慢SQL、网络带宽也不高,但用户却在持续反馈系统很慢。监控一切正常,用户体验却是异常的——问题出在哪里?
设备指标 vs 用户体验
在很多环境里,我们经常遇到一个现象:
- 服务器CPU正常
- 数据库没有慢SQL
- 网络带宽也不高
但用户却在持续反馈:系统很慢。
问题是:监控一切正常,但用户体验却是异常的。
因为设备监测关注的是设备状态,无法反映用户体验。
"我知道慢了,还需要测吗?"
很多时候会有人说:"只要用户打电话,我就知道系统慢了。"
但问题在于:你知道"慢了",但你不知道"慢成什么样"。
为什么必须量化用户体验?
因为只有数据,才能回答三个关键问题:
- 是个别终端慢,还是大面积慢?
- 是一个系统慢,还是多个系统都慢?
- 慢是从什么时候开始的?
这些问题,本质上是在定义一件事:当前业务受影响的"范围"和"严重程度"。
"影响度",决定排查方向
不同的影响范围,对应完全不同的排查路径:
- 只有一个系统慢 → 优先看该系统
- 多个系统同时慢 → 优先看基础设施
- 个别终端慢 → 优先看终端或接入网络
也就是说:不是所有"慢",都需要全栈排查。
慢终端测量的价值:给排错一个"坐标系"
慢终端测量,本质上做了两件事:
- 定义范围(哪些用户慢)
- 圈定时间(什么时候开始慢)
当它与设备性能指标放在同一时间轴上:就能把"用户慢"与"系统变化"直接关联起来。
带来的改变是什么?
从:全栈排查,经验判断。
改为:基于影响度快速收敛范围,有方向地定位问题。
改为:基于影响度快速收敛范围,有方向地定位问题。
慢终端测量,不是为了证明"慢",而是为了定义"慢的范围和时间"。
汉远网智IT运维系统将慢终端测量与设备性能指标置于同一时间坐标系下,两者结合分析,通过影响度辅助排错。