确定异常开始时间,核心是找到“指标从正常范围越出”的最早可核查时刻,而不是告警到达你手机的时间。对SEO监控软件来说,通常要综合告警记录、指标历史曲线、抓取日志和站内统计的采样时间,取其中最早且能排除误报的那个点。时间和人手有限时,先确定这个时间点,才能判断该先查抓取、索引还是页面本身。
同一件事在系统里往往有三个时间:指标实际发生变化的采样时间、监控规则触发的时间、通知送达的时间。三者可能相差几分钟到几小时。判断时以采样时间为准,触发和送达时间只用来解释“为什么现在才发现”。
如果监控频率是每天一次,异常开始时间只能精确到“某天”,不要强行写成具体小时。
确定起点前,先给每个指标定义正常范围。常见做法是取过去四周同一星期的数据做对比,因为搜索流量有明显的星期规律。判断依据可以写成检查项:
假设某页面点击量从周一开始下降,而抓取频次从上周六就减少。那么抓取异常开始时间应定在上周六,而不是周一。这里的关键是“哪个指标先动”,不是“哪个指标降得最多”。
观察:先拉出异常指标的历史曲线,标出最后一个正常点和第一个异常点,两者之间就是待查区间。区间越窄,后续排查越省力。
判断:在待查区间内找证据,例如服务器日志中的状态码变化、页面模板改动记录、robots文件或canonical标签的修改时间。能对上时间点的证据,才可作为起点依据。找不到证据时,只能给出“介于某时刻与某时刻之间”的范围。
处理:按影响面排序。如果异常起点早且影响的是整站抓取,优先处理;如果只是单个页面的标题变化,可以排后。人手有限时,先处理“起点早、范围大、可回滚”的问题。
复查:修复后不要立刻宣布恢复。至少观察一个完整采样周期,确认指标回到基线区间,并记录本次起点和修复时间,供下次对比。
下面清单可直接用于确定起点并安排优先工作:
如果第三方估算流量与站内统计对不上,不要用估算数据反推算法原因。以可核查的日志和站内数据为主,估算值只作参考。
确定异常开始时间后,下一步是把起点、证据来源、影响范围和负责人写进同一张处理单,再按影响面从大到小安排修复。这样即使中途换人,也能从记录的时间点继续排查,不必重新翻一遍全部数据。