日志分析的目标不是找到最多的错误行,而是回答“最早从哪里偏离正常状态”。一条可信时间线必须能被其他人重复验证。
固定时间基准
先确认所有系统的时区和时钟偏差。查询时统一使用 UTC,并记录原始时间格式。跨服务误差超过几秒时,不要仅靠时间排序,应结合 trace ID、请求 ID 和消息偏移量。
timedatectl status
journalctl --since '2026-07-01 13:50:00' --until '2026-07-01 14:20:00' -o short-iso
从用户症状反向追踪
选择一个明确失败的请求作为样本,从入口状态码、网关日志、服务日志一路追到依赖。每一跳记录请求标识、耗时和返回状态,不要先搜索模糊的 error。
保留原始证据
导出日志时同时保存查询条件、索引范围和校验值。避免在原始文件上直接编辑或只保留截图。敏感字段应在副本中脱敏。
时间线格式
每条记录包含时间、组件、事实、证据链接和动作。推测使用“假设”标识;被证伪的假设不要删除,它能解释团队为什么改变方向。
复盘前检查
- 是否找到第一个异常信号,而不只是最大影响点
- 是否能区分触发因素、放大因素和恢复阻碍
- 是否保留了变更、告警和人工操作记录
- 是否能用同一查询重新得到结论