根因分析 Skill:从问题假设走向可验证的根因结论
根因分析要解释防线为何没有阻止影响扩大,并把责任讨论建立在时间线、实验和证据上。结论必须能被复核。
根因分析 Skill 区分触发因素、促成条件和缺失控制,把事故故事转为预防工作。
本文用贴近协作现场的案例拆解判断过程,帮助你把不同信号转化为可沟通、可追踪的行动。
根因分析 Skill 用来做什么
根因分析适合事故、缺陷或性能退化已经出现,却还停留在猜测阶段的团队。它用时间线、候选假设和反驳实验推进结论,并把防复发动作交给明确负责人。
先回到源 Skill
这个 Skill 的完整执行规则在 根因分析 提示词。源目录还包含 3 个评测用例,用于验证输出是否遵守契约。
它要求特别注意:
- 不要把最后一个报错当根因
- 区分触发因素、根因和促成因素
- 证据不足时保持假设状态
用一份项目材料开始
先把当前拿得到的材料摆上来。缺口可以保留,状态必须说实话。
| 材料 | 这次填什么 | 缺失时的处理 |
|---|---|---|
| 目标与范围 | 针对支付失败事故构建可验证的根因假设,区分触发因素、扩散路径和修复验证 | 标出不在本轮判断内的链路 |
| 版本与环境 | 事故 ID、复现版本、部署环境、时间线和变更窗口 | 无法复现时先保留假设状态 |
| 证据 | 最小复现、日志、指标、代码 diff、配置和实验结果 | 把相关性与已验证因果分开记录 |
| 决策边界 | 候选根因、验证实验、修复方案和回滚 Owner | 每个假设绑定支持与反证条件 |
可以这样调用:
请使用 root-cause-analysis Skill。
任务:针对支付失败事故构建可验证的根因假设,区分触发因素、扩散路径和修复验证
输入材料:[版本、链接、日志或报告路径]
范围:[本次包含和排除的对象]
限制:[时间、数据、权限、合规要求]
先审计输入,再按风险和证据强度排序。材料没有证明的内容标为假设,并列出验证方法。
根因分析要让假设接受反驳
| 产物 | 要回答的问题 | 最低证据 |
|---|---|---|
| 症状时间线 | 什么时候开始,影响怎样扩大 | 日志、指标、发布和用户事件 |
| 候选假设 | 哪些机制可以解释症状 | 代码、配置、依赖和历史缺陷 |
| 反驳证据 | 什么观察会推翻某个假设 | 实验、对照、复现和失败结果 |
| 防止复发 | 哪项修复会改变系统行为 | 修复、监控、测试和 Owner |
没有时间线、复现条件或反驳实验时,只能写候选原因,不能写最终根因。
在项目里跑一轮
先用一个边界清楚的小回合启动——针对支付失败事故构建可验证的根因假设,区分触发因素、扩散路径和修复验证。别急着把结果写成报告。先把输入版本、时间窗口和负责人贴到同一处;然后把每个判断连回具体材料;最后只安排一项能改变结论的验证动作。
根因不是最先看到的错误,假设需要反证、时间线和修复后的验证。这一轮交付应当包含:可复查的证据索引、仍然成立的假设、以及下一位同事可以直接执行的动作。这样做很朴素,也很有效。
进阶使用:把一次分析变成持续机制
根因不是最先看到的错误,假设需要反证、时间线和修复后的验证。
每次根因分析都保存症状窗口、版本、假设和实验结果。新证据出现时更新假设状态,保留被推翻的路径,避免复盘只剩最后一句结论。
三段式 Skill 链
production-incident-analysis → root-cause-analysis → change-impact-analysis
| 交接 | 传递内容 | 接收方要检查什么 |
|---|---|---|
| 上游到 root-cause-analysis | 来源版本、范围、风险、未决项 | 输入是否过期,冲突是否标记 |
| root-cause-analysis 到下游 | 判断、证据索引、残余风险、待办 | 产物是否可执行,Owner 是否明确 |
| 下游回写 root-cause-analysis | 执行结果、缺陷、事实变化 | 是否更新基线与回归范围 |
交接时传摘要、证据索引和原始材料的位置。信息量足够,结论出了问题也能回到来源。
团队门禁
| 门禁 | 检查内容 | 未满足时 |
|---|---|---|
| root-cause-analysis 输入门禁 | 版本、环境、证据来源和 Owner | 停止生成,列出缺口 |
| root-cause-analysis 产物门禁 | 关键结论带依据、状态和影响 | 退回补证据 |
| root-cause-analysis 执行门禁 | 命令、查询或验证路径可复现 | 标记基础设施或测试问题 |
| root-cause-analysis 决策门禁 | 残余风险有接受人与日期 | 不进入下一阶段 |
容易踩的坑
- 看到最后一个报错就把它当成根因。
- 只找一个组件背锅,没有解释防线为何失效。
- 没有设计能区分候选原因的实验。
- 修复症状后就关闭问题,没有验证影响是否真的消失。
相关 Skill
根因分析需要把初始线索、运行证据和事故上下文放在同一条链上:
交付前复核:把判断落到证据
Skill 输出拿到手后,先核对四件事:输入版本是否明确,范围是否完整,每条结论能否回到证据,下一步由谁执行。少一项,报告就容易变成漂亮的猜测。
| 项目 | 需要留下 | 缺失时 |
|---|---|---|
| 输入边界 | 版本、环境、时间窗口和本次范围 | 标记假设,不写成事实 |
| 证据索引 | 日志、报告、Trace、截图或命令输出 | 标记 evidence_pending |
| 结论状态 | verified、assumption、blocked 或 pending | 停止扩大结论 |
| 后续动作 | 最小验证命令、负责人和截止时间 | 交付为待办,不进入门禁 |
source_version: [版本或提交]
scope: [本次包含和排除的对象]
evidence: [日志、报告、Trace 或命令输出]
status: pending
owner: [负责人]
next_action: [最小验证动作]
分析类 Skill 要保留查询条件和时间窗口;执行类 Skill 要保留命令、退出码和失败产物。人工修改也要记录,下一次复核才知道结论从哪里变化。
安装与调用
安装这个 Skill:
npx skills add https://github.com/naodeng/awesome-qa-skills/tree/main/skills/zh/testing-types/root-cause-analysis -g
安装后,直接使用下文的 root-cause-analysis 调用词,并附上本次的真实材料。
常见问题
输入还不完整,能开始吗?
能。先交付受限初版:列出已知事实、假设、缺口和最小验证动作。环境、数据或权限缺失时,不写执行结论。
什么时候需要人工确认?
范围取舍、风险接受、生产操作、数据权限和发布决定必须由对应负责人确认。Skill 负责整理证据与选项,不替团队做授权决定。
先用一份真实材料跑通 根因分析,把输入、产物、人工修改和验证证据留在同一个工作链里。下一次变化发生时,才有东西可以复用。
参考
- 根因分析 提示词:https://github.com/naodeng/awesome-qa-skills/tree/main/skills/zh/testing-types/root-cause-analysis/prompts/root-cause-analysis.md
- Awesome QA Skills:根因分析 Skill 源文件:https://github.com/naodeng/awesome-qa-skills/tree/main/skills/zh/testing-types/root-cause-analysis
- Awesome QA Skills GitHub 项目:https://github.com/naodeng/awesome-qa-skills
- 根因分析 Skill 详情页:https://inaodeng.com/zh-cn/qaskills/root-cause-analysis/