autorenew

技能详情

提示词测试

需要验证提示词在代表性、边界、对抗和版本变化下的正确性、稳定性与可控性。

状态稳定
类型原子 Skill
领域软件测试
生命周期测试设计
适合角色QA / DEV
语言中文 / 英文
评测有评测 ✓
同步日期2026-09-15

解决什么问题

它把当前 Skill 的方法整理成可以直接执行、评审和复用的质量输入。

  • 不要只测一个样例
  • 固定模型与参数
  • 对语义结果使用 rubric 而非脆弱的逐字匹配
  • 只列检查点,不说明输入条件、预期结果或证据。

适用场景

推荐使用
  • 需要验证提示词在代表性、边界、对抗和版本变化下的正确性、稳定性与可控性。
  • 需要使用 prompt-regression 模式比较基线与候选版本,并记录数据集身份、行为差异和证据状态。
  • 需要对现有方案、结果或证据做风险评审,并形成可执行改进项。
  • 输入不完整,但仍需先给出带假设和信息缺口的可用初版。
常见误区
  • 只列检查点,不说明输入条件、预期结果或证据。
  • 把所有事项都标为高优先级,失去取舍价值。
  • 用工具名或通用理论替代领域判断。
  • 输入不完整时直接拒绝,或反过来假装结论已经确定。
  • 把候选版本与基线的表面差异直接写成回归缺陷,或遗漏可比性和证据状态。

输入

最低输入
  • 当前任务范围、目标和待处理对象。
推荐输入
  • 项目目标
  • 测试范围
  • 约束条件
可选上下文
  • 相关代码或配置
  • 历史结果
  • 日志与指标

输出

输出会围绕该 Skill 的方法形成可执行结果,并明确事实、假设、风险和下一步。

不安装也能判断输出价值

  1. 01已覆盖:指令遵循、格式、事实性、边界输入、对抗输入、多语言、稳定性、回归、成本。
  2. 02已区分事实、假设、缺口和建议。
  3. 03高风险项有明确优先级、证据、负责人或下一步。
  4. 04输出包含可验证的判断标准,而非泛泛而谈。
查看完整输出结构
  1. 05回归模式保留数据集/测试提示词身份、证据状态、差异和 Human 决策边界。
  2. 06未执行未经授权的生产写操作或破坏性动作。

工作原理

  1. 01先阅读并遵循 prompts/prompt-testing.md 的输入、执行规则、最低覆盖清单和输出顺序。
  2. 02选择普通测试或 prompt-regression 模式;回归模式必须读取基线、候选版本、数据集/测试提示词身份和可比性信息。
  3. 03补充真正影响判断的范围、环境、版本、限制、证据和成功标准。
  4. 04先做输入审计,再区分已确认事实、合理假设和待确认问题。
  5. 05按风险和证据强度排序,产出可直接执行、评审或验证的结果。
  6. 06信息不足时不要停在提问:先交付受限初版,并说明哪些结论暂不能成立。

安装与快速开始

安装命令 / SHELL
npx skills add \
  https://github.com/naodeng/awesome-qa-skills/tree/main/skills/zh/testing-types/prompt-testing
  -g
prompt-testing.prompt
@skill prompt-testing

结合当前项目上下文,按该 Skill 的要求给出可执行结果。

补充上下文:
[粘贴项目背景或需求]