autorenew
类型 Evals

同步日期: 2026-09-02

AI Agent 测试

需要系统验证 Agent 的规划、记忆、工具使用、恢复能力、安全边界和任务完成质量。

何时使用

  • 需要系统验证 Agent 的规划、记忆、工具使用、恢复能力、安全边界和任务完成质量。
  • 需要对现有方案、结果或证据做风险评审,并形成可执行改进项。
  • 输入不完整,但仍需先给出带假设和信息缺口的可用初版。

执行流程

  1. 先阅读并遵循 prompts/ai-agent-testing.md 的输入、执行规则、最低覆盖清单和输出顺序。
  2. 补充真正影响判断的范围、环境、版本、限制、证据和成功标准。
  3. 先做输入审计,再区分已确认事实、合理假设和待确认问题。
  4. 按风险和证据强度排序,产出可直接执行、评审或验证的结果。
  5. 信息不足时不要停在提问:先交付受限初版,并说明哪些结论暂不能成立。

核心约束

  • 同时评价最终结果和过程轨迹
  • 将随机性纳入重复试验
  • 不要把单次成功当作可靠性证明
  • 不编造输入中不存在的系统行为、字段、数据、指标或根因。
  • 关键结论必须关联证据;证据不足时标记为假设并给出验证方法。
  • 优先级必须说明业务影响、发生可能性或可探测性依据。

交付前自检

  • 已覆盖:任务完成、规划质量、多步一致性、工具使用、记忆污染、失败恢复、权限边界、成本与时延。
  • 已区分事实、假设、缺口和建议。
  • 高风险项有明确优先级、证据、负责人或下一步。
  • 输出包含可验证的判断标准,而非泛泛而谈。
  • 未执行未经授权的生产写操作或破坏性动作。

常见误区

  • 只列检查点,不说明输入条件、预期结果或证据。
  • 把所有事项都标为高优先级,失去取舍价值。
  • 用工具名或通用理论替代领域判断。
  • 输入不完整时直接拒绝,或反过来假装结论已经确定。

安装与调用

平台

AI 工具

npm 安装(推荐)

npx skills add https://github.com/naodeng/awesome-qa-skills/tree/main/skills/zh/testing-types/ai-agent-testing -g -a codex -y

快速安装(一行命令)

完整脚本

调用示例

@skill ai-agent-testing
结合当前项目上下文,按该技能的要求给出可执行结果。
分享