Skip to content

v0.4.0 — 首个公开版本:全生命周期 QA Agent Skills 框架

Choose a tag to compare

@fishzjp fishzjp released this 20 Aug 12:45
· 63 commits to main since this release

v0.4.0 — 首个公开版本

让 AI 像资深测试工程师一样工作:一句「帮我测试这个需求」,跑完 需求理解 → 风险分析 → 测试策略 → 用例编写 → 审查 → 自动化执行 → Bug 分析 → 回归 → 测试报告 的完整流水线。

面向 Claude Code 等 Agent 的一套测试工程 Skill 框架:不是几个测试 Prompt,而是「方法论 + 10 Skills + Benchmark」三层,且每个数字都实测过——包括对自己不利的数字。

它解决什么问题

  • AI 写的用例"看着专业,拿着没法执行"——占位符、模糊判定、虚构入口、无时限异步。本框架的核心产出标准只有一条:没读过需求、没人讲解的人,拿着文件能直接开工(不可执行的用例,覆盖再全也计零分)
  • 指令堆得越多 AI 越弱——三层架构(触发边界 / ≤500 行工作流 / 按需加载的方法库),Agent 每一步只面对当前需要的指令

核心特性

  • 10 个 skill 全生命周期qa 薄编排 + 需求分析 / 测试策略 / 用例编写(含代码优先审查)/ 用例审查 / E2E 自动化 / API 自动化 / 探索性测试 / Bug 分析 / 回归测试
  • 证据与风险双模型:每条结论标注证据等级(E0–E4),风险评级必须挂证据;推导链可追溯
  • 文件即流水线状态:阶段产物落盘,Skill 间只通过文件衔接,中断后新会话凭文件续跑
  • 双轨用例产物:markmap 给人执行 + Test Case Schema 给机器消费(审查/回归/执行自动化)
  • 科学评估体系:黄金集 12 任务 + 多样本生成(n=3)+ 任务层配对 bootstrap 95%CI + 成对评审位置互换 + E2E/API 真实执行验证 + GT 标注独立审计 + 门预注册冻结

实测效果(Skill On / Off,如实披露)

指标 无 Skill 有 Skill 说明
E2E 代码真实执行通过率 0% 78% 真实浏览器 + 被测应用,无 judge 参与
植入 bug 检出率 100% 代码审查类任务
产出质量(LLM judge) 0.87 0.92 配对 bootstrap 95%CI 显著
用例可执行性 0.77 0.98 客观正则;该口径含 skill 模板遵从度,构造上偏向 On(详见 eval 文档)
API 代码真实执行通过率 87% 52% 如实披露的反向结果:skill 的三件套严断言更易暴露失败
token 成本 3.3× 更好但更贵

门判定 4/7 通过(G2/G3/G5/G6 ✅,G1a/G1b/G4 ❌)按预注册纪律如实记录,失败门诊断与阈值来源的噪声膨胀分析见 eval/EXPECTED.md——包括"校准轮 +28.8pp 被多样本复验证实为噪声(实际 +6.2pp)"这类自我纠错的记录。

v0.4.0 变更(全面审查修复)

  • 预注册纪律补留痕:G2 阈值 0.75→0.85 修订如实披露并立规(门修订须独立提交先行)
  • 全部文档数字对齐落盘 metrics.json(成对评审 23 对/21 平、审计一致率 0.872)
  • harness 工程加固:judge GT-id 本地校验、mock 就绪探测 + 端口预检、执行异常包裹、统计口径修正(配对任务集均值、pairwise 任务层聚合、G5/G6 门实现保真)
  • skills 一致性:修复 api-testing 无效示例代码、风险等级/改动分类/Bug 条目字段三处体系归一

完整变更见 CHANGELOG.md

快速开始

# 复制到你的 Agent skills 目录(core/ 必须一起,各 skill 相对引用它)
cp -r qa core requirement-analysis test-strategy test-case-writing test-case-review \
      automated-e2e-testing api-testing exploratory-testing bug-analysis regression-testing \
      <项目>/.claude/skills/

# 对 Agent 说一句话
"帮我测试这个需求:{需求描述 + 仓库地址}"

单阶段任务(写用例 / 审查 / 转自动化 / 回归范围)直接描述即可触发对应 skill。

已知限制与下一步

  • 本轮 judge 与生成模型同源(额度耗尽降级),覆盖/质量/成对数字为保守估计——异构 judge 复评与 G7 泛化待 opencode 额度恢复补跑
  • 黄金集覆盖 8/10 个 skill(qa 为编排层、exploratory-testing 未纳入),扩容优先补齐
  • v1.1 门提案已基于本轮多样本估计导出,只约束下一轮

Full Changelog: v0.3.0...v0.4.0