Releases: fishzjp/qa-skills
Release list
v0.5.0 — 决策层 Phase A:类型决策矩阵 + 自包含架构 + 一键安装
v0.5.0 — 决策层 Phase A:类型决策矩阵 + 自包含架构 + 一键安装
上一个公开版(v0.4.0)证明了这套 skill 能把"看着专业、拿着没法执行"的测试产出变成可执行的。本版解决下一层问题:AI 自由发挥时根本不做测试类型决策——两个模型段位、30 个采样,零个逐轴的纳入/排除决策。新增「类型决策矩阵」决策层后,弱模型 0 → 0.88、中强模型 0 → 0.955。
本版亮点
1. 决策层 Phase A:类型决策矩阵(新)
测试策略升级为功能域 + 类型域两域决策:性能 / 业务安全 / 可靠 / 并发 / 兼容 / 无障碍 / 视觉 / 国际化 / 迁移 / 契约十个测试类型全轴必答——纳入必须挂信号、排除必须留痕(G+S 双清单)、full 档有预算上限,每条决策落盘为机器可校验的 type_scope(V1–V5 五条校验规则)。
- 新增
core/test-type-matrix.md(十轴决策矩阵唯一真相源)与core/scripts/scan_signals.py(G 级代码信号扫描 + 决策预填表,零依赖确定性输出) test-strategySKILL.md 重写:分轴组推进 + 受限选择 + 预填修订(面向弱模型的四个增益机制)- 配套:handoff 协议做实(专项移交包 + 结果回收表)、报告模板新增专项结果节、qa 新增预算裁决检查点
- 设计全文见 docs/decision-layer-design.md
2. skills 自包含重构 + 三条架构红线
被多个 skill 消费的方法 / 格式 / 规则全部下沉 core/(设计方法四篇、用例格式、Schema 抽取、统一澄清格式、Schema 校验器),跨 skill 引用清零。新增并 CI 拦截三条红线:禁止跨 skill 引用、description ≤300 字符、产品自包含(不引用本地评测链路)。
3. 一键安装与仓库收敛
install.sh/uninstall.sh:自动检测宿主 skills 目录,支持拷贝 / 软链,安装时写入版本标识- 仓库收敛为 skills 产品本体 + 设计文档 + examples + 安装与 CI 链路;完整方法学与原始数据在本地评测链路维护,公开证据链改为每版 Release 附增益矩阵快照(见下)
4. 评测驱动的一批行为修复
弱模型行为修复群(逐模块推进硬约束 / 输出预算纪律 / 维度核对三条)、Bug 严重度 S 系消歧、部署双形态适配、澄清反向结果消除(On 检出 100% vs Off 85.2%)。
跨模型增益矩阵快照(v0.5.0)
核心指标(正式口径:异构裁判复评轮,12 任务,n=3)
| 指标 | 无 Skill | 有 Skill |
|---|---|---|
| 用例规格符合度 | 0.26 | 0.98 |
| E2E 代码真实执行 | 0/3 可运行 | 1 全过 + 2×(2/3) |
| 植入 Bug 检出率 | — | 75%(异构裁判;同源 100%) |
| 产出质量(LLM judge) | 0.70 | 0.76(Δ+6.1pp) |
| API 代码真实执行通过率 † | 74% | 52% |
| Token 成本 | 1× | 3.3× |
† 如实披露的反向结果:skill 要求的三件套严断言更易暴露失败。覆盖增益(异构裁判):用例编写类 +8.7pp、全任务 +13.2pp、缺陷检出 +9.7pp,均显著。
决策层跨模型矩阵(本版新证据)
类型域决策任务族(5 任务,GT 双人独立标注复核,n=3,注入式上界口径,类别性判读):
| 模型段位 | 模型 | Off 类型决策查全 | On(严格口径) |
|---|---|---|---|
| 弱 | deepseek-v4-flash | 0.000(宽容口径亦 0) | 0.880 |
| 中强 | glm-5.2 ※ | 0.000(15/15 无显式决策) | 0.955(已解析样本;全样本 0.700 含 4 个空输出生成伪影) |
- ※ glm-5.2 同时是该任务族 GT 标注者之一(不知矩阵标注),双重身份如实披露
- Off 零显式决策跨模型复现(n=30 采样零例外):盲区在决策纪律而非类型知识——输出里"提到"了正确类型,但没有逐轴的纳入/排除决策
- 需求未提、只存在于代码的信号轴:contract 0 → 8/9、reliability 0 → 5/6
- 增益梯度 弱 > 中 成立,两段位决策质量均近顶;剩余差距分别是格式遵循(已修复)与生成预算(harness 侧),均非方法论问题
迭代记录:一行修复换 +0.35 查全(飞轮闭环)
首轮实测发现 47% 弱模型样本把决策写成块式 YAML 致解析失败(决策内容无恙,纯格式损耗)→ SKILL.md 落"每轴单行"硬约束 → 复验轮格式失败 7→0、查全 0.533→0.880。这是"实测发现 → 定位 → 修复 → 复验"闭环的第一圈完整记录。
污染检查(发布前,全过)
cutoff 核对(涉及模型知识截止均早于材料创建)、n-gram 扫描(本轮对外数字来源轮逐任务零告警)、canary(23 任务材料全覆盖)三件套通过,历史命中的 15 处维持 2026-08-21 基线人工裁决(可推导组合 + 方法论效应,非泄漏)。
升级注意
--link安装用户:git pull后必须重跑install.sh——skill 目录已迁入skills/,旧软链全部失效- 拷贝安装用户:替换整个仓库副本即可(安装后的宿主布局不变)
快速开始
git clone https://github.com/fishzjp/qa-skills.git && cd qa-skills
./install.sh # 自动检测 ~/.agents/skills 等宿主目录对 Agent 说一句话即可触发完整流水线:"帮我测试这个需求:{需求描述 + 仓库地址}";单阶段任务(写用例 / 审查 / 转自动化 / 回归范围)直接描述即可。宿主兼容性与 markmap 渲染指引见 README。
已知限制与下一步
- 决策层数字为 5 任务族、n=3 类别性判读(注入式上界口径),待任务扩容后进 README 正式表;scan 预填注入臂在中强模型侧因思考模型预算伪影作废,待 harness 流式修正后重跑
- 评测的注入通道将 skill 全部指令预注入,"有 skill"数字为指令全部在场的上界;in-situ 探针(n=1)未观测到衰减,更大样本在计划中
- 成对评审三种裁判下平局率均超限,胜率指标作废(机制问题,非平局结果本身)
- API 执行反向结果(52% vs 74%)的诊断与门处理按预注册纪律推进中
完整变更见 CHANGELOG.md。
v0.4.0 — 首个公开版本:全生命周期 QA Agent Skills 框架
v0.4.0 — 首个公开版本
让 AI 像资深测试工程师一样工作:一句「帮我测试这个需求」,跑完 需求理解 → 风险分析 → 测试策略 → 用例编写 → 审查 → 自动化执行 → Bug 分析 → 回归 → 测试报告 的完整流水线。
面向 Claude Code 等 Agent 的一套测试工程 Skill 框架:不是几个测试 Prompt,而是「方法论 + 10 Skills + Benchmark」三层,且每个数字都实测过——包括对自己不利的数字。
它解决什么问题
- AI 写的用例"看着专业,拿着没法执行"——占位符、模糊判定、虚构入口、无时限异步。本框架的核心产出标准只有一条:没读过需求、没人讲解的人,拿着文件能直接开工(不可执行的用例,覆盖再全也计零分)
- 指令堆得越多 AI 越弱——三层架构(触发边界 / ≤500 行工作流 / 按需加载的方法库),Agent 每一步只面对当前需要的指令
核心特性
- 10 个 skill 全生命周期:
qa薄编排 + 需求分析 / 测试策略 / 用例编写(含代码优先审查)/ 用例审查 / E2E 自动化 / API 自动化 / 探索性测试 / Bug 分析 / 回归测试 - 证据与风险双模型:每条结论标注证据等级(E0–E4),风险评级必须挂证据;推导链可追溯
- 文件即流水线状态:阶段产物落盘,Skill 间只通过文件衔接,中断后新会话凭文件续跑
- 双轨用例产物:markmap 给人执行 + Test Case Schema 给机器消费(审查/回归/执行自动化)
- 科学评估体系:黄金集 12 任务 + 多样本生成(n=3)+ 任务层配对 bootstrap 95%CI + 成对评审位置互换 + E2E/API 真实执行验证 + GT 标注独立审计 + 门预注册冻结
实测效果(Skill On / Off,如实披露)
| 指标 | 无 Skill | 有 Skill | 说明 |
|---|---|---|---|
| E2E 代码真实执行通过率 | 0% | 78% | 真实浏览器 + 被测应用,无 judge 参与 |
| 植入 bug 检出率 | — | 100% | 代码审查类任务 |
| 产出质量(LLM judge) | 0.87 | 0.92 | 配对 bootstrap 95%CI 显著 |
| 用例可执行性 | 0.77 | 0.98 | 客观正则;该口径含 skill 模板遵从度,构造上偏向 On(详见 eval 文档) |
| API 代码真实执行通过率 | 87% | 52% | 如实披露的反向结果:skill 的三件套严断言更易暴露失败 |
| token 成本 | 1× | 3.3× | 更好但更贵 |
门判定 4/7 通过(G2/G3/G5/G6 ✅,G1a/G1b/G4 ❌)按预注册纪律如实记录,失败门诊断与阈值来源的噪声膨胀分析见 eval/EXPECTED.md——包括"校准轮 +28.8pp 被多样本复验证实为噪声(实际 +6.2pp)"这类自我纠错的记录。
v0.4.0 变更(全面审查修复)
- 预注册纪律补留痕:G2 阈值 0.75→0.85 修订如实披露并立规(门修订须独立提交先行)
- 全部文档数字对齐落盘 metrics.json(成对评审 23 对/21 平、审计一致率 0.872)
- harness 工程加固:judge GT-id 本地校验、mock 就绪探测 + 端口预检、执行异常包裹、统计口径修正(配对任务集均值、pairwise 任务层聚合、G5/G6 门实现保真)
- skills 一致性:修复 api-testing 无效示例代码、风险等级/改动分类/Bug 条目字段三处体系归一
完整变更见 CHANGELOG.md。
快速开始
# 复制到你的 Agent skills 目录(core/ 必须一起,各 skill 相对引用它)
cp -r qa core requirement-analysis test-strategy test-case-writing test-case-review \
automated-e2e-testing api-testing exploratory-testing bug-analysis regression-testing \
<项目>/.claude/skills/
# 对 Agent 说一句话
"帮我测试这个需求:{需求描述 + 仓库地址}"单阶段任务(写用例 / 审查 / 转自动化 / 回归范围)直接描述即可触发对应 skill。
已知限制与下一步
- 本轮 judge 与生成模型同源(额度耗尽降级),覆盖/质量/成对数字为保守估计——异构 judge 复评与 G7 泛化待 opencode 额度恢复补跑
- 黄金集覆盖 8/10 个 skill(
qa为编排层、exploratory-testing未纳入),扩容优先补齐 - v1.1 门提案已基于本轮多样本估计导出,只约束下一轮
Full Changelog: v0.3.0...v0.4.0