Releases: coolwkx/agent-eval-lab
Releases · coolwkx/agent-eval-lab
Release list
Agent Eval Lab v0.3.0
Agent Eval Lab v0.3.0
这一版本把评测从“能生成一个数字”升级为“输入完整、统计稳定、证据边界清晰”的可复核流程。
主要更新
- 新增 JSON/JSONL 命令行入口、Draft 2020-12 JSON Schema 与 ExperimentManifest。
- 严格校验任务覆盖、随机种子、重复次数以及不同任务之间的调度一致性。
- 支持多标签失败归因,同时保留单一主失败类型,便于统计与根因分析。
- 修复大样本 McNemar 精确检验的数值溢出,并加入按任务聚类的确定性 Bootstrap。
- 区分两类公开证据:可完整复算的合成示例,以及仅用于核对算术和口径的私有实验汇总。
- 汇总证据增加嵌套字段白名单、来源校验、敏感信息与绝对路径扫描。
- 空最终答案可以正常进入评测,并归因为
empty_final_answer。
验证结果
- 34 项自动化测试全部通过。
- 公开合成示例可复算,作品集汇总通过 29 项一致性检查。
- npm 打包检查通过;依赖安全审计为 0 个高危漏洞。
使用边界
仓库不公开、也不伪造原始私有运行轨迹。公开合成数据用于验证工具链机制;作品集汇总只能证明公开数字的算术与口径一致,不等同于原始实验复现。
v0.2.0 — 配对与证据完整性升级
Agent Eval Lab v0.2.0
- 使用 taskId + repeatId + seed 严格配对,拒绝重复和孤立样本
- 成功率与 McNemar 使用同一批有效配对
- verification 证据必须与成功 tool_result 的产出一致
- 自动测试 10/10、合成演示通过、依赖漏洞 0
附件是明确标注的合成示例报告,只用于复现评测流程。
v0.1.0 — Reproducible Agent Evaluation Lab
首个招聘展示版本。
- 轨迹完整性和证据式完成判定
- 结构化失败类型归因
- 配对 A/B、Fail→Pass / Pass→Fail 和 exact McNemar 检验
- 3 条明确标注的合成任务,5 项自动测试
- 新增架构图、演示 GIF 和中文面试讲解材料
演示数字仅验证评测器流程,不代表真实 Agent 性能。