Skip to content

Agent Eval Lab v0.3.0

Latest

Choose a tag to compare

@coolwkx coolwkx released this 19 Aug 09:42
· 2 commits to main since this release
560b2a9

Agent Eval Lab v0.3.0

这一版本把评测从“能生成一个数字”升级为“输入完整、统计稳定、证据边界清晰”的可复核流程。

主要更新

  • 新增 JSON/JSONL 命令行入口、Draft 2020-12 JSON Schema 与 ExperimentManifest。
  • 严格校验任务覆盖、随机种子、重复次数以及不同任务之间的调度一致性。
  • 支持多标签失败归因,同时保留单一主失败类型,便于统计与根因分析。
  • 修复大样本 McNemar 精确检验的数值溢出,并加入按任务聚类的确定性 Bootstrap。
  • 区分两类公开证据:可完整复算的合成示例,以及仅用于核对算术和口径的私有实验汇总。
  • 汇总证据增加嵌套字段白名单、来源校验、敏感信息与绝对路径扫描。
  • 空最终答案可以正常进入评测,并归因为 empty_final_answer

验证结果

  • 34 项自动化测试全部通过。
  • 公开合成示例可复算,作品集汇总通过 29 项一致性检查。
  • npm 打包检查通过;依赖安全审计为 0 个高危漏洞。

使用边界

仓库不公开、也不伪造原始私有运行轨迹。公开合成数据用于验证工具链机制;作品集汇总只能证明公开数字的算术与口径一致,不等同于原始实验复现。