Skip to content

v2.8.1 — 安全性與資料遺失修復

Choose a tag to compare

@lianghsun lianghsun released this 11 Sep 04:49
· 11 commits to main since this release
1c5cf1d

從 PR #136 拆出的獨立 bug fix 批次(#158),作者 @dave-apmic / S.Feng。內容為不改變評測分數的修復。

🔴 重要修復

  • --benchmark 把完整 API 金鑰寫進 benchmark_results_*.json —— 該路徑未經清理(原則 E 破口)
  • finalize 刪除合併後的 JSONL —— rank0 的 shard 路徑與合併輸出路徑相同(原則 D 資料遺失)
  • _prepare_config_for_saving() 就地破壞 self.config —— 同一個 runner 無法重複執行

其他修復

  • HTML exporter 在 usage_total_tokens 為 None 時崩潰;模型輸出未經 html.escape() 會注入報告
  • cli.py 的 sys.path hack 遮蔽 HuggingFace datasets 套件
  • text2sql 的 SQL 執行逾時從未生效
  • gated dataset 檢查的運算子優先序錯誤

⚠️ 行為變更

  • --dry-run 與評測啟動不再做 Google 連線檢查(修好 §4 與 §12 兩個契約;代價是診斷延後到上傳階段)
  • Google Sheets 匯出移除金鑰欄位 —— 既有試算表的歷史列仍有截斷金鑰且會位移一欄,建議封存
  • --download-dataset 對非 gated 的 403 改為 exit 1
  • text2sql 逾時真的生效,gold SQL 逾時會退回 Exact Match,可能小幅改變分數

注意

秒級時間戳只套用到 log 檔名。results_*.json 與 JSONL 仍是分鐘精度,同分鐘啟動兩次會出問題(JSON 被覆蓋、JSONL 累加導致下游重複計數)。

完整內容見 CHANGELOG。