Skip to content

real task shadow feedback validation

lipluscodex edited this page Aug 14, 2026 · 1 revision

Real-task shadow feedback validation

Question

controlled corpus 上で confirmed-triggered reinforcement の誤強化回避が支持された後、default 採用前の次の実証をどのように行うか。

Current resolution

次の実証は、客観的 outcome を持つ Codex 実タスクに対する shadow A/B とする。

  • 現行 serving policy を固定 baseline とし、confirmed+diminishing candidate は shadow 側だけで同じ task と retrieval event を再生する。
  • confirmed は Codex の自己評価だけでは発火させず、test 成功、引用 source との literal 一致、review acceptance、rollback や correction の不在など、事前登録した外部観測可能な outcome に接続する。
  • task inclusion、arm assignment、source identity、metric、停止条件、result schema を観測前に固定する。
  • retrieval correctness と誤強化率を primary とし、tool call、再検索、token、elapsed time は Agent end-to-end 効果を読む secondary metric とする。
  • shadow candidate は serving default、library/MCP default、既存 q3/s1 local registration を変更しない。

Edges

Background

Issue #85 / PR #86 の fresh comparison は development / holdout の固定 gate を通過した。baseline relation MRR は両 split とも 1.0 で strict rank improvement は観測できなかった一方、used+q3 arm は corrected-use の quorum 到達後に非期待 sibling を強化し、期待 terminal を rank 1 から 9 へ低下させた。confirmed+diminishing arm は corrected-use を control と同一に保ち、confirmed-use だけを減衰強化した。

この結果は controlled mechanics の安全性を支持するが、外部 corpus、実際の Codex 作業成功率、tool call や token の削減、production quality を検証していない。controlled pass を default 採用へ直結させず、実タスク上の観測へ軸を移す必要がある。

Constraints

  • 同じ AI が検索、利用、確認を担当する場合でも、自己評価だけを outcome gold にしない。
  • task または結果を見て metric、confirmation rule、停止条件を変更しない。
  • corrected、rolled_back、superseded から自動 negative reinforcement や rollback を追加しない。
  • shadow result が不足または不支持なら candidate を調整して同じ task を再利用せず、結果を保存して停止する。
  • 実タスク観測が完了するまで default adoption と production quality を主張しない。

Conclusion

次段は新しい controlled fixture の追加ではなく、客観的 outcome に接続した Codex 実タスクの shadow A/B とする。candidate は非 serving のまま観測し、検索品質と誤強化回避に加えて Agent end-to-end 効果を測る。default 採用はこの観測後の別判断に残す。

Related

Clone this wiki locally