Skip to content

evidence gated local feedback reinforcement

lipluscodex edited this page Aug 11, 2026 · 3 revisions

Evidence-gated local feedback reinforcement

Question

success feedback の強化量をどのように決め、少数の成功や局所的な edge 更新が検索順位全体を不安定に変動させることをどう防ぐか。

Current resolution

この judgment は、今後の target policy として confirmed-outcome-feedback-reinforcement に supersede された。以下の used-evidence quorum 3 / normalization 1.0 は、observed artifact と現在の可逆な local deployment を表す既存状態として保持し、successor の mechanics と fresh comparison が完了するまで遡及変更しない。

次の feedback candidate は、学習証拠と serving weight を分離する。

  • relation trace 上の独立した success-use evidence を edge identity ごとに蓄積する。
  • 固定した evidence quorum を満たすまでは serving weight を変更しない。
  • quorum 後の credited reinforcement は既存の bounded learning-rate / maximum-weight 規則を使い、同一 source の uncredited sibling だけへ局所的な mass conservation を適用する。
  • quorum、learning rate、local normalization ratio は result-free rank-elasticity evaluation で固定し、採用値を観測後に調整しない。
  • candidate は default-off とし、relation improvement、direct / lexical / directional-negative non-regression、mutation scope、deterministic replay の development / conditional holdout gate を通過するまで既定値を変えない。
  • fresh canonical evaluation では evidence quorum 3 と same-source sibling normalization 1.0 が development / holdout の全 gate を通過した。この組合せはローカル MCP instance の可逆な opt-in evaluation deployment に進めるが、library / MCP CLI の既定値は quorum 1 / normalization 0.0 のまま維持する。

Edges

Background

rank-elasticity 診断は、同じ既定 learning rate でも、一回の feedback で順位が反転する threshold case と、edge weight と raw graph activation が増加しても max normalization 後の score と順位が変わらない ceiling case を区別した。単一の learning-rate 値だけでは、早すぎる順位反転と強化が順位へ届かない状態を同時に解消できない。

anchored fusion の固定候補は relation rank を改善すると direct / negative controls を退行させ、controls を維持する conservative variants は relation を改善しなかった。一方、same-source uncredited sibling だけを減算する opt-in normalization は repository-native controlled development / holdout の固定 gate を通過したが、external generalization と default 採用は主張していない。

Constraints

  • retry、duplicate、同一 source-use transition の再送を独立 evidence として数えない。
  • lexical trace、zero-hop success、uncredited source、別 source の edge を変更しない。
  • evidence quorum 到達時に未適用分を一括加算して大きな jump を作らない。quorum 到達を一回目の bounded serving update とする。
  • storage / feedback transaction は atomic とし、credited edge または sibling update が失敗した場合は evidence と weight の双方を rollback する。
  • rank-elasticity result は target rank だけでなく score margin、top-k entry / exit、non-target churn、regression を保持する。
  • synthetic または repository-native controlled pass を production quality や external corpus generalization へ拡張しない。

Conclusion

used-evidence quorum 3 / normalization 1.0 は controlled development / holdout を通過した既存 evidence と可逆な local deployment として保持する。今後の target policy は confirmed-outcome-feedback-reinforcement が supersede し、この node の artifact、設定、観測結果を遡及変更しない。

Related

Clone this wiki locally