Skip to content

confirmed outcome feedback reinforcement

lipluscodex edited this page Aug 11, 2026 · 1 revision

Confirmed outcome feedback reinforcement

Question

永続的な検索順位を変える relation feedback は source の利用時点と正しさの確認時点のどちらで発火し、後続の確認をどのように加算するか。

Current resolution

永続的な serving edge reinforcement は used ではなく confirmed outcome に接続する。

  • retrievedselectedvalidatedused は検索と利用の履歴を保存するが、永続 weight を変更しない。
  • 保存済み relation trace の node が実際に used となり、後続証拠または運用結果がその判断を支持した confirmed だけを正の reinforcement 候補にする。
  • credited edge ごとの最初の独立 confirmation は、既存の一回分の bounded reinforcement を multiplier 1.0 で適用する。
  • 後続の独立 confirmation は明示的な decay ratio に従う決定論的な減衰加算とし、累積 weight を上限へ飽和させる。
  • same-source sibling normalization は confirmation で実際に増加した credited delta だけを局所配分する。
  • 現行の used-evidence quorum 3 / normalization 1.0 deployment は、successor candidate の mechanics と fresh result-free comparison が完了するまで可逆な既存評価設定として維持する。

Edges

Background

従来の MCP v1 は、新規 used を即時 reinforcement へ接続したため、delayed confirmed は二重加算を避ける監査・評価記録に限定した。correctedrolled_back も、query、index、source selection、source、実装のどこへ原因を帰属するかを一件の outcome だけで決められないため、自動的な負の reinforcement に接続しなかった。

しかし used は最終判断の根拠として利用したことを示すだけで、判断の正しさを示さない。永続 weight を used で変更すると、初期露出、利用、強化、再露出の自己強化を生じ得る。hard quorum はこの過敏性を抑えるが、同じ credited edge の再利用が疎な場合は、正しい一回限りの利用からも学習できない。

used の reinforcement を外して confirmed を唯一の正の trigger にすれば、従来の二重加算理由は消える。確認済みの初回 signal を無視せず通常量で反映し、同じ edge の後続 confirmation だけを減衰させることで、疎な利用と過剰な反復学習を両立させる。

Constraints

  • confirmed は、同じ trace ですでに used となった node と、保存済みの一意な relation credited path にだけ適用する。回答全体の成功から曖昧な edge credit を推測しない。
  • duplicate outcome、同一 trace/node の再送、idempotency replay を独立 confirmation として数えない。
  • correctedrolled_backsuperseded はこの判断だけで自動的な負の reinforcement または既存 weight rollback に接続しない。原因帰属と反転規則は別の versioned policy とする。
  • candidate は default-off とし、現行 library / MCP defaults、ローカル q3/s1 registration、legacy engine/storage contract を mechanics 実装だけで変更しない。
  • decay ratio と採用判断は観測後に調整せず、used+q3 と confirmed+diminishing を比較する fresh result-free protocol で固定する。
  • #76 / #77 の protocol と observed artifact を変更、再実行、再集計しない。

Conclusion

永続 feedback の品質は利用回数ではなく outcome の意味で選別する。used は pending evidence、confirmed は最初の通常 bounded update、後続 confirmation は減衰加算とする。used-evidence quorum は既存 controlled evidence と可逆な deployment として保持するが、今後の target policy は confirmed-triggered reinforcement とし、default 採用は新規 mechanics と result-free comparison の通過後に別判断する。

Related

Clone this wiki locally