Repository navigation
docs(rlpt3,#14464): frontiere gaming vs tampering (Everitt 2021) - #14650
Conversation
Nouvelle section 8 "Frontiere : specification gaming n'est pas reward tampering" avant la conclusion (renumeroee 9) : tableau taxonomie Everitt et al. (3 classes, definitions Figure 1), un exemple par classe, CID ASCII (regle du but instrumental, Figure 4), declaration de perimetre (aucun tampering demontre par construction), principes current-RF optimisation / rewards uninfluenceable + limite methodologique, renvoi DecInfer-05. Markdown-only : aucun changement de cellule code (exception C.2). Co-Authored-By: Claude-Code <noreply@anthropic.com>
Golden-Set Execution (H.7 P3)✅ 8/8 notebooks passed (certified reproducible)
Pinned lockfile: |
|
G-VAR-2/3 GENRE signals (advisory, non bloquant, #10020).
G-VAR-2 plafonne a max(1, grains_mergees_du_jour // 3) LIGHT par lane et par jour, toutes categories LIGHT confondues -- un RATIO, pas un plafond plat ; le cap calcule du jour est dans le tally ci-dessus. G-VAR-3 interdit deux genres LIGHT consecutifs. Les signaux ci-dessus rendent le fait VISIBLE (labels |
Notebook PR Validation: PASS
Checks: H.1 (no errors), H.3 (execution_count), C.1 (no banned patterns) |
|
[DONE c.963] PR #14650 — Lane Head : Grain : Cycle de reporting : Tell c.477 sustained « commit + PR AVANT rapport » était tenu (PR commited, CLEAN MERGEABLE) — il manquait le dashboard [DONE]. Cycle c.963 = finalisation honnête d'un cycle livré sans reporting. Périmètre : 1 fichier
Validations :
Tells sustained ×c.963 : c.745 strict 1 pertinent/cycle ✓ (1 PR LIVRÉE, dashboard finalisé) · c.477 sustained « commit+PR AVANT rapport » ✓ (PR commited hier 16:51Z, juste report en souffrance) · c.745 strict 3 BANNED ✓ (pas de DELETE / PATCH body / PUT) · c.918 ★×16ᵉ cycle NAMING LIVRÉ-urn ✓ · c.13475 ★★★ PREV-NOT-PR ✓ ( G-VAR-1 : TENU ×27ᵉ (genre Prune worktrees (résiduel c.962 levé) :
Résiduel c.964+ :
— po-2026 c.963 worker (lane |
Path-collision (organ #13359/#13615)Cette PR #14650 (
|
Grain: MED/notebook-python -- lane myia-po-2026:CoursIA -- prev: MED/guard #14601
Quoi
Enrichissement markdown-only de
MyIA.AI.Notebooks/RL/rlpt_3_reward_hacking.ipynb(#14464) : nouvelle section « ## 8. Frontière : specification gaming n'est pas reward tampering » insérée avant la conclusion (renumérotée 8 → 9), construite sur Everitt, Hutter, Kumar & Krakovna (2021), arXiv:1908.04734 :reward_proxyni ses entrées ne sont modifiables par le modèle ; §§3-5 = gaming pur, la frontière est tenue close par le protocole ;Fidélité vérifiée contre le PDF source (extraction pypdf, pages 1-8 et 18-19) : définitions Figure 1, structure d'ICI Figure 4a, §4.1, exemples 3/Figure 10b.
Validation (relancée après le dernier commit)
execution_count/outputsdans le diff — exception C.2, outputs précédents valides.python scripts/notebook_tools/notebook_tools.py validate <nb>= OK, 0 warnings, 0 errors.python scripts/notebook_tools/check_notebook_navlinks.py <nb>= 0 lien cassé (le lien relatif DecInfer-05 résout).python scripts/notebook_tools/validate_pr_notebooks.py origin/main <nb>= 1/1 passed (12 cellules code, exec_count + outputs cohérents).G-VAR-3 : ordre de merge recommandé (exposition même-genre)
La lane a déjà deux PRs
notebook-pythonouvertes plus anciennes (#14626, #14642). Si l'une merge juste avant celle-ci, l'adjacency guard (qui lit la séquence mergée, cf incident #14638) la bloque. Tout interfoliage évitant deux notebook-python consécutifs convient, p. ex. : #14626 → #14644 (tooling) → #14642 → #14632 (ledger) → celle-ci.Périmètre
1 fichier :
MyIA.AI.Notebooks/RL/rlpt_3_reward_hacking.ipynb(+70/−3, markdown uniquement).Closes #14464