Part of #17528 — arc A (jeux d'assistance, série GameTheory)
Constat (mesure du 23/09 sur main)
GameTheory-15-CooperativeGames.ipynb est le seul notebook du dépôt, avec son jumeau C#, où le programme de recherche de Russell habite au lieu d'être cité. Sa section 4 (cellules 24 à 35) présente le Paperclip Game et l'Off-Switch Game, code une simulation (cellule 31) et en tire un seuil de confiance « autour de 50-60 % » (cellules 32 et 34). Elle attribue le cadre à AIMA 4e §18.2.5 et à Hadfield-Menell et al. (2016, 2017).
Jusqu'au 23/09, ces deux papiers étaient cités sans être archivés. Ils le sont désormais (chemins ci-dessous).
Livrable, en deux PRs
1. Confrontation aux sources (MED)
Relire la section 4 contre le texte archivé de The Off-Switch Game. Le papier établit qu'un agent qui tient sa fonction de récompense pour acquise est incité à désactiver l'interrupteur, sauf si l'humain est parfaitement rationnel, et que la préservation de l'interrupteur exige l'incertitude du robot sur l'utilité humaine.
- Vérifier que la simulation de la cellule 31 modélise bien ce résultat.
- Établir d'où vient le seuil « autour de 50-60 % » : résultat du papier ou paramétrage propre au notebook. Dans le second cas, le dire dans la prose.
- Corriger ce qui doit l'être (prose ou simulation), puis re-exécuter (C.2).
- Aucun verdict n'est présumé : si la section est fidèle, la PR le dit et la preuve suffit.
2. Un résultat de 2026 exécuté (DEEP)
Une section ou un notebook qui exécute un résultat récent au lieu de le citer. Le choix revient à la lane, qui le motive dans le body :
- Provably Optimal Learning Algorithms for Assistance Games (Ananthakrishnan, Bedaywi, Jordan, Russell, Haghtalab, 2026) ;
- Learning the Preferences of a Learning Agent (Abdel Sadek, Bedaywi, Gould, Russell, 2026) ;
- ou The Partially Observable Off-Switch Game (2411.17749) / AssistanceZero (2504.07091), à archiver d'abord dans le gisement (identité vérifiée sur la première page).
Un nouveau notebook suit la règle de numérotation par accrétion : un numéro se justifie par un argument pédagogique écrit.
Périmètre et contraintes
Sources (gisement G:\Mon Drive\MyIA\IA\Bibliographie IA)
| Source |
Chemin |
sha8 |
| Cooperative Inverse Reinforcement Learning (2016, arXiv 1606.03137) |
GameTheory\2016 - Hadfield-Menell et al - Cooperative Inverse Reinforcement Learning (arXiv 1606.03137).pdf |
A06213BE |
| The Off-Switch Game (2016, arXiv 1611.08219) |
GameTheory\2016 - Hadfield-Menell et al - The Off-Switch Game (arXiv 1611.08219).pdf |
2E813111 |
| Provably Optimal Learning Algorithms for Assistance Games (2026, arXiv 2607.08012) |
GameTheory\2026 - Ananthakrishnan et al - Provably Optimal Learning Algorithms for Assistance Games (arXiv 2607.08012).pdf |
EFD6BC8D |
| Learning the Preferences of a Learning Agent (2026, arXiv 2605.09217) |
MachineLearning\2026 - Abdel Sadek et al - Learning the Preferences of a Learning Agent (arXiv 2605.09217).pdf |
3799AEB2 |
| AIMA 4e (§18.2.5) |
racine du gisement |
— |
See #17528
Part of #17528 — arc A (jeux d'assistance, série GameTheory)
Constat (mesure du 23/09 sur
main)GameTheory-15-CooperativeGames.ipynbest le seul notebook du dépôt, avec son jumeau C#, où le programme de recherche de Russell habite au lieu d'être cité. Sa section 4 (cellules 24 à 35) présente le Paperclip Game et l'Off-Switch Game, code une simulation (cellule 31) et en tire un seuil de confiance « autour de 50-60 % » (cellules 32 et 34). Elle attribue le cadre à AIMA 4e §18.2.5 et à Hadfield-Menell et al. (2016, 2017).Jusqu'au 23/09, ces deux papiers étaient cités sans être archivés. Ils le sont désormais (chemins ci-dessous).
Livrable, en deux PRs
1. Confrontation aux sources (MED)
Relire la section 4 contre le texte archivé de The Off-Switch Game. Le papier établit qu'un agent qui tient sa fonction de récompense pour acquise est incité à désactiver l'interrupteur, sauf si l'humain est parfaitement rationnel, et que la préservation de l'interrupteur exige l'incertitude du robot sur l'utilité humaine.
2. Un résultat de 2026 exécuté (DEEP)
Une section ou un notebook qui exécute un résultat récent au lieu de le citer. Le choix revient à la lane, qui le motive dans le body :
Un nouveau notebook suit la règle de numérotation par accrétion : un numéro se justifie par un argument pédagogique écrit.
Périmètre et contraintes
GameTheory-15-CooperativeGames-Csharp.ipynb. Il est touché par fix(density,#13410): GT06c + GT15-Csharp — 9 lectures paraphrasees retirees, apport net 1 miette ancree #16694, PR de la campagne densite pedagogique : 430 notebooks sous le plancher 1200 — surface majoritairement non suivie #13410, gelée. Le jumeau suivra quand le sort de fix(density,#13410): GT06c + GT15-Csharp — 9 lectures paraphrasees retirees, apport net 1 miette ancree #16694 sera tranché ; le body le signale.Sources (gisement
G:\Mon Drive\MyIA\IA\Bibliographie IA)GameTheory\2016 - Hadfield-Menell et al - Cooperative Inverse Reinforcement Learning (arXiv 1606.03137).pdfA06213BEGameTheory\2016 - Hadfield-Menell et al - The Off-Switch Game (arXiv 1611.08219).pdf2E813111GameTheory\2026 - Ananthakrishnan et al - Provably Optimal Learning Algorithms for Assistance Games (arXiv 2607.08012).pdfEFD6BC8DMachineLearning\2026 - Abdel Sadek et al - Learning the Preferences of a Learning Agent (arXiv 2605.09217).pdf3799AEB2See #17528