Part of #16741 — arc B — ouverte, responsable, prouvable, explicable
Livrable
Rejouer Backdoor Code (prompts H.4 verbatim) : Houdini 3 étages (idées sans code → implémentation minimale → entrée déclencheuse) vs Guard majority-vote sur APPS/HumanEval ; mesurer taux de backdoors viables ET taux de détection ; la nuance Fig 12/13 (plus nombreux ≠ plus trompeurs). Module stats complet : Elo (fit L-BFGS-B + bootstrap), double-ReLU 3 phases + AIC, NSO imbriqué n*, demi-vie de contrôle. + Wargames 3 rôles en simulation guidée ; anecdote « Dr. Anya Sharma » (persona de site de roleplay ressortie dans 12 % des transcripts = mémorisation).
Contenu à distiller
- Backdoor Code rejoué : Houdini (attaquant 3 étages) vs Guard (majority-vote), prompts H.4 verbatim.
- Les DEUX taux mesurés : backdoors viables, détection — et la nuance « plus nombreux ≠ plus trompeurs » (Fig 12/13).
- Module stats : Elo L-BFGS-B + bootstrap, double-ReLU 3 phases + AIC, NSO imbriqué n*, demi-vie de contrôle.
- Wargames 3 rôles en simulation guidée.
- L'anecdote Dr. Anya Sharma comme cellule mémorisation.
Sources
- R12 — Scaling Laws For Scalable Oversight (arXiv:2504.18530)
PDF : G:\Mon Drive\MyIA\IA\Bibliographie IA\XAI\2025 - Engels et al - Scaling Laws For Scalable Oversight.pdf (sha8 FDA29C9A)
Localisation papier : R12 §2-4 + App D/G/H — [DISTILL R12-1..5]
Cible (vérifiée contre le dépôt)
GenAI/sécurité (nouveau). Notre quotidien : nos bots reviewers SONT des Guards — le parallèle explicite fait partie du livrable.
Priorité et contraintes
P2 — Mêmes sources APPS/HumanEval que T10 : les issues se citent.
Part of #16741 — arc B — ouverte, responsable, prouvable, explicable
Livrable
Rejouer Backdoor Code (prompts H.4 verbatim) : Houdini 3 étages (idées sans code → implémentation minimale → entrée déclencheuse) vs Guard majority-vote sur APPS/HumanEval ; mesurer taux de backdoors viables ET taux de détection ; la nuance Fig 12/13 (plus nombreux ≠ plus trompeurs). Module stats complet : Elo (fit L-BFGS-B + bootstrap), double-ReLU 3 phases + AIC, NSO imbriqué n*, demi-vie de contrôle. + Wargames 3 rôles en simulation guidée ; anecdote « Dr. Anya Sharma » (persona de site de roleplay ressortie dans 12 % des transcripts = mémorisation).
Contenu à distiller
Sources
PDF :
G:\Mon Drive\MyIA\IA\Bibliographie IA\XAI\2025 - Engels et al - Scaling Laws For Scalable Oversight.pdf(sha8FDA29C9A)Localisation papier : R12 §2-4 + App D/G/H — [DISTILL R12-1..5]
Cible (vérifiée contre le dépôt)
GenAI/sécurité (nouveau). Notre quotidien : nos bots reviewers SONT des Guards — le parallèle explicite fait partie du livrable.
Priorité et contraintes
P2 — Mêmes sources APPS/HumanEval que T10 : les issues se citent.