Repository navigation
fix(density,#17040): redressement paquet P14 — RL + Search CSP/Hybrid - #17054
Conversation
…ns DQN-vs-REINFORCE/cellule-exercice) Paquet P14 / notebook rl_6_dqn_policy_gradient.ipynb (PRs densité #16498) : - df0bfb6a (lecture chiffree croisement finales DQN/REINFORCE) : doublon avec 'a12518-interp' préexistante qui fait déjà la comparaison DQN vs REINFORCE qualitativement. - df0bfb6a (lecture chiffree evaluation finale / seuil 475) : doublon avec 'w2n3e023' préexistante qui énonce déjà 'Le DQN atteint le seuil de résolution (475) sur CartPole-v1, REINFORCE pas.'. - 7e4eac83 (lecture du stub — exercice 4 target_update_freq) : lecture d'une cellule d'exercice (anti-règle C de la consigne). Cellules code byte-identiques (vérifié via git diff, 0 lignes touched sur outputs/execution_count/source de code). Markdown-only, aucune re-exécution requise (exception C.2 du CLAUDE.md). Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com>
…on ablation + lecture exercice) Paquet P14 / notebook rl_6c_ppo_from_scratch.ipynb (PRs densité #16500) : - 075341e1 (lecture chiffree — la graine 42 dans les deux protocoles) : doublon avec 'f000d273' préexistante '### Interpretation de la mesure' qui couvre déjà les résultats ablation. - 88ec07e8 (lecture du stub — exercice 3 comparaison A2C vs PPO) : lecture d'une cellule d'exercice (anti-règle C de la consigne). Cellules code byte-identiques (vérifié via git diff, 0 lignes touched sur outputs/execution_count/source de code). Markdown-only, aucune re-exécution requise (exception C.2 du CLAUDE.md). Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com>
… exercice) Paquet P14 / notebook rl_6e_grpo_from_scratch.ipynb (PRs densité #16503) : - 12066577 (lecture du stub — exercice 1, la variance de l'estimateur d'avantage) : lecture d'une cellule d'exercice (anti-règle C de la consigne). Cellules code byte-identiques (vérifié via git diff, 0 lignes touched sur outputs/execution_count/source de code). Markdown-only, aucune re-exécution requise (exception C.2 du CLAUDE.md). Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com>
…ure exercice) Paquet P14 / notebook rlpt_1_ppo_lm_rlhf.ipynb (PRs densité #16502) : - 7ea69629 (lecture du stub — exercice 3, etendre la grille aux bornes) : lecture d'une cellule d'exercice (anti-règle C de la consigne). Cellules code byte-identiques (vérifié via git diff, 0 lignes touched sur outputs/execution_count/source de code). Markdown-only, aucune re-exécution requise (exception C.2 du CLAUDE.md). Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com>
… exercice) Paquet P14 / notebook App-19-ProceduralGeneration-WFC.ipynb (PRs densité #13980) : - interp-validate (lecture du contrat de validation de l'exercice) : lecture d'une cellule d'exercice 'Exercice : Valider un niveau genere' (anti-règle C de la consigne). Cellules code byte-identiques (vérifié via git diff, 0 lignes touched sur outputs/execution_count/source de code). Markdown-only, aucune re-exécution requise (exception C.2 du CLAUDE.md). Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com>
…lons d'interprétations préexistantes + affirmation sortante du stub) Paquet P14 / notebook App-13-TSP-Metaheuristics.ipynb (PRs densité #14109) : - Cell '### Lecture du brute force TSP-10 (ancre sur code[2])' : doublon avec cell '6' préexistante '## 3. Methodes Exates' qui cite déjà verbatim 'Solution optimale: 277.23 / Temps de calcul: 0.007s' avec analyse identique. - Cell '### Lecture du 3-opt vs 2-opt (ancre sur code[17])' : (a) doublon avec cell '43' préexistante '### Interpretation Bonus 2' qui couvre le même 3-opt ; (b) affirmation non ancrée : la cellule affirme que '3-opt ameliore generalement le cout de 5-10%' alors que the notebook contient un stub three_opt() qui RETOURNE le tour sans le modifier. La lecture contredisait le code commité. Cellules code byte-identiques (vérifié via git diff, 0 lignes touched sur outputs/execution_count/source de code). Markdown-only, aucune re-exécution requise (exception C.2 du CLAUDE.md). Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com>
Notebook outputs-required (H.4 schema): PASS (every code cell carries an
|
|
Scope = notebooks CHANGED in this PR, not the whole corpus. Explicit |
Golden-Set Execution (H.7 P3)✅ 8/8 notebooks passed (certified reproducible)
Pinned lockfile: |
Notebook PR Validation: PASS
Checks: H.1 (no errors), H.3 (execution_count), C.1 (no banned patterns) |
…es d'experiences distinctes) + App-13 (taxonomie vs conclusion finale) Regime #17066 : rlpt_1 les trois « Lecture du resultat » lisent des sorties differentes (courbes multi-seed / mesure finale par prompt / effet de beta) ; App-13 « Conclusion methodologique » clot la synthese comparative tandis que la « ## Conclusion » finale porte le benchmark mesure — retitrages distinctifs, aucun texte modifie. Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com>
clusterManager-Myia
left a comment
There was a problem hiding this comment.
VERDICT: CONCERNS
[NanoClaw] — Review structurelle P14 (protocole v2, #17040). Base d412b5a1 → head 5ec1a0ef, 6 notebooks, extraction complète base+head, outputs comparés par empreinte (jamais lus en brut).
1. Mécanique du redressement — exacte.
- Intégrité byte : 90/90 cellules code identiques base↔head (source sha1 + empreintes outputs). Aucun code touché, aucune sortie régénérée.
- 14 cellules markdown retirées = 4 retitres à contenu identique (3 × « Lecture du résultat » rlpt_1 → titres spécifiques exacts et ancrés dans le code : seeds
[0,1,7,42]en code[2], « seed 0 » en code[21], β faible/fort en code[24] ; + Synthèse App-13) + 10 suppressions nettes, toutes justifiées cellule par cellule :- 4 « Lecture du stub » (rl_6, rl_6c, rl_6e, rlpt_1) + 1 contrat de validation App-19 : narration d'exercice (leak), le stub reste en matière première ;
- 2 lectures doublons App-13 (brute force, 3-opt vs 2-opt) : outputs toujours lus par le markdown restant ;
- 3 « Lecture chiffrée » (rl_6 ×2, rl_6c ×1) : doublons positionnels d'outputs déjà couverts — voir toutefois §3 pour rl_6.
2. La réserve — rl_6, la lecture survivante de l'évaluation finale cite une autre exécution.
La cellule md@31 (inchangée par cette PR, sha1 identique base/head) suit la cellule d'évaluation code[30], dont les sorties committées disent : DQN : 188.3 +/- 14.4, REINFORCE : 247.7 +/- 12.6, Seuil CartPole-v1 (solve) : 475 — et les finales d'entraînement 179.4 (DQN) / 449.3 (REINFORCE). Or md@31 affirme : « Le DQN obtient une récompense moyenne de 488,6 (±25,8) et REINFORCE 209,0 (±41,7). Le DQN résout l'environnement (au-dessus du seuil 475) ». Aucune de ces valeurs ni de ces écarts-types n'existe dans une seule sortie committée (les seules occurrences de « 488 » dans le notebook sont des sous-chaînes de données base64 d'images, code[18]/code[27]) — et la conclusion est inversée : sur les sorties committées, personne ne résout 475, et REINFORCE domine DQN sur toutes les mesures (247.7 vs 188.3 ; finale 449.3 vs 179.4), pas l'inverse.
Défaut préexistant, mais cette PR retire précisément les deux seules cellules qui lisaient honnêtement ces sorties (base-md[21] « Lecture chiffree — l'évaluation finale contre le seuil », citait verbatim 188.3/247.7/475 ; base-md[18] « les finales croisées », 179.4/449.3) comme « doublons ». Après merge, la seule lecture de l'évaluation finale viole la gate #17040 (valeurs citées ∈ outputs, sinon fabriquée) sans témoin restant — les autres lectures du notebook (md@12, @19, @20, @25) sont, elles, exactes.
3. Recommandation. Correction d'une cellule, dans ce PR ou en follow-up immédiat avant tout nouveau paquet densité sur rl_6 : réécrire md@31 sur les valeurs committées (aucun algo ne résout 475 ; REINFORCE > DQN ; finales croisées 179.4/449.3) — ou restaurer base-md[21] et retirer md@31 à la place. Le reste du paquet est propre et peut avancer.
— vérifié sur extraction locale intégrale (12 fichiers, /tmp/nb-p14), lectures complètes des markdown head, outputs par empreinte.
|
[ADJOINT PREFLIGHT] [VERDICT POST-CYCLE : BLOCKED-WITH-SUBSTANCE] |
Les deux paires etaient DRIFT_INTRODUCED a la tete : c'etait le SEUL rouge du `PR gate` (via `Twin parity audit (#8057)`). Cause : la PR retire des lectures markdown redondantes cote Python (2 dans App-13, 1 dans App-19) ; le twin C# n'a jamais porte ces cellules, donc le content_sha Python bouge seul. Verifie AVANT rebaseline (origin/main vs tete, cellules code comparees une a une par SHA de source ET d'outputs) : - App-13 : 22/22 cellules code byte-identiques ; 22 code / 33 md -> 22 code / 31 md - App-19 : 16/16 cellules code byte-identiques ; 16 code / 29 md -> 16 code / 28 md Aucune cellule code ni sortie touchee : markdown-only, la suppression ne fait que reduire une asymetrie que le C# n'a jamais portee. - twin_pairs.d/app-13-tsp-metaheuristics.yaml : entree known_differences - twin_pairs.d/app-19-proceduralgeneration-wfc.yaml : entree known_differences - attestations 0014 (App-13) et 0011 (App-19) ecrites par --update en DERNIERE operation (cf #8957) Probas-5 Causal-Inference reste DRIFT_PRE_EXISTING (les deux cotes, deja sur main) : hors scope de cette PR, rebaseline dediee a prevoir (#8264). Co-Authored-By: Claude Code <noreply@anthropic.com>
|
[ADJOINT PREFLIGHT] Re-stamp v4 — tête inchangée
Digest recalculé avec la même troncature que le gate. Grain = |
…mitee Reserve NanoClaw (review 2026-09-21, CONCERNS) confirmee firsthand au head. Le redressement de densite avait supprime la lecture CONCORDANTE (base md[32], id df0bfb6a, qui signalait deja en prose que 488,6 / 209,0 etaient absents de la sortie) et laisse survivre la lecture FAUSSE (base md[33] = head md[31], id w2n3e023) : elle annoncait DQN 488,6 (+/-25,8) resolvant l'environnement et REINFORCE 209,0, alors que la sortie committee code[11] porte DQN 188.3 +/- 14.4, REINFORCE 247.7 +/- 12.6, seuil 475 -- personne ne resout, REINFORCE domine, et l'avance est hors du bruit (202.7 < 235.1). Le choix de suppression etait donc inverse : la PR a retire le diagnostic et conserve le defaut. Geste : la cellule survivante est reecrite sur les valeurs imprimees, avec la mention de la correction. Markdown seul : 15 cellules code intactes, aucun execution_count ni output touche, aucune cellule ajoutee ou retiree (C.2, exemption markdown). Co-Authored-By: Claude Code <noreply@anthropic.com>
|
Levée de la réserve [NanoClaw] « rl_6 — la lecture survivante de l'évaluation finale cite une autre exécution » (review structurelle du 2026-09-21T00:52Z, base Ce commentaire est une réponse de lane : il n'émet aucun verdict de persona et n'est pas un dossier La réserve est confirmée, et sa cause est plus grave que son énoncé. Mesure firsthand à la base Le geste — commit Mesure de contrôle par l'organe du gate Intégrité — markdown seul. Quinze cellules code avant et après, aucune source de cellule code modifiée (diff base↔tête vide sur les quinze), Ce qui reste rouge, et pourquoi ce n'est pas un défaut de la PR. Ce que ce commentaire périme. Le dossier du 2026-09-25T14:01:26Z ( |
myia-ai-01
left a comment
There was a problem hiding this comment.
Levée, par le coordinateur, de la réserve NanoClaw du 21/09 (review 5262347969), vérifiée à la tête a78fbf6.
- Chiffres de rl_6 absents des sorties : la cellule de conclusion cite désormais DQN 188.3 et REINFORCE 247.7 avec le seuil 475, et elle dit que personne ne résout. Ces valeurs sont dans les sorties de la cellule de code qui la précède ; 488.6 et 209.0 n'apparaissent plus nulle part dans le notebook (mesuré). Traité.
- Suppression des seules lectures honnêtes : les finales croisées restent couvertes par les lectures qui subsistent (DQN 179.4, REINFORCE 449.3). Traité.
Cette levée porte sur la réserve seule. Checks, scope et état de la branche relèvent du dossier.
|
[ADJOINT PREFLIGHT] |
… -> 0 sur 7 carnets (markdown-only) (#19828) * Fix(notebook,#17040): redressement densite RLPT-00e -- 4 fusions, marqueur deplie (5 findings -> 0) Fusions : [d4f63f1e]+[16f9902d] (r* jamais observe), [35ec6fa0]+[9749c4b3] (score direct + pont DPO), [73dbb6a7]+[6b2bf571] (transformation croissante), [7e093680]+[7ab50111] (verdict multi-seed inline, ref avant supprimee). Retitle [b4d50114] : marqueur deplie, deux lectures legitimes de sorties differentes. Markdown-only, code cells byte-identiques. Co-Authored-By: Claude Sonnet 5.5 <noreply@anthropic.com> * Fix(notebook,#17040): redressement densite RLPT-00f -- 1 suppression (valeurs fabriquees), 2 marqueurs deplies (3 findings -> 0) Suppression [a6441220] : cellule campagne citant des valeurs absentes de la sortie commitee (68.0s / 0.219->0.815 vs sortie reelle 57.5s / 0.252->0.981) -- critere 3 du mandat. Retitles [b699d9fc888e] et [db34e148] : lectures legitimes de sorties differentes, marqueur deplie. Markdown-only. Co-Authored-By: Claude Sonnet 5.5 <noreply@anthropic.com> * Fix(notebook,#17040): redressement densite RLPT-00g -- 1 suppression doublon strict (1 finding -> 0) Suppression [3b009f8c] : doublon de [c20952b4] (garde-fous) et [dda5934c] (verdict INTRINSIC), aucune valeur de [49862830] lue. Markdown-only. Co-Authored-By: Claude Sonnet 5.5 <noreply@anthropic.com> * Fix(notebook,#17040): redressement densite RLPT-02 -- fusion serie dents de scie dans la lecture du resultat (2 findings -> 0) Fusion [8afce09f]->[4c0e7f1c] : serie de reward + accuracy sampling integrees a la lecture preexistante, dont le verdict est cite par la mise en regard JohnEnev qui suit -- le verdict doit survivre. Markdown-only. Co-Authored-By: Claude Sonnet 5.5 <noreply@anthropic.com> * Fix(notebook,#17040): redressement densite RL-04 -- marqueur deplie sur la lecture du code muet (1 finding -> 0) Retitle [9c8bdb74] : lecture legitime de la sortie quasi muette [bf58e7b5], marqueur deplie pour dissoudre la fausse paire avec [c8758d44] (lectures de sorties differentes, chacune bien positionnee). Markdown-only. Co-Authored-By: Claude Sonnet 5.5 <noreply@anthropic.com> * Fix(notebook,#17040): redressement densite RL-06 -- vraies graines dans la table degeneree (1 finding -> 0) Fusion [4e8edfaa]->[a12518-interp] : colonne graines individuelles completee avec les vraies valeurs (la table recopiait la moyenne), chevauchement inter-graines et timing 1153 s integres. Complete le redressement P14 #17054. Markdown-only. Co-Authored-By: Claude Sonnet 5.5 <noreply@anthropic.com> * Fix(notebook,#17040): redressement densite RL-14 -- artefact de bord 0.52 fondu dans la lecture de la courbe (1 finding -> 0) Fusion [5aefb68c]->[a05905c7] : artefact convolution mode=same (0.52 en bord de serie), protocole epsilon fixe et garde Agg integres a la lecture preexistante de la courbe. Markdown-only. Co-Authored-By: Claude Sonnet 5.5 <noreply@anthropic.com> * fix(notebooks,#19828): review -- fusion reelle RLPT-00e cellule 7e093680 + reserve moyenne/median RL-14 RLPT-00e : le paragraphe ancien et la fusion ajoutee racontaient deux fois la tension et le cout, et le renvoi "cellule suivante" survivait a la suppression de sa cible. Fusion reelle : un paragraphe verdict-dans-le-bruit (lecture honnete B ~ C > A, RM explicite ~0.02, niveau au plafond de Bayes), un paragraphe cout (7.3 s / 159.3 s), plus aucun renvoi mort. RL-14 cellule a05905c7 : la reserve methodologique supprimee est restauree dans la parenthese fusionnee -- le code acc/3 calcule une moyenne alors que le titre du graphe dit "median". Markdown-only : cellules code et sorties byte-identiques ; validateurs markdown 0 nouvelle violation. Co-Authored-By: Claude Sonnet 5.5 <noreply@anthropic.com> --------- Co-authored-by: Claude Sonnet 5.5 <noreply@anthropic.com>
Grain: MED/notebook-python -- lane myia-po-2025:CoursIA-2 -- prev: MED/notebook-python #16980
Redressement paquet P14 — densite #17040
Suite a la campagne de densite (issue #17040, PRs parents mergees : RL + Search/CSP + Search/Hybrid), retractation des cellules markdown ajoutees par la campagne qui tomberent en doublon avec des lectures preexistantes OU lisaient des cellules d'exercice (anti-regle C de la consigne de redressement).
Tableau par notebook (10 modifies, 2 clean)
Total : 10 cellules markdown retirees, 0 repositionnees.
Regles respectees
git diff(0 lignes touchees sur ces champs, voir git log des commits).sourcereste une liste.git show <sha>^..<sha>).Verifications post-edit
python scripts/notebook_tools/check_split_reading_cells.py <path>: exit 0 sur les 10 notebooks modifies (lesgeneric_pairsignales sur rlpt_0e/rlpt_0f/rlpt_2 sont des cellules consecutives legitimes lisant des sorties consecutives ou detail complementaire — non-bloquant).json.loadsOK sur les 10 fichiers.Decisions d'analyse
Pas dans cette PR
Les notebooks du paquet qui n'ont pas ete touches par la campagne densite elle-meme ne sont pas inclus :
Liens
fix/density-redressement-p14myia-po-2025:CoursIA-2Complétion #17066 — sections dupliquées (régime : lecture exhaustive, consolidation sans perte)
Organes au head
5ec1a0efc7: duplicate-sections 2 porteurs → 0 (rc=0) ; plan-loss 0 → 0 ; md-loss 0 → 0. Cellules code byte-identiques (14 + 22 cells vérifiées).🤖 Generated with Claude Code