Repository navigation
Add: 6 markdown lectures chiffrees RL-15 GRPO (densite 1027 -> 1400, #13410) - #16488
Conversation
…13410) Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com>
Golden-Set Execution (H.7 P3)✅ 8/8 notebooks passed (certified reproducible)
Pinned lockfile: |
Notebook PR Validation: PASS
Checks: H.1 (no errors), H.3 (execution_count), C.1 (no banned patterns) |
|
Scope = notebooks CHANGED in this PR, not the whole corpus. Explicit |
Notebook outputs-required (H.4 schema): PASS (every code cell carries an
|
|
[ADJOINT PREFLIGHT] |
|
[ADJOINT PREFLIGHT] |
myia-ai-01
left a comment
There was a problem hiding this comment.
[ai-01 exact-head] APPROVED
Head bb1d8521bf8835cb84fdde69a0ffe23b473bb538 lu intégralement : body, 6 commentaires, 0 review antérieure, 0 thread et diff complet. B.0 rc=0 ; checks latest-wins settles verts. Le diff est strictement markdown-only (+6 cellules), chaque lecture suit l'output concerné, les chiffres sont verbatim ou re-dérivés exactement, et les deux divergences historiques sont signalées honnêtement sans altérer outputs ni code. Scope, C.5 et D.4bis conformes.
|
[ADJOINT PREFLIGHT] |
Grain: DEEP/notebook-python -- lane myia-po-2026:CoursIA -- prev: DEEP/notebook-python #16486
Livrable
Tranche densité #13410 : RL/rl_15_grpo_group_relative_policy (1027 → 1400), plancher 1200. Markdown-only : +48 lignes — 6 cellules md (lectures chiffrées des sorties), chacune avec id nbformat 4.5 (sha1 8 hex, 6 nouveaux ids uniques, vérifiés) ; 0 cellule code touchée, 0 output édité, 0 md supprimée. Branche dédiée
feature/13410-density-rl15depuis origin/main (fe8a398), créée avant l'édition. Famille RL, 2e grain RL de la lane (règle 6).Les 6 cellules
Device: cudalue comme un témoin (ce run a tourné GPU), pas une exigence : le md de setup garantit la reproductibilité CPU-only ;[nvidia-smi]citée verbatim (NVIDIA GeForce RTX 3070 Laptop GPU, 8192 MiB, 749 MiB, 7270 MiB, 610.88),params=9155,peak allocated: 17.68 MiB/peak reserved: 22.00 MiB/final allocated: 16.41 MiB, marge > 300x sous la borne 6144 MiB ;obs_dim=4, n_actions=2lu contre l'architecture4-64-64-2décrite en amont (§1.1) : 4 entrées, 2 logits, deux couches cachées de 64 ;48.66(seed=1) à329.27(seed=0) et282.27(seed=123) ; le fait tranchant : meilleur GRPO (227.43, seed=42) sous le pire PPO (236.93, seed=1) — les deux distributions ne se chevauchent pas ;-190.86, Wilcoxonstat=0.0, p-value=0.0312= le minimum n=6 exact que le REPAIR c.644 rendait atteignable,IC95% [-265.41, -117.11]exclut 0 ;VERDICT : PPO BEATS GRPO: conjonction complète (edge au-delà de 2σ, p < 0.05, IC excluant 0).Défauts préexistants signalés (non corrigés, hors scope md-only)
Mes lectures citent les sorties committées verbatim ; deux divergences prose-vs-sortie du contenu existant sont signalées dans les cellules 2 et 6 et laissées à l'owner :
17.44 MiBalors que la sortie committée affiche17.68 MiB(JSON interne :vram_peak_mib: 17.6845703125) ;Validation
pedagogy_density.py→ RC=0, plancher 1200 respecté (1400).detect_markdown_rendering.py --check→ OK (rc=0).Preflight
Par noms (
rl_15,grpo, scoped au repo) : aucune PR open. Par chemins : sweep des chemins des PRs open #13410 → seul RL/ touché est rl_7 (PR #16486, cette lane) ; rl_15 intact partout. Vérifié au choix du grain ET au commit. Branche créée avant l'édition.See #13410
🤖 Generated with Claude Code