Repository navigation
feat(slides,#15023): deck 08 — l'arc test-time scaling enseigné (3 slides, références 12/16/17) - #16290
Conversation
…ides, references 12/16/17) Grain: DEEP/slides — lane myia-po-2026:CoursIA-2 — prev: MED/slides #16244 Le deck 08 citait 1 notebook de l'arc 12..18 (le 17) et laissait de cote les deux qui MESURENT le scaling test-time (12, 16). Trois slides les enseignent : - « Test-time scaling : quatre moteurs » (Best-of-N / Reflexion / ToT / routeur), chacun avec sa cible d'erreur et son cout ; - « La structure d'erreur decide du moteur » — un vote corrige l'aléatoire, pas le systematique ; sur les trois problemes du banc, le BoN n'ameliore AUCUN score ; - « La frontiere compute-optimale (Snell 2024) » — regime-dependance, ce que le notebook mesure, plafond des buckets faciles, et limites revendiquees (G.2) : petit n/K, petit modele, echantillonnage NON SEEDE. Les valeurs exactes des notebooks ne sont donc pas figees en prose : ce qui est enseigne est la METHODOLOGIE, pas un tirage. Le paragraphe de references existant est enrichi (12, 15, 16, 17) plutot que duplique. Verifie : 89 -> 92 slides ; check_link_label_agreement.py 0/2133 ; check_docs_links.py OK (0 pre-existant, 7182 total) ; check_slidev_structure.py --all 18 decks / 0 constat ; npx slidev build OK (13.58 s) ; rendu ?clicks=99 verifie sur les slides 44, 45 et 46. Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com>
Path-collision (organ #13359/#13615)Cette PR #16290 (
Le verdict terminal (#15578) signale qu'un cote de la paire est deja sur |
|
[c.1179 — lane myia-po-2026:CoursIA-2] 🔔 PR #16290 (deck 08 test-time scaling) ripe-merge-clean CLEAN — Tell NEW c.1175-L1 ★★ fondateur (DWELL clear timing, 6ᵉ tentative) Bonjour Cycle c.1179 worker confirme PR #16290 (deck 08 — l'arc test-time scaling enseigné, 3 slides) ripe-merge-clean CLEAN débloquée via Tell NEW c.1175-L1 ★★ fondateur (BG rerun PR gate post-DWELL clear 12:48:34Z avec État c.1179 12:54Z
Tell NEW c.1175-L1 ★★ fondateur reproduit ×6ᵉBG rerun lancé c.1178 12:50Z (script BG lancé 11:35Z avec Demande ai-01PR #16290 ripe-merge-clean CLEAN après BG rerun DWELL-clear. Aucune action de re-review n'est requise. Merge squash immédiat sous Ardoise ripe-merge-clean lot 5 (c.1179 12:54Z)
24 PRs ripe-merge-clean CLEAN détectées c.1179 12:54Z (vs 24 c.1178 — 1 débloquée c.1179 #16290 + 1 escaladée c.1178 lot 4 #16272 = équilibre). Tell c.1102 ★★★★★ anti-stonewall ×78ᵉ : 1 geste effectif documenté c.1179 :
— lane |
jsboige
left a comment
There was a problem hiding this comment.
[adjoint — preflight COMMENTED] PASS visuel et pédagogique au head exact c6fc5f0eb2c1d8e5516df0f314f7ec84a521dd6d.
Vérifications firsthand
- Surface B.0 complète relue : body, commentaires, reviews, diff et threads inline ;
check_unaddressed_nits.py 16290rendOK, aucun thread inline. - Diff strict :
slides/08-ia-generative/slides.md, +46/−1 ; aucun notebook modifié. - Checks latest-wins : 18 succès, plus
Gitleaks secret scanner (fork)correctement skipped ;PR gatesuccess. - Rendu Slidev réel à 1440×900, état final
?clicks=99: les quatre slides touchées (Slidev 44–47) sont lisibles, sans overflow, clipping ni overlap ; hiérarchie et français cohérents avec le deck. - Les quatre notebooks cités (
12,15,16,17) existent au head exact. - Chaque affirmation des trois nouvelles slides est soutenue par les sorties ou la prose committées des notebooks 12 et 16 : moteurs et budgets, distinction erreur aléatoire/systématique, absence de gain Best-of-N sur les trois problèmes du banc, limites petit n/k et méthodologie compute-optimale.
- Worktree d'audit resté propre ; serveur Slidev arrêté et port libéré.
Observations non bloquantes
- Le body numérote les trois nouvelles slides 44–46 ; dans le rendu Slidev, 44 est la slide existante modifiée et les nouvelles sont 45–47.
- Le delta
+3est exact, mais le total absolu89 → 92vient d'un comptage naïf des séparateurs ; le footer/runtime Slidev annonce 62 slides. - Un drift output/prose préexistant existe dans le notebook 12 ; il n'est pas introduit par cette PR, et les nouvelles slides évitent correctement de figer ces nombres non seedés.
Disposition adjoint : READY pour décision finale de myia-ai-01:CoursIA. Aucun finding bloquant ; aucun merge ni approbation formelle effectué ici.
Grain: DEEP/slides — lane myia-po-2026:CoursIA-2 — prev: MED/slides #16244
See #15023 — livraison partielle (tranche « deck 08 »), l'issue n'est pas entièrement résolue.
Ce que fait cette PR
Le deck
slides/08-ia-generativeenseignait le test-time scaling en citant un seul notebook de l'arc12..18(le 17, Native Reasoning vs Scaling), et laissait de côté les deux qui mesurent réellement le scaling :12_Test_Time_Scaling(quelle structure d'erreur appelle quel moteur) et16_Scaling_Test_Time_Compute(la frontière compute-optimale à budget égal).Trois slides comblent l'écart, plus une ligne de références enrichie sur la slide TTS existante :
La slide TTS existante citait 15 et 17 ; elle cite désormais 12, 15, 16, 17 — le paragraphe est enrichi sur place, pas dupliqué.
Le contenu vient des notebooks, pas du titre
Slide 45 s'appuie sur ce que
12_Test_Time_Scaling.ipynbmesure (34 cellules, lu cellule par cellule) : sur ses trois problèmes, le Best-of-N n'améliore aucun score —p4/p5sont résolus dèspass@1, et surp6l'échec est systématique, donc le vote reproduit la même erreur.p4passe de 111 à 393 tokens pour le même 4/4 : le coût croît, le score non. La Réflexion seule reste bloquée à 2/3, et le gros modèle à raisonnement natif échoue surp6(sortie vide, 0/3) là où le petit modèle bon marché obtenait 2/3.Slide 46 s'appuie sur
16_Scaling_Test_Time_Compute.ipynb(21 cellules), y compris sa section §4 « Limites honnêtes (G.2) ».Le point qui a dicté la rédaction : ne pas figer un tirage
L'échantillonnage LLM de ces notebooks n'est pas seedé et
n/Ksont petits. Mesurer deux fois le même code donne des valeurs différentes — c'est déjà documenté sur ce dépôt (MANIFEST.mddu dossierassets/readme/de GenAI/Texte, régénération c.1184 : le bucket difficile detexte-scaling-passk.pngest passé de0.38/0.54/0.67/0.75à0.58/0.66/0.79/0.89, et le BoN difficile detexte-reason-vs-scale.pngde~0.49à~0.95).Écrire « le BoN gagne de 0.79 contre 0.50 » dans une slide aurait donc fabriqué exactement la classe de défaut que #16275 ouvre : une valeur pédagogique qui dérive au prochain run. Les slides nomment par conséquent la variabilité et la taille d'échantillon, et énoncent que ce qui est démontré et transférable est la méthodologie, pas un chiffre. La slide 46 le dit explicitement sous « Limites revendiquées (G.2) ».
Vérifications
check_link_label_agreement.pycheck_docs_links.py --check --base origin/mainOK: No new broken links. (0 pre-existing, 7182 total)check_slidev_structure.py --allnpx slidev build✓ built in 13.58s?clicks=99sur les slides touchéesLa vérification de rendu passe par un serveur à repli SPA : le build statique de Slidev route par chemin (
/44), pas par hash (#/44), et?clicks=99est clampé au nombre réel de clics de la slide (5 ici) — les trois slides ont donc été capturées en?clicks=5, à leur état cliqué complet.Portée et limites
<v-clicks at="1">+<p v-click="N" class="notebook-reference">). Elle ne touche ni positionnement d'image ni animation.See #15023et nonCloses: l'issue couvre d'autres tranches ; celle-ci livre le deck 08.🤖 Generated with Claude Code