From c6fc5f0eb2c1d8e5516df0f314f7ec84a521dd6d Mon Sep 17 00:00:00 2001 From: jsboige self-bot Date: Tue, 15 Sep 2026 12:48:34 +0200 Subject: [PATCH] =?UTF-8?q?feat(slides,#15023):=20deck=2008=20=E2=80=94=20?= =?UTF-8?q?l'arc=20test-time=20scaling=20enseigne=20(3=20slides,=20referen?= =?UTF-8?q?ces=2012/16/17)?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit Grain: DEEP/slides — lane myia-po-2026:CoursIA-2 — prev: MED/slides #16244 Le deck 08 citait 1 notebook de l'arc 12..18 (le 17) et laissait de cote les deux qui MESURENT le scaling test-time (12, 16). Trois slides les enseignent : - « Test-time scaling : quatre moteurs » (Best-of-N / Reflexion / ToT / routeur), chacun avec sa cible d'erreur et son cout ; - « La structure d'erreur decide du moteur » — un vote corrige l'aléatoire, pas le systematique ; sur les trois problemes du banc, le BoN n'ameliore AUCUN score ; - « La frontiere compute-optimale (Snell 2024) » — regime-dependance, ce que le notebook mesure, plafond des buckets faciles, et limites revendiquees (G.2) : petit n/K, petit modele, echantillonnage NON SEEDE. Les valeurs exactes des notebooks ne sont donc pas figees en prose : ce qui est enseigne est la METHODOLOGIE, pas un tirage. Le paragraphe de references existant est enrichi (12, 15, 16, 17) plutot que duplique. Verifie : 89 -> 92 slides ; check_link_label_agreement.py 0/2133 ; check_docs_links.py OK (0 pre-existant, 7182 total) ; check_slidev_structure.py --all 18 decks / 0 constat ; npx slidev build OK (13.58 s) ; rendu ?clicks=99 verifie sur les slides 44, 45 et 46. Co-Authored-By: Claude Sonnet 5 --- slides/08-ia-generative/slides.md | 47 ++++++++++++++++++++++++++++++- 1 file changed, 46 insertions(+), 1 deletion(-) diff --git a/slides/08-ia-generative/slides.md b/slides/08-ia-generative/slides.md index d167c4dd60..a8915dbd92 100644 --- a/slides/08-ia-generative/slides.md +++ b/slides/08-ia-generative/slides.md @@ -733,7 +733,52 @@ flowchart LR -

Références : 15_Tree_of_Thoughts_Search.ipynb, 17_Native_Reasoning_vs_Scaling.ipynb.

+

Références : 12_Test_Time_Scaling.ipynb, 15_Tree_of_Thoughts_Search.ipynb, 16_Scaling_Test_Time_Compute.ipynb, 17_Native_Reasoning_vs_Scaling.ipynb.

+ +--- + +# Test-time scaling : quatre moteurs + + + +- **Best-of-N** — *N* tirages indépendants, on retient celui que le vérificateur valide. Budget : *N* appels **parallèles**. Vise l'erreur **aléatoire** : les tirages fautifs ne se répètent pas identiquement, le vote les annule. +- **Réflexion** — générateur → critique → mémoire : on remontre au modèle *quel* test échoue et *pourquoi*, pour qu'il en corrige la cause. Budget : 2 à 3× les appels. Vise l'erreur **systématique**, qu'un vote ne peut pas corriger. +- **Tree-of-Thoughts** — recherche sur des états partiels, avec évaluation et élagage. Budget variable. Pour les problèmes **combinatoires** où un état intermédiaire peut être noté. +- **Routeur adaptatif** — estime la difficulté, escalade vers le moteur adapté, et sait **s'arrêter**. Pour les cas où la structure d'erreur n'est pas connue à l'avance. + + + +

Référence : 12_Test_Time_Scaling.ipynb.

+ +--- + +# La structure d'erreur décide du moteur + + + +- **Un vote corrige l'aléatoire, pas le systématique.** Si le modèle se trompe *toujours de la même façon*, échantillonner davantage reproduit la même erreur : il n'y a rien à moyenner. +- **Ce que le banc d'essai du notebook montre** — sur ses trois problèmes, le Best-of-N n'améliore **aucun** score : deux sont déjà résolus du premier coup, et sur le troisième l'échec est systématique. Le coût, lui, croît avec *N*. +- **La Réflexion seule ne suffit pas non plus** — même en nommant au modèle le test qui échoue, il peut persister dans la même stratégie. Le gain dépend de la **capacité du modèle à exploiter le signal**, pas du seul calcul dépensé. +- **Conséquence pratique** — la structure d'erreur se **mesure** sur votre tâche et votre modèle avant de choisir un moteur. Le cadre théorique oriente ; il ne dispense pas de la mesure. + + + +

Référence : 12_Test_Time_Scaling.ipynb.

+ +--- + +# La frontière compute-optimale (Snell 2024) + + + +- **L'idée** — le calcul d'inférence se met à l'échelle comme le calcul d'entraînement, mais la stratégie **optimale dépend du régime** : échantillonner large en parallèle sur les problèmes faciles, chercher séquentiellement avec retour du vérificateur sur les difficiles. +- **Ce que le notebook mesure** — une suite graduée à réponse vérifiable, l'estimateur *pass@k* non biaisé par bucket, puis, **à budget égal**, Best-of-N parallèle contre Réflexion séquentielle. +- **Plafond des buckets faciles** — quand *pass@1* est déjà haut, le scaling parallèle n'ajoute presque rien : le signal vit sur le bucket **difficile**. +- **Limites revendiquées (G.2)** — petit *n*, petit *k*, petit modèle, et **échantillonnage non seedé** : les valeurs exactes bougent d'un run à l'autre. Ce qui est démontré et transférable est la **méthodologie**, pas un chiffre. + + + +

Références : 16_Scaling_Test_Time_Compute.ipynb, 17_Native_Reasoning_vs_Scaling.ipynb.

---