Enfant de #1454 (volet « RL / Post-training SOTA ») — créé sur mandat coordinateur (DM 2026-08-23T21:09Z). Grain unitaire ancré sur un gap mesuré, pas une umbrella.
Groundage (2026-08-23, firsthand)
La série GenAI/PostTraining/ (14 notebooks) couvre GRPO/RLVR sur Qwen3.5-0.8B QLoRA : PT-11a (Z3 CSP), PT-11b (SymPy + N-queens), PT-11b multi-seed (4 seeds × 100 steps, See #10289). Le cran modèle supérieur n'existe nulle part : aucun notebook GRPO-RLVR au-delà de 0.8B dans le dépôt (grep Qwen + 1.5B/1.7B/2B dans PostTraining/FineTuning : 0 hit sur un GRPO exécuté). Qwen2.5-1.5B-Instruct est en cache local ; Qwen3-1.7B / Qwen3.5-2B à télécharger.
C'est le lead candidat pour l'étage GPU moyen (#1454, ventilation 3 étages du 23/08) : un 1.7B-2B QLoRA + GRPO (policy + ref gelé pour KL, num_generations par prompt) est borderline sur 8 Go — à qualifier (tient / ne tient pas), pas à supposer. Si OOM sur RTX 3070 : routé po-2025/po-2026 (16 Go). Si ça tient : po-2024 le livre en PT-11c.
Livrable
PT_11c_grpo_qwen17_rlvr.ipynb (ou PT_11c_*_2b_* selon le modèle qualifié) : GRPO + RLVR sur le cran au-dessus de 0.8B, même infrastructure que PT-11b (verifier SymPy arithmétique, rewardspy en ligne si applicable), avec :
- Verdict mémoire mesuré (teneur 8 Go vs étage moyen) — pic VRAM, batch/generations réduit si besoin, comparé au 0.8B de PT-11b.
- Run réel ≥ 100 steps, courbe reward, comparaison honnête 0.8B vs 1.7B/2B à budget de steps égal (même verifier, même seed) — verdict BEATS/NO BEATS/INCONCLUDE si claim d'amélioration.
- Multi-seed ≥ 4 si « BEATS » est prononcé (conjonction edge ≥ 2σ ET DM
dm_p_median < 0.05 sur perte mse/mae — cf pr-review-discipline §C).
- 3 exercices C.1, prose densité ≥ 1200, outputs réels committés (C.2).
Acceptance
- Exec réelle (papermill log dans le body), 0 erreur volontaire.
- Verdict mémoire : chiffres mesurés (pas « ça devrait tenir »).
- Comparaison 0.8B vs cran supérieur avec verdict honnête documenté.
- README PostTraining mis à jour (ligne PT-11c) dans la même PR.
Non-goals
- Pas de nouveau verifier (réutiliser SymPy arithmétique de PT-11b).
- Pas de mono-seed « BEATS » — passe par le gate §C complet.
Enfant de #1454 (volet « RL / Post-training SOTA ») — créé sur mandat coordinateur (DM 2026-08-23T21:09Z). Grain unitaire ancré sur un gap mesuré, pas une umbrella.
Groundage (2026-08-23, firsthand)
La série
GenAI/PostTraining/(14 notebooks) couvre GRPO/RLVR sur Qwen3.5-0.8B QLoRA : PT-11a (Z3 CSP), PT-11b (SymPy + N-queens), PT-11b multi-seed (4 seeds × 100 steps,See #10289). Le cran modèle supérieur n'existe nulle part : aucun notebook GRPO-RLVR au-delà de 0.8B dans le dépôt (grep Qwen + 1.5B/1.7B/2B dans PostTraining/FineTuning : 0 hit sur un GRPO exécuté). Qwen2.5-1.5B-Instruct est en cache local ; Qwen3-1.7B / Qwen3.5-2B à télécharger.C'est le lead candidat pour l'étage GPU moyen (#1454, ventilation 3 étages du 23/08) : un 1.7B-2B QLoRA + GRPO (policy + ref gelé pour KL,
num_generationspar prompt) est borderline sur 8 Go — à qualifier (tient / ne tient pas), pas à supposer. Si OOM sur RTX 3070 : routé po-2025/po-2026 (16 Go). Si ça tient : po-2024 le livre en PT-11c.Livrable
PT_11c_grpo_qwen17_rlvr.ipynb(ouPT_11c_*_2b_*selon le modèle qualifié) : GRPO + RLVR sur le cran au-dessus de 0.8B, même infrastructure que PT-11b (verifier SymPy arithmétique, rewardspy en ligne si applicable), avec :dm_p_median < 0.05sur perte mse/mae — cf pr-review-discipline §C).Acceptance
Non-goals