You signed in with another tab or window. Reload to refresh your session.You signed out in another tab or window. Reload to refresh your session.You switched accounts on another tab or window. Reload to refresh your session.Dismiss alert
État au 2026-09-01 — les deux « NEW à ouvrir » sont livrés, et la ventilation GPU a un étage de plus
Corps réécrit contre l'avancement réel (défaut #13906). Trois écarts, tous mesurés ce jour :
Les deux entrées « NEW … (à ouvrir par po-2024) » décrivent du travail déjà sur main — 47 notebooks au total.
Les six enfants listés sont tous terminaux, et le registre réel des enfants vivait dans un commentaire, pas dans le corps.
Le partage du travail à deux étages est périmé depuis la directive user du 2026-08-23 : la ventilation GPU en compte trois. Elle aussi ne vivait qu'en commentaire.
25 PRs mergées portent #1454 au titre. Zéro PR ouverte.
Ventilation GPU — trois étages (directive user du 2026-08-23)
« Tu as la grosse GPU (24Gb), po-2024 la petite, po-2025 ou po-2026 fourniront la moyenne, ce qui permet pas mal de fluidité dans nos approches de ML. »
étage intermédiaire — reprend un lead qui déborde 8 Go sans exiger la grosse carte : fine-tunes moyens, séries de seeds, walk-forward, ablations
grosse
ai-01 (3× RTX 4090 24 Go)
approfondit les leads prometteurs. GPU 0-1 tenus par vLLM, trainings sur GPU 2 (CUDA_VISIBLE_DEVICES=2)
Ce que l'étage moyen change : un lead de po-2024 qui bute sur 8 Go n'attend plus un créneau sur la grosse carte. Il monte d'un cran, se fait qualifier ou tuer là, et ne consomme la grosse carte que s'il survit. C'est un filtre de plus, pas une file d'attente de plus.
Le training est par ailleurs un ping-pong distinct de celui du harnais prover (#1453) : il tourne avec les workers QC / ICT / autres, pas avec le prover.
Les deux volets « NEW » — livrés, pas à ouvrir
RL / Post-training SOTA — MyIA.AI.Notebooks/RL/ porte 24 notebooks, dont la sous-série post-training rlpt_1_ppo_lm_rlhf, rlpt_2_grpo_minimal, rlpt_3_reward_hacking, rlpt_4_dpo_vs_ppo, plus rl_6c_ppo_from_scratch, rl_6d_sac_from_scratch, rl_6e_grpo_from_scratch et rl_15_grpo_group_relative_policy. Les « techniques à la Deepseek-Qwen » que le corps appelait de ses vœux sont là, from scratch.
Traqueurs ouverts pour les gaps résiduels le 2026-08-23, tous deux fermés depuis : #12653 (PT-11c GRPO-RLVR sur Qwen3-1.7B/2B, fermé le 2026-08-28) et #12654 (FT-06 LoRA vision-langage Qwen3.5-0.8B + migration FT-03, fermé le 2026-08-30).
Cet EPIC est un umbrella permanent, pas une liste de tâches : il n'a plus d'enfant ouvert et n'en a pas besoin pour être piochable. Ce qu'il attend est un lead nommé, pas une nouvelle arborescence.
po-2024 nomme le lead qui mérite l'étage moyen — le mécanisme à trois étages n'a encore jamais été exercé de bout en bout. Un lead qui bute sur 8 Go et monte d'un cran est le premier test réel de la fluidité que la directive user vise.
Acceptance inchangée, et un étage de plus ne l'assouplit pas : notebooks de recherche reproductibles · multi-seed ≥ 4 et Diebold-Mariano dm_p_median < 0.05 sur une perte de précision (mse/mae, jamais linear seul) · rapport de biais par modèle dans le body dès qu'une PR prononce « BEATS » (cf pr-review-discipline §C) · verdict honnête « BEATS » / « NO BEATS » / « INCONCLUSIVE », jamais « promising ».
Corps d'origine conservé ci-dessous (2026-05-23). L'esprit parcimonieux et l'autonomie de po-2024 restent valides mot pour mot ; seuls l'état des enfants et la ventilation à deux étages étaient périmés.
Objectif
Umbrella de tout le travail de training. po-2024 (RTX 3070 8 Go) pionnier sur modèles parcimonieux/spécialistes ; ai-01 (gros GPU) approfondit les pistes prometteuses. 8 Go = largement assez pour des modèles fins très spécialistes : scikit-learn, Infer.NET, experts de MoE, petits fine-tunes, LoRAs.
Esprit agile et parcimonieux — pas de gros DNN sur 8 Go, mais beaucoup de possibilités pour des modèles ciblés.
NEW — RL / Post-training SOTA : nouvelle série de notebooks PPO / GRPO / techniques "à la Deepseek-Qwen" de post-training. (à ouvrir par po-2024)
NEW — GenAI fine-tuning / LoRA : extension des séries GenAI avec notebooks de fine-tuning et LoRA. (à ouvrir par po-2024)
Partage du travail (po-2024 ⇄ ai-01)
po-2024 défriche sur 8 Go (LoRA, specialist, MoE experts) → ai-01 a "la grosse carte" et approfondit les leads intéressants. Side track d'ai-01 ; main track de po-2024.
Acceptance
≥1 PR/wakeup de po-2024 · notebooks de recherche reproductibles · multi-seed ≥4 si claim "improvement" (cf pr-review-discipline C).
Autonomie
po-2024 avance trading + RL indépendamment même si coordinateur absent.
État au 2026-09-01 — les deux « NEW à ouvrir » sont livrés, et la ventilation GPU a un étage de plus
Corps réécrit contre l'avancement réel (défaut #13906). Trois écarts, tous mesurés ce jour :
main— 47 notebooks au total.25 PRs mergées portent
#1454au titre. Zéro PR ouverte.Ventilation GPU — trois étages (directive user du 2026-08-23)
CUDA_VISIBLE_DEVICES=2)Ce que l'étage moyen change : un lead de po-2024 qui bute sur 8 Go n'attend plus un créneau sur la grosse carte. Il monte d'un cran, se fait qualifier ou tuer là, et ne consomme la grosse carte que s'il survit. C'est un filtre de plus, pas une file d'attente de plus.
Le training est par ailleurs un ping-pong distinct de celui du harnais prover (#1453) : il tourne avec les workers QC / ICT / autres, pas avec le prover.
Les deux volets « NEW » — livrés, pas à ouvrir
MyIA.AI.Notebooks/RL/porte 24 notebooks, dont la sous-série post-trainingrlpt_1_ppo_lm_rlhf,rlpt_2_grpo_minimal,rlpt_3_reward_hacking,rlpt_4_dpo_vs_ppo, plusrl_6c_ppo_from_scratch,rl_6d_sac_from_scratch,rl_6e_grpo_from_scratchetrl_15_grpo_group_relative_policy. Les « techniques à la Deepseek-Qwen » que le corps appelait de ses vœux sont là, from scratch.MyIA.AI.Notebooks/GenAI/PostTraining/: 16 notebooks (GRPO/RLOO/GAE from-scratch, RLVR Qwen3.5-0.8B multi-seed).MyIA.AI.Notebooks/GenAI/FineTuning/: 7 notebooks.Traqueurs ouverts pour les gaps résiduels le 2026-08-23, tous deux fermés depuis : #12653 (PT-11c GRPO-RLVR sur Qwen3-1.7B/2B, fermé le 2026-08-28) et #12654 (FT-06 LoRA vision-langage Qwen3.5-0.8B + migration FT-03, fermé le 2026-08-30).
Enfants d'origine — tous terminaux
Ce qui reste
Cet EPIC est un umbrella permanent, pas une liste de tâches : il n'a plus d'enfant ouvert et n'en a pas besoin pour être piochable. Ce qu'il attend est un lead nommé, pas une nouvelle arborescence.
Acceptance inchangée, et un étage de plus ne l'assouplit pas : notebooks de recherche reproductibles · multi-seed ≥ 4 et Diebold-Mariano
dm_p_median < 0.05sur une perte de précision (mse/mae, jamaislinearseul) · rapport de biais par modèle dans le body dès qu'une PR prononce « BEATS » (cfpr-review-discipline§C) · verdict honnête « BEATS » / « NO BEATS » / « INCONCLUSIVE », jamais « promising ».Corps d'origine conservé ci-dessous (2026-05-23). L'esprit parcimonieux et l'autonomie de po-2024 restent valides mot pour mot ; seuls l'état des enfants et la ventilation à deux étages étaient périmés.
Objectif
Umbrella de tout le travail de training. po-2024 (RTX 3070 8 Go) pionnier sur modèles parcimonieux/spécialistes ; ai-01 (gros GPU) approfondit les pistes prometteuses. 8 Go = largement assez pour des modèles fins très spécialistes : scikit-learn, Infer.NET, experts de MoE, petits fine-tunes, LoRAs.
Esprit agile et parcimonieux — pas de gros DNN sur 8 Go, mais beaucoup de possibilités pour des modèles ciblés.
Enfants
Partage du travail (po-2024 ⇄ ai-01)
po-2024 défriche sur 8 Go (LoRA, specialist, MoE experts) → ai-01 a "la grosse carte" et approfondit les leads intéressants. Side track d'ai-01 ; main track de po-2024.
Acceptance
≥1 PR/wakeup de po-2024 · notebooks de recherche reproductibles · multi-seed ≥4 si claim "improvement" (cf pr-review-discipline C).
Autonomie
po-2024 avance trading + RL indépendamment même si coordinateur absent.