Skip to content

[EPIC] Training & Post-Training — trading + sudoku + RL/PPO + GenAI fine-tuning (po-2024 pionnier ⇄ ai-01 approfondit) #1454

Description

@jsboige

État au 2026-09-01 — les deux « NEW à ouvrir » sont livrés, et la ventilation GPU a un étage de plus

Corps réécrit contre l'avancement réel (défaut #13906). Trois écarts, tous mesurés ce jour :

  1. Les deux entrées « NEW … (à ouvrir par po-2024) » décrivent du travail déjà sur main — 47 notebooks au total.
  2. Les six enfants listés sont tous terminaux, et le registre réel des enfants vivait dans un commentaire, pas dans le corps.
  3. Le partage du travail à deux étages est périmé depuis la directive user du 2026-08-23 : la ventilation GPU en compte trois. Elle aussi ne vivait qu'en commentaire.

25 PRs mergées portent #1454 au titre. Zéro PR ouverte.

Ventilation GPU — trois étages (directive user du 2026-08-23)

« Tu as la grosse GPU (24Gb), po-2024 la petite, po-2025 ou po-2026 fourniront la moyenne, ce qui permet pas mal de fluidité dans nos approches de ML. »

Étage Lane Rôle dans le ping-pong
petite po-2024 (RTX 3070 8 Go) pionnier — défriche : LoRA, specialists, experts de MoE, scikit-learn / Infer.NET, petits fine-tunes
moyenne po-2025 ou po-2026 étage intermédiaire — reprend un lead qui déborde 8 Go sans exiger la grosse carte : fine-tunes moyens, séries de seeds, walk-forward, ablations
grosse ai-01 (3× RTX 4090 24 Go) approfondit les leads prometteurs. GPU 0-1 tenus par vLLM, trainings sur GPU 2 (CUDA_VISIBLE_DEVICES=2)

Ce que l'étage moyen change : un lead de po-2024 qui bute sur 8 Go n'attend plus un créneau sur la grosse carte. Il monte d'un cran, se fait qualifier ou tuer là, et ne consomme la grosse carte que s'il survit. C'est un filtre de plus, pas une file d'attente de plus.

Le training est par ailleurs un ping-pong distinct de celui du harnais prover (#1453) : il tourne avec les workers QC / ICT / autres, pas avec le prover.

Les deux volets « NEW » — livrés, pas à ouvrir

  • RL / Post-training SOTA — MyIA.AI.Notebooks/RL/ porte 24 notebooks, dont la sous-série post-training rlpt_1_ppo_lm_rlhf, rlpt_2_grpo_minimal, rlpt_3_reward_hacking, rlpt_4_dpo_vs_ppo, plus rl_6c_ppo_from_scratch, rl_6d_sac_from_scratch, rl_6e_grpo_from_scratch et rl_15_grpo_group_relative_policy. Les « techniques à la Deepseek-Qwen » que le corps appelait de ses vœux sont là, from scratch.
  • GenAI fine-tuning / LoRA — MyIA.AI.Notebooks/GenAI/PostTraining/ : 16 notebooks (GRPO/RLOO/GAE from-scratch, RLVR Qwen3.5-0.8B multi-seed). MyIA.AI.Notebooks/GenAI/FineTuning/ : 7 notebooks.

Traqueurs ouverts pour les gaps résiduels le 2026-08-23, tous deux fermés depuis : #12653 (PT-11c GRPO-RLVR sur Qwen3-1.7B/2B, fermé le 2026-08-28) et #12654 (FT-06 LoRA vision-langage Qwen3.5-0.8B + migration FT-03, fermé le 2026-08-30).

Enfants d'origine — tous terminaux

Enfant État
#1409 Curriculum trading V3 long-horizon fermé le 2026-07-26
#1412 L1 TSMOM baseline multi-actifs fermé le 2026-05-26
#1413 L2 cross-sectional + dual momentum fermé le 2026-05-26
#1417 L3 modèle directionnel long-horizon GPU fermé le 2026-06-11
#1451 RL-Portfolio Q-Learning research notebook PR mergée le 2026-05-25
#605 Sudoku-NN Phase 2 fermé le 2026-05-24

Ce qui reste

Cet EPIC est un umbrella permanent, pas une liste de tâches : il n'a plus d'enfant ouvert et n'en a pas besoin pour être piochable. Ce qu'il attend est un lead nommé, pas une nouvelle arborescence.

  1. po-2024 nomme le lead qui mérite l'étage moyen — le mécanisme à trois étages n'a encore jamais été exercé de bout en bout. Un lead qui bute sur 8 Go et monte d'un cran est le premier test réel de la fluidité que la directive user vise.
  2. Le trading long-horizon reste le volet le moins refermé : [EPIC] Curriculum trading V3 — Long-Horizon Trend & Regime (side-track BG ai-01 GPU2 + po-2024) #1409 est fermé, mais l'instrument de biais des harnais de volatilité M4/M15 (feat(training,#1454): instrument — M4/M15 vol harnesses persistent biais + séries de prévisions #12745, mergée) a été livré comme instrument, pas comme verdict.

Acceptance inchangée, et un étage de plus ne l'assouplit pas : notebooks de recherche reproductibles · multi-seed ≥ 4 et Diebold-Mariano dm_p_median < 0.05 sur une perte de précision (mse/mae, jamais linear seul) · rapport de biais par modèle dans le body dès qu'une PR prononce « BEATS » (cf pr-review-discipline §C) · verdict honnête « BEATS » / « NO BEATS » / « INCONCLUSIVE », jamais « promising ».


Corps d'origine conservé ci-dessous (2026-05-23). L'esprit parcimonieux et l'autonomie de po-2024 restent valides mot pour mot ; seuls l'état des enfants et la ventilation à deux étages étaient périmés.

Objectif

Umbrella de tout le travail de training. po-2024 (RTX 3070 8 Go) pionnier sur modèles parcimonieux/spécialistes ; ai-01 (gros GPU) approfondit les pistes prometteuses. 8 Go = largement assez pour des modèles fins très spécialistes : scikit-learn, Infer.NET, experts de MoE, petits fine-tunes, LoRAs.

Esprit agile et parcimonieux — pas de gros DNN sur 8 Go, mais beaucoup de possibilités pour des modèles ciblés.

Enfants

Partage du travail (po-2024 ⇄ ai-01)

po-2024 défriche sur 8 Go (LoRA, specialist, MoE experts) → ai-01 a "la grosse carte" et approfondit les leads intéressants. Side track d'ai-01 ; main track de po-2024.

Acceptance

≥1 PR/wakeup de po-2024 · notebooks de recherche reproductibles · multi-seed ≥4 si claim "improvement" (cf pr-review-discipline C).

Autonomie

po-2024 avance trading + RL indépendamment même si coordinateur absent.

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Projects

    No projects

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions