Skip to content

epic(audit): arc narratif des carnets compliques -- lecture simple d'abord, approfondissements en annexes (generalisation du pilote Lean-31) #18703

Description

@jsboige

État mesuré au 2026-10-05 (origin/main = 90b2be6d65). Consolidation par la lane myia-po-2026:CoursIA, détail et preuves en c.5986538924 ; bloc posé par le coordinateur. La table et le census du corps, en dessous, sont datés : lire les corrections ci-dessous avant de s'en servir.

Reste ouvert : le déploiement continue (Search-03 en vol, lane myia-po-2025:CoursIA). L'EPIC n'est pas fermé.


Pourquoi

Suite directe du constat utilisateur du 01/10 (Lean-31) : certains carnets écrivent des murs sur chaque sujet et enterrent leur payoff — le récit, les visualisations — derrière des statistiques de preuve obscures. Le lecteur intéressé par les viz décroche avant d'y arriver. Le pilote #18699 (Lean-31) valide la méthode sur un cas ; cette EPIC généralise le geste aux carnets « compliqués » du dépôt, sur les bases de ce que la réécriture aura clarifié.

Le geste est celui déjà fait pour la numérotation allégée + accrétions (lettres) dans les carnets et l'arc narratif dans les README : lecture simple remontée dans les premières parties, approfondissements rendus optionnels (sections tardives, annexes lettrées), aucune suppression de contenu.

« Compliqué » = critères observables, pas une impression

Trois mesures objectives par carnet (census complet des 1458 notebooks de origin/main, script jetable, métriques reproductibles) :

Critère Mesure Seuil candidat
Murs de prose cellules markdown > 4 000 caractères ≥ 2
Payoff tardif position de la première sortie image (% du carnet) ≥ 40 %
Volume total caractères de source ≥ 60 k

Census du 01/10 (1155 carnets scannés sur l'arbre de travail local, 867 conservés après exclusion des archive/, artefacts *_output.ipynb et carnets < 15 cellules). Top candidats par score combiné :

score kchars murs>4k 1re img à carnet
194.5 195 0 — QuantConnect/partner-course…/Crypto-MultiCanal/research.ipynb *
144.4 137 3 — SymbolicAI/SemanticWeb/RDF.Net-Legacy/RDF.Net.ipynb *
141.6 142 0 — SymbolicAI/Lean/Lean-9-SK-Multi-Agents.ipynb
113.6 111 1 — QuantConnect/Python/QC-Py-14-Portfolio-Construction-Execution.ipynb
104.3 97 3 — Sudoku/Sudoku-13-SymbolicAutomata-Csharp.ipynb
102.6 103 0 37 % SymbolicAI/SemanticWeb/SW-11-Python-KnowledgeGraphs.ipynb
102.1 100 1 12 % QuantConnect/Python/QC-Py-18-ML-Features-Engineering.ipynb
101.0 101 0 26 % QuantConnect/Python/QC-Py-10-Risk-Portfolio-Management.ipynb
97.9 98 0 — GenAI/Texte/10_LocalLlama.ipynb
96.5 87 2 40 % SymbolicAI/Lean/Lean-16b-Conway-Game-of-Life-Lean.ipynb
95.5 93 1 30 % QuantConnect/Python/QC-Py-20-ML-Regression-Prediction.ipynb
94.6 95 0 — SymbolicAI/SMT/Z3-Linq2Z3/06_Meal_Planner_Modelisation.ipynb
92.1 90 1 — SymbolicAI/Lean/Lean-10-LeanDojo.ipynb
88.8 89 0 29 % Probas/DecisionTheory/PyMC/DecPyMC-5-Value-Information.ipynb
85.3 83 1 35 % QuantConnect/Python/QC-Py-19-ML-Supervised-Classification.ipynb
85.0 75 0 75 % Search/Part1-Foundations/Search-3-Informed.ipynb

Le pilote lui-même, mesuré à part (absent de l'arbre local, lu depuis origin/main) : Lean-31 = 135 k chars, 3 murs, première image à 75 % — il se classerait ~4e. Cohérent avec le signalement utilisateur.

Caveats : (1) census sur arbre de travail local — les carnets plus récents que le checkout manquent (Lean-31,Lean-33/34…) ; la table est un point de départ, pas un recensement fermé. (2) Les entrées * sont du matériel hérité/partner (RDF.Net-Legacy, examples Crypto-MultiCanal) — à arbitrer séparément (peut-être hors scope pédagogique). (3) 555 carnets n'ont aucune sortie image : pour eux le « payoff » est narratif (résultats, récits, tableaux) — le critère s'applique en variante « première interprétation/résultat vs murs préliminaires », pas « première image ». 131 carnets ont leur première image à ≥ 40 %.

Le geste attendu (par carnet retenu)

  1. Cartographier l'arc (sections, volumes, position des sorties images, dépendances d'exécution par AST).
  2. Remonter la lecture simple : récit/chronologie + visualisations principales dans la première moitié.
  3. Descendre les approfondissements en sections tardives puis annexes lettrées (convention accrétions) — stats obscures, contrats d'outillage, forensics.
  4. Transitions réécrites (renvois des « Lecture du résultat »), plan et titre mis à jour.
  5. Ré-exécution complète (C.2), ordre d'exécution préservé pour les dépendances.
  6. Anti-régression : volume source préservé à ± transitions ; non-claims et démonstrations intacts.

Lien avec la campagne #17073 (Hermes + NanoClaw)

Un critère d'observation est ajouté aux partitions encore à auditer : en plus des classes existantes, consigner les carnets présentant la pathologie d'arc (payoff tardif + murs de prose) — en lecture seule, finding de classe arc-narratif, sans réparation. Voir le commentaire sur #17073. Les carnets déjà audités seront couverts par le census ci-dessus — aucune re-audit nécessaire.

Rollout

  1. Pilote : refactor(notebook): Lean-31 Euler-Navier-Stokes -- remonter le recit et les viz, stats de preuve en annexes (arc narratif) #18699 (Lean-31) — valider la méthode, mesurer le coût.
  2. Tranches par famille (une PR par carnet, grain MED) sur les candidats du census, priorité aux carnets les plus scorés.
  3. Chaque tranche cite les critères d'acceptation du pilote.

Non-goals

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    auditAutomated quality audit findingsqualityNotebook quality issues

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions