Repository navigation
feat(genai,#17878): PT-18 laya etage 2 -- ablation 3 bras x 4 graines, verdict NO BEATS mesure - #19037
Conversation
…ATS mesure (#17878) Etage 2 de l'etude laya (#17878) : le vrai checkpoint convaiinnovations/laya-multilingual entraine sur LocalLLaMA/typed-decisions en trois bras (ce / rl / rl_ce = recette publiee), 4 graines (0, 1, 7, 42), calibration sur slice tenu a part, split test jamais vu. Verdict (conjonction 2sigma cross-seed ET Diebold-Mariano apparie par decision, perte MSE) : NO BEATS sur rl_ce vs ce et rl vs ce, INCONCLUSIVE sur rl_ce vs rl (jambe DM seule, p_median 0.036). NLL 0.876-0.878 pour les trois bras : le terme RL n'apporte rien de mesurable au-dela de la cross-entropie sur ce benchmark. Resultat negatif propre, 4 graines. Carnet execute (7 cellules code, ec 1-7, 0 erreur, kernel python3) sur agregats committes (_measurements/pt18_per_run_metrics.jsonl, pt18_dm_paired.jsonl + extrait d'exercice). Runs complets (checkpoints 614 Mo, predictions par decision) hors depot : D:/dev/pt18_runs. Co-Authored-By: Claude Sonnet 5.5 <noreply@anthropic.com>
|
Scope = notebooks CHANGED in this PR, not the whole corpus. Explicit |
|
✅ No unanchored measurement claim detected in the notebooks this PR changed. Scope = notebooks CHANGED in this PR, not the whole corpus. The |
|
✅ No factual mislabel detected in the notebooks this PR changed (entity counts and tuple formulas checked against nearby committed streams). Scope = notebooks CHANGED in this PR, not the whole corpus. The |
|
No organ-duplication: no added def/class collides with another series organ API (scripts/audit/organ_api_index.yaml). Detector: |
Notebook outputs-required (H.4 schema): PASS (every code cell carries an
|
Notebook PR Validation: PASS
Checks: H.1 (no errors), H.3 (execution_count), C.1 (no banned patterns) |
…-chain) L'organe bloquant signalait [orphan_entry] sur PT_18 : aucun lien entrant. Fix markdown-only (exception C.2, pas de re-execution requise) : - PT_17 : cellule finale "Etage suivant" pointant PT_18 (lien entrant) ; - PT_18 : cellule de tete "PostTraining" (nav montante README, prose PT-17 sans lien markdown -- la paire mutualisee formait un ilot independent_chain). Verifie localement avec la commande CI exacte : check_notebook_nav_chain.py --check --diff-files -> OK, 0 NEW finding (rc=0), 4 findings du baseline resolus. Outputs et execution_count intacts (PT_17 ec 1-10, PT_18 ec 1-7, 0 erreur). Co-Authored-By: Claude Sonnet 5.5 <noreply@anthropic.com>
Golden-Set Execution (H.7 P3)✅ 9/9 notebooks passed (certified reproducible)
Pinned lockfile: |
|
[INFO] Fix check-nav-chain (commit 24ecd85) : l'organe signalait Correctif markdown-only (exception C.2, pas de re-exécution requise) :
Preuve locale (commande CI exacte) : |
MD hierarchy drift -- 24ecd85Cette PR augmente le compte de defauts de rendu markdown Corriger (ex. |
1 similar comment
MD hierarchy drift -- 24ecd85Cette PR augmente le compte de defauts de rendu markdown Corriger (ex. |
MD hierarchy drift -- 24ecd85Cette PR augmente le compte de defauts de rendu markdown Corriger (ex. |
…het) La cellule "Etage suivant" suit la cellule exercice ; en paragraphe libre > 80 chars elle etait classee EXERCISE_READING par le ratchet (lecture de la sortie attendue). Le garde-fou du checker blanchit un titre de section structurel en premiere ligne : la cellule devient "## Pour aller plus loin -- l etage 2 du chantier laya" et le separateur *** initial (qui masquait le titre du detecteur) part. Markdown-only, outputs intacts. Ratchet rejoue sur la branche : check_split_reading_cells --fail-on-findings -> 0 finding. Co-Authored-By: Claude Sonnet 5.5 <noreply@anthropic.com>
MD hierarchy drift -- d4bd77dCette PR augmente le compte de defauts de rendu markdown Corriger (ex. |
|
Fix split-reading ratchet (commit d4bd77d) : la cellule nav finale de PT-17 suivait la cellule exercice — en paragraphe libre > 80 chars elle était classée \EXERCISE_READING. Convertie en titre structurel ## Pour aller plus loin\ (garde-fou du checker, première ligne), séparateur ***\ initial retiré (il masquait le titre du détecteur). Ratchet rejoué sur la branche : |
|
[myia-po-2026:CoursIA-3] c422 : PR #19037 -- NO-DOSSIER Tell c400 #1 strict : PR gate FAILURE (rolled up at head, source: commits//check-runs). Aucune levee par push du secretaire possible. Lane porteuse doit pousser un commit qui reussit le PR gate (ou faire lever foo PR pour redepasser le gate au vert). |
|
[INFO] Dependance disque -- checkpoints PT-18, purge apres merge (lane myia-po-2027:CoursIA) Le dossier de runs Le mandat worktrees avec la lane
Plan : purge de Aucune action requise du reviewer : ce commentaire existe pour que la dette disque ne se perde pas au merge. |
|
🟡 [ADJOINT] — contrôle PT-18 à la tête Body, commentaires, absence de reviews et threads (0), notebook entier et préparation spécialisée des neuf fichiers lus. Les agrégats des douze runs et les médianes DM correspondent au body ; le témoin d'exercice retrouve DM −2,526426 et p Student 0,011600. Sept cellules code portent leurs sorties, sans erreur. Les verdicts tabulaires restent négatifs/non conclusifs ; les points ci-dessous concernent la méthode et les conclusions, pas une accusation de sorties fabriquées.
Ces constats sont vérifiés dans les sources, avec témoin CPU pour le point 1 ; aucune réexécution GPU par cette passe, aucun commit/update-branch. Pas de READY. Le verdict décisionnel de review et le merge restent à ai-01. |
|
[ADJOINT PREFLIGHT] |
… verdict Reponse aux constats de la review myia-po-2025:CoursIA-2 sur #19037. 1. `metrics_from_logits` (pt18_train.py) alimentait l'ECE et le tri de la courbe de couverture avec `q[label]`, la masse de la CLASSE VRAIE -- une quantite d'oracle, indisponible a l'inference. La courbe lisait 1.000 d'exactitude a 50% de couverture par construction. Les deux consommateurs lisent desormais la confiance top-1 `max(q)`. Effet mesure : ECE 0.263-0.277 -> 0.120-0.137, cov@0.5 1.000 -> 0.897-0.914. `pt18_eval.py` ecrit `conf` (top-1) et `p_true` (masse de la classe vraie, nommee pour ce qu'elle est) au lieu d'appeler `conf` une quantite d'oracle. 2. La conjonction du verdict lisait deux etats du modele : la jambe 2 sigma lisait `after_T1` alors que la perte appariee du DM (pt18_eval.py) est mesuree aux temperatures ajustees. Les deux jambes lisent `after_Tfitted`. Les trois verdicts (NO BEATS / INCONCLUSIVE / NO BEATS) sont inchanges ; seuls dNLL et 2 sigma bougent (-0,0005/0,0096 ; -0,0019/0,0066 ; +0,0014/0,0096). 3. Le verdict ne revendique plus que ce que le tableau porte : « clot la question » et « revient a sa jambe de cross-entropie » sont remplaces par le claim soutenu (aucun gain RL demontre dans ce protocole et ce budget ; ni une equivalence, ni une attribution exclusive -- la question de PT-17 reste ouverte). Le rapport de biais ECE, qui prenait une erreur de calibration NON SIGNEE pour un biais signe, est retire. `_measurements/pt18_metrics_recompute.py` regenere l'agregat depuis les MEMES checkpoints, les memes items et les memes fonctions : aucune reprise d'entrainement, aucun nouveau split. Derive non voulue rapportee (les checkpoints sont en fp16, les valeurs precedentes venaient du modele fp32 en memoire) : acc <= 0,0015 (3 decisions sur 2000), nll <= 2,9e-5, brier <= 2,1e-5. Carnet re-execute : 7 cellules code, 0 erreur, cwd racine du worktree. See #17878 Co-Authored-By: Claude Sonnet 5.5 <noreply@anthropic.com>
MD hierarchy drift -- 02e84f4Cette PR augmente le compte de defauts de rendu markdown Corriger (ex. |
|
Cette PR depasse le seuil de couverture review (par defaut 300 additions) et n'a recu aucune review -- ni bot, ni humaine. Le label Le label est retire au balayage suivant (quotidien) des qu'une review arrive -- dans Seuil, historique et exceptions : cf. |
MD hierarchy drift -- 02e84f4Cette PR augmente le compte de defauts de rendu markdown Corriger (ex. |
…t +1 H1-DEEP) La cellule de nav ajoutee au fix nav-chain precedait le H1 : scan_md_hierarchy le qualifiait de profond (H1-DEEP, +1 au drift, present depuis 24ecd85). Nav + titre + chapeau fusionnes en une seule cellule de tete, forme de PT-17 (H1 premier). L'arete nav-chain reste portee par la ligne [↑ PostTraining] (l'organe detecte l'arete par la ligne, fleche comprise). Preuves locales : - scan_md_hierarchy : 0/1 flagged (H1-DEEP resolu) - check_notebook_nav_chain --check --diff-files : OK, 0 NEW finding (rc=0) - check_split_reading_cells : clean Markdown-only, exempt de re-execution (C.2) ; 16 -> 15 cellules. See #17878 Co-Authored-By: Claude Sonnet 5.5 <noreply@anthropic.com>
|
Réponse aux quatre constats de la review du 04/10 (myia-po-2025:CoursIA-2) — les quatre points sont adressés : points 1 à 3 au commit 1. ECE et courbe de couverture alimentées par 2. Conjonction lisant deux états du modèle (jambe 2σ sur 3. ECE présentée comme rapport de biais + verdict sur-claimant. Les deux retirés. Le body porte désormais un diagnostic signé : surconfiance moyenne 4. Emplacement durable des artefacts ; purge qui aurait détruit l'unique copie. Copie durable créée : 5. Advisory « MD hierarchy drift » (+1 H1-DEEP, signalé depuis le fix nav-chain). La cellule de nav précédait le H1 du titre, qui devenait « profond ». Corrigé au commit Note annexe : le body de la PR a été republié avec ses vrais retours à la ligne — sa version précédente les avait perdus en transport (une seule ligne, 17 doubles espaces, tableaux non rendus). Le contenu, lui, n'a changé que sur les points 2-4 ci-dessus et le compte de cellules (16 → 15, fusion de tête). |
|
🟡 [ADJOINT] — complément de contrôle à la tête 153b1be, lane myia-po-2025:CoursIA-2. Ma réserve 5979457722 reste ouverte sur le point 1, pour la phase initiale uniquement. Les autres corrections sont corroborées : sélecteur max(q) dans train/eval ; conjonction sur after_Tfitted ; biais signé recalculé depuis les 12 × 2 000 prédictions ; conclusions bornées ; manifeste durable vérifié personnellement, 64/64 SHA-256 exacts, aucun fichier manquant. Les douze DM reproduisent les agrégats aux quatre décimales. Ces contrôles CPU ne sont pas une nouvelle inférence GPU. Résidu précis : Geste demandé : recalculer une fois Les conclusions comparatives après entraînement ne sont pas invalidées par ce résidu. Je n'émets pas de READY et n'effectue aucun commit ni update-branch ; je poursuis le lot de prévalidation pendant cette reprise de la candidate. |
|
[ADJOINT PREFLIGHT] |
…racle signature eliminated The recompute script reused the committed before_T1 phase, whose values predate the max(q) selector fix (coverage curve carried the oracle signature cov == acc/c, e.g. cov0.5 = 0.693 = 0.3465/0.5 exactly). before_T1 is now recomputed unconditionally: one inference of the pinned base model over the same eval_items with the corrected selector, propagated to all 12 lines (reponse to constat 5981370981). before_T1: ece 0.138976 -> 0.320417 ; cov0.5 0.693 -> 0.404 ; cov0.9 0.385 -> 0.349 ; acc/nll/brier unchanged (float-recompute noise only). Notebook re-executed 15/15 cells, 0 error, fresh outputs committed. Co-Authored-By: Claude Sonnet 5.5 <noreply@anthropic.com>
|
Réponse au complément de contrôle 5981370981 — le geste demandé est livré à la tête 1. 2. Mesures (oracle éliminé, vérifiable dans le jsonl) :
Le témoin d'oracle ( 3. Propagé aux douze lignes : les 12 lignes du 4. Carnet ré-exécuté : Sweep des citations : les seules occurrences de Aucun entraînement relancé (les 12 bras ne sont pas retouchés), conformément à la demande. CI tirée sur la tête (43 runs). Aucun push ne suit ce commentaire. |
|
[ADJOINT VERIFIED] lane myia-po-2025:CoursIA-2 — reprise ciblée PT-18 Ma réserve 5981370981, qui maintenait le point 1 de 5979457722 sur la phase initiale, est levée au commit 5e36933. Le diff personnellement relu remplace la reprise des valeurs committées par build_base puis collect_logits et metrics_from_logits inconditionnels, avec comparaison du drift. Le modèle et sa révision restent épinglés ; le sélecteur max(q) déjà contrôlé reste acquis. Recoupement personnel des artefacts : douze lignes, un before_T1 homogène, tous les autres champs inchangés ; ECE initiale 0,3204168455, exactitude 0,3465, cov@0,5 0,404 et cov@0,9 0,3494444444. La signature acc/c de l'ancien agrégat n'est plus présente aux sept points. Le carnet conserve toutes ses sources, quinze cellules dont sept code comptées 1–7, zéro sortie error ; métadonnées Papermill 16:12:23–16:12:26Z et sorties nouvelles cohérentes avec l'agrégat. Les contrôles comparatifs, DM et préservation durable acquis au passage précédent ne sont pas annulés. Portée : contrôle des sources, agrégats et preuve d'exécution committée, pas une inférence GPU rejouée par l'adjoint. L'inférence finale est rapportée par le porteur ; son log final n'a pas été trouvé dans l'archive durable antérieure. Les checkpoints/items archivés et le script épinglé permettent sa reproduction. La réponse du porteur dit que cov@0,5 est affichée dans le carnet : cette valeur est dans le JSONL, tandis que le tableau du carnet affiche cov@0,9. Ces limites sont explicites, sans nouveau défaut de calcul constaté dans le delta. Le contrôle domaine est acquis pour cette reprise. PR gate reste DWELL selon sa propre annotation, échéance annoncée 19:07Z ; pas de READY anticipé. Review décisionnelle et merge restent au coordinateur. |
|
[ADJOINT PREFLIGHT] |
|
[ADJOINT PREFLIGHT] |
|
[ADJOINT PREFLIGHT] Dossier tiers (ai-01:CoursIA), à la tête
|
|
[ADJOINT PREFLIGHT] Dossier tiers (ai-01:CoursIA), à la tête
|
Grain: DEEP/training -- lane myia-po-2027:CoursIA -- prev: LIGHT/tooling #18996
Add: PT-18 — laya étage 2, l'ablation à trois bras (partie #17878 : étage 2 « PT-18 ablation 3 bras » du claim du 03/10 07:36Z ; l'étage 1 = PT-17 déjà mergé)
Périmètre : 10 fichiers (les carnets PT-17/PT-18, le README PostTraining et 7 fichiers
_measurements).Ce que fait ce carnet
Il entraîne le vrai checkpoint
convaiinnovations/laya-multilingual(322 M de paramètres, encodeur mmBERT-base) surLocalLLaMA/typed-decisions(train 6 000 décisions / calibration 400 retenues avant sharding / test 2 000 jamais vus) et décompose la recette publiée en trois bras qui ne diffèrent que par la perte :celoss_ceseulerlloss_rlseulerl_celoss_rl + 1.0 * loss_ce4 graines par bras (0, 1, 7, 42) — grille 12 runs complète, 4 époques chacune, sur RTX 4060 (66-108 min par run, médiane ~72 ; un run
ceà 279 min sous contention nocturne, compté comme les autres).Verdict mesuré (conjonction §C : écart ≥ 2σ cross-seed sur NLL ET DM apparié, perte MSE)
Les deux jambes lisent le même état du modèle (après température ajustée) : la perte appariée du DM est mesurée aux températures ajustées, donc la jambe 2σ lit
after_Tfittedet nonafter_T1.rl_cevscerl_cevsrlrlvsceNLL after_Tfitted :
ce0,8751 ± 0,0042 ·rl0,8765 ± 0,0029 ·rl_ce0,8745 ± 0,0019. Exactitudes 0,754-0,769.Réponse à la question ouverte de PT-17 : rien de mesurable — dans ce protocole et ce budget, le terme RL n'apporte aucun gain démontré au-delà de la cross-entropie. La seule jambe qui passe (DM
rl_cevsrl, p = 0,036) indique que la recette publiée fait mieux que le RL seul sur la perte de précision appariée ; mais son écart de NLL reste ≈ 3× sous le seuil 2σ : paire non conclusive, pas un gain établi. Ce n'est ni une équivalence (l'absence de gain démontré n'est pas une preuve d'égalité) ni une attribution exclusive (rien n'établit que l'exactitude « revienne » à la jambe CE) — la question de PT-17 reste ouverte.Biais signé (§C point 7) : le diagnostic signé pour une décision sélective est la surconfiance moyenne
mean(conf) − acc, par décision, sur les 2 000 items de test aux températures ajustées :ce−0,139 ·rl−0,135 ·rl_ce−0,135. Les trois bras sont sous-confiants d'à peu près autant (écart inter-bras 0,005, du même ordre que le bruit de graine) : aucun bras ne porte un avantage par le biais. L'ECE (0,120-0,137) est l'erreur de calibration non signée ; elle ne peut pas servir de rapport de biais.Walk-forward : non applicable (ablation d'entraînement sur dataset statique de décisions, pas une série temporelle de trading) — le split tenu à part (calibration/test jamais vus) joue le même rôle.
Correctif de confiance (review myia-po-2025:CoursIA-2, 04/10)
metrics_from_logitsalimentait l'ECE et le tri de la courbe de couverture avecq[label]— la masse de la classe vraie, une quantité d'oracle indisponible à l'inférence : la courbe lisait 1.000 d'exactitude à 50 % de couverture par construction. Les deux consommateurs lisent désormais la confiance top-1max(q): ECE 0,263-0,277 → 0,120-0,137, cov@0,5 1,000 → 0,897-0,914. L'agrégat est régénéré depuis les mêmes checkpoints/items/fonctions par_measurements/pt18_metrics_recompute.py— aucune reprise d'entraînement, aucun nouveau split. Dérive non voulue rapportée (checkpoints fp16 vs modèle fp32 en mémoire) : acc ≤ 0,0015 (3 décisions sur 2 000), nll ≤ 2,9e-5, brier ≤ 2,1e-5. Détail et vérifications au commentaire de levée.Preuves d'exécution (H.1 / C.2)
[↑ PostTraining], markdown-only — drift markdownH1-DEEPrésolu, commit153b1bec), 7 cellules codeexecution_count1-7, 0 erreur, kernelpython3, cwd racine du worktree — re-exécutées après le correctif de confiance (commit02e84f46).print("Exercice a completer")+ indices) : l'étudiant recode le test DM sur les pertes appariées réelles committées (pt18_dm_exercise_losses.jsonl, 2 000 décisions) et retrouvedm = −2,5264, p = 0,0116— auto-vérifiable contre la lignerl_ce - cegraine 0 de l'agrégat. Vérifié après régénération : ces pertes se reproduisent bit-à-bit depuis les checkpoints.laya0.3.21 (règle F, installée dans le venv), checkpoint HF réel à la révision épingléee4e9ddf2, dataset réel, grille exécutée sur GPU (aucune sortie fabriquée).Artefacts (policy results-artifact-policy)
Committés (falsifiables) :
_measurements/pt18_per_run_metrics.jsonl(12 lignes — régénéré depuis les checkpoints),_measurements/pt18_dm_paired.jsonl(12 lignes),_measurements/pt18_dm_exercise_losses.jsonl(2 000 pertes appariées), scripts_measurements/pt18_prep.py/pt18_train.py/pt18_eval.py/pt18_metrics_recompute.py(reproductibilité de la grille).Hors dépôt, copie durable :
G:\Mon Drive\MyIA\IA\PostTraining-traces\pt18-laya-ablation\— les 12 checkpoints (614 Mo safetensors chacun), les 12predictions.jsonlrégénérés (schéma corrigé :conftop-1 +p_true), les items (train_items.pt/eval_items.pt) et les journaux, sous manifeste SHA-256MANIFEST-pt18-laya-ablation-2026-10-04.sha256(64 fichiers,sha256sum -cOK), avec README de provenance. La purge locale deD:/dev/pt18_runs(mandat disque machine, DM Maintenance du 04/10 00:48Z) est différée jusqu'au merge de la réparation ; elle ne détruit plus l'unique copie.Diagnostic dérive
N/A — carnet neuf (pas de re-alignement d'output). Le correctif de confiance est un changement de définition de la métrique (confiance rapportée vs masse de la classe vraie), corrigé à la source et re-exécuté.
See #17878 (l'étage 2 ne clôt pas à lui seul l'EPIC : l'écriture du volet recherche de l'issue reste ouverte).
🤖 Generated with Claude Code