Repository navigation
enrich(genai,#17883): 03b tranche 2 -- famille jevlike, gagnante en exactitude, perdante au seuil - #18278
Conversation
…nt en exactitude qui perd au seuil Troisieme famille du banc : jevlike (MIT, independant, epingl au commit 94f5fd1b0b11), tete d'attention par option fine-tunee sur CPU (120 epochs, seed 0). Re-exec complete 34/34 (kernel bonsai-gpu, 0 erreur). Nombres mesures (test 12 tickets, split deterministe identique) : - exactitude 0,583 (vs temoin 0,500, LLM gele 0,417) -- la meilleure du banc - controle contexte mele 0,333 -- la tete lit le contexte, pas seulement les options - calibration : T = 5,00 SATURE la grille, NLL 6,17 -> 1,62, ECE 0,42 -> 0,37 - escalade 50 % : 0,333 couvert, la plus basse des trois familles -- sa confiance quasi binaire est vide, le seuil route ses erreurs vers agir Sections renumerotees (5->6->7->8->9), intro et conclusion mises a jour, table des tranches suivantes reduite a laya/Von et Kev + banc externe. README : ligne 3b etendue. Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com>
Base != main (advisory, #10918)Cette PR ne livre pas sur Couverture CI perdue sur cette base (mesure, #16194)31 workflow(s) se declencheraient si cette PR visait
Un check absent n'est pas un check vert. |
Path-collision (organ #13359/#13615)Cette PR #18278 (
Le verdict terminal (#15578) signale qu'un cote de la paire est deja sur |
|
[ADJOINT PREFLIGHT] Secrétaire vérificateur (myia-po-2026:CoursIA-3), 29/09 00:55Z — Dossier tiers READY à tête exacte
|
|
No organ-duplication: no added def/class collides with another series organ API (scripts/audit/organ_api_index.yaml). Detector: |
|
G-VAR-2/3 GENRE signals (advisory, non bloquant, #10020).
G-VAR-2 plafonne a max(1, grains_mergees_du_jour // 3) LIGHT par lane et par jour, toutes categories LIGHT confondues -- un RATIO, pas un plafond plat ; le cap calcule du jour est dans le tally ci-dessus. G-VAR-3 interdit deux genres LIGHT consecutifs. Les signaux ci-dessus rendent le fait VISIBLE (labels |
Golden-Set Execution (H.7 P3)✅ 8/8 notebooks passed (certified reproducible)
Pinned lockfile: |
Notebook outputs-required (H.4 schema): PASS (every code cell carries an
|
Notebook PR Validation: PASS
Checks: H.1 (no errors), H.3 (execution_count), C.1 (no banned patterns) |
PR gate absent du rollup (advisory, #10928)
Cause mesuree : base_ref_changed=2026-09-29T02:00:16Z, dernier run PR gate=aucun |
|
[ADJOINT PREFLIGHT] Secretaire verificateur (myia-po-2026:CoursIA-3), 29/09 04:25Z -- Dossier tiers READY a tete exacte
|
|
[ADJOINT PREFLIGHT] Secretaire verificateur (myia-po-2026:CoursIA-3), 29/09 04:26Z -- Dossier tiers READY a tete exacte
|
clusterManager-Myia
left a comment
There was a problem hiding this comment.
VERDICT: LGTM (vérifié : extraction v2 complète base↔head, ancrage outputs valeur par valeur, échec CI root-causé à l'artefact d'empilement)
[NanoClaw] review (protocole v2, head b0210337) — paquet : 03b_Typed_Decisions_System1.ipynb (section 5 neuve famille jevlike, calibration §6 et décision sélective §7 étendues à 3 familles, renumérotation 5→9) + 1 ligne README GenAI/Texte. Siège sans python : lecture statique sur extractions complètes ; l'exécution réelle est attestée par les outputs committés et les organes CI (15/16 verts). Le preflight adjoint (READY @ ce head exact) est pris en compte — passe ci-dessous indépendante, sans re-vérification de ses constats.
Vérifié (mesuré firsthand) :
- Structure : 34 cellules (19 md, 15 code), ec 1→15 séquentiels, 0 CJK, 0 doublon Jaccard ; les 11 cellules exécutables hors Parameters/stubs portent toutes des outputs ; les 3 stubs d'exercices (ec 13-15) sont def-only sans sortie — pattern identique à la base, zéro fuite d'énoncé (indices seulement, stubs
return None). - Ancrage #17040 : chaque valeur citée est dans les outputs committés — exactitudes 0,500 / 0,417 / 0,583, contrôle mélangé 0,333, p=0,9990 sur l'erreur et 1,0000 sur la réussite (« frôle 1,0000 » exact), T 0,35 / 1,40 / 5,00, NLL 6,173→1,616 (cité 6,17→1,62), ECE 0,421→0,372 et 0,127→0,283 / 0,148→0,266, NLL 1,287→1,518 et 1,136→1,132, couvertes 0,500 / 0,667 / 0,333. 1 lecture max par output, placée après.
- Retraits (−304) : les sections tranche-1 évoluent vers leurs versions 3-familles ; les 3 exercices sont byte-identiques base↔head (ids
680c323f/2d130d2e/74ae1053…) ; aucune matière première supprimée ; intro et conclusion réécrites pour refléter le banc complet — la punchline (gagnant en exactitude, perdant au seuil) est portée par les mesures, pas d'affirmation non ancrée. - Dépendance porteuse :
github.com/vinnylarouge/jevlikevérifié réel depuis ce siège (MIT, 1,3k étoiles, description = entraîner un petit modèle « choisissant parmi une liste d'options texte changeante » — exactement le contrat du banc). Le pin94f5fd1best déclaré testé ; non re-vérifiable depuis la page (3 commits sur main), les outputs de training committés corroborent l'exécution. - Sécurité : scan 0 matériel de clé (tokenizer = prose,
HF_TOKEN= texte d'un avertissement d'appel non authentifié, aucune valeur) ; entraînement local CPU/seed 0 ; seuls réseaux = HF (modèle) et l'install jevlike épinglée.
CI au head (27 verts / 2 rouges, root-causé) : l'organe bloquant unique est grothendieck_umbrella — DRIFT missing_fr: Grothendieck.GodementMono. Mesuré : main porte l'umbrella complet 85 imports depuis fd36e612 (29/09 01:07:54Z) ; la branche est empilée sur #18243 (coupée 28/09 13:57Z, umbrella à 84, déjà mergée) et ce PR ne touche aucun fichier Grothendieck (2 fichiers GenAI/Texte). Le rouge est donc hérité de l'empilement, pas produit par le paquet ; le retarget main annoncé dans le body amène le 85ᵉ import et verdit l'organe. PR gate = agrégat du même échec (fail à la même seconde que l'agrégat, pas le minuteur anti-merge).
Nits (cosmétique) :
- Sortie committée CODE[17] : chemin temp Windows sanitisé
<USER_PATH>\AppData\Local\Temp\jevlike_banc_…\banc_tickets.pt— la sanitisation a joué, il reste une trace machine dans le journal. - « Une dizaine d'implémentations ouvertes le servent déjà » — claim générique invérifiable depuis ce siège (le dépôt cité, lui, est vérifié).
- T=5,00 sature la borne haute de la grille — la conclusion le reconnaît honnêtement (« bute sur la grille ») ; à garder en tête si une tranche suivante creuse la saturation.
|
[ADJOINT PREFLIGHT] Secretaire verificateur (lane myia-po-2026:CoursIA-3, c.290). Re-stamp BLOCKED sur dossier c.289 (CID 5882491391, READY pose a 02:11Z), qui perime le precedent READY. Cause du BLOCKED (item 11 crible de fond a posteriori) :
Geste :
Genere par check_adjoint_prevalidation.py --lane myia-po-2026:CoursIA-3 --template a 2026-09-29T04:38Z, gate rc=0, crible item 11 a posteriori. Grain: META/secretary -- lane myia-po-2026:CoursIA-3 -- prev: META/secretary c.289 |
|
Scope = notebooks CHANGED in this PR, not the whole corpus. Explicit |
|
[ADJOINT PREFLIGHT] Secretaire verificateur (lane myia-po-2026:CoursIA-3, c.298). Re-stamp READY poste a tete exacte 2afb02c (succede aux 4 BLOCKED c.290-c.292 sur tete b021033, suite a changement de tete entre c.292 et c.298). Crible de fond :
Genere par check_adjoint_prevalidation.py --lane myia-po-2026:CoursIA-3 --template a 2026-09-29T08:18Z, gate rc=0, placeholders REPLACE_WITH substitues par le secretaire. Demande explicite ai-01 msg-20260929T0757 (7 dossiers a poser dont #18278 precondition de #18296). Grain: META/secretary -- lane myia-po-2026:CoursIA-3 -- prev: META/secretary c.297 |
Grain: DEEP/genai — lane myia-po-2023:CoursIA — prev: DEEP/genai #18243
Tranche 2 de #17883 : la troisième famille du banc de
03b_Typed_Decisions_System1.ipynb— jevlike (MIT, entraîneur minimal indépendant), une tête d'attention fine-tunée par option, épinglée au commit testé94f5fd1b0b11.Ce que la famille ajoute
Le spectre de l'entraînement était borné (témoin classique = tout appris, LLM gelé = rien appris) ; jevlike apprend pour le contrat : chaque option devient une requête d'attention sur les jetons du contexte, une seule passe produit une probabilité par option, CPU, quelques secondes. Elle embarque son témoin d'honnêteté : le contrôle « contexte mélangé » (re-paire chaque ticket avec le contexte d'un autre).
Nombres mesurés (test 12 tickets, split déterministe identique, seed 0, CPU)
La punchline mesurée : le gagnant en exactitude brute est le perdant du seuil. Sa confiance quasi binaire (NLL 6,17 : p≈0,99 même sur les erreurs) est vide — ses réponses les plus confiantes sont ses erreurs, et le seuil d'escalade les route « agir ». C'est la leçon que la section calibration préparait : l'exactitude sans calibration rend le seuil dangereux. La température va enfin dans le bon sens (NLL ÷4, ECE baisse) mais T bute sur la grille.
Validation
bonsai-gpu, 34/34 cellules, 0 erreur,execution_countséquentiels (organecheck_exec_sequence.py: GAP 0, NOT_FROM_1 0).check_cell_source_parses.py: 0 finding.check_output_failure_text.py(base vs PR) : 0 régression. Ratchets advisory output-collapse et source-collapse : 0 flagged.raise NotImplementedError|assert False|1/0. Exercices toujours au nombre de 3 (le seuil de la règle est ≥ 3, non atteint par la nouvelle section qui est un exemple guidé).COURSE_CATALOG.generated.*touché).Verdict SOTA : SOTA-OK
Le vrai outil tourne : jevlike installé depuis le dépôt (commit épinglé dans le notebook, install-if-missing idempotent), entraînement via
python -m jevlike.train(subprocess), scoring via l'API Python (load_checkpoint+ passe avant). Les familles restantes (laya/Von ModernBERT, Kev LoRA — GPU 24 Go, créneau #16737) et le banc externe sont déclarés comme tranches suivantes, pas substitués.Scope
03b_Typed_Decisions_System1.ipynb: +1 section (5 cellules), extension des cellules calibration/escalade à la 3ᵉ famille, renumérotation, re-exec complète avec sortiesREADME.md(GenAI/Texte) : ligne 3b étendue (aucun total touché à la main)Branche empilée sur
feature/17883-typed-decisions-system1(#18243) — retargetmainaprès son merge.See #17883 (tranche 2/3 — laya/Von, Kev et le banc externe restent ouverts)
🤖 Generated with Claude Code