Repository navigation
feat(genai,#16755): notebook 22b - profil cognitif CHC d'un LLM (Hendrycks 2025) - #17454
Conversation
…rycks 2025) Nouveau notebook GenAI/Texte/22b_Profil_Cognitif_CHC.ipynb, execute de bout en bout (19 cellules de code, 0 erreur) sur 4 modeles reels : Qwen3.5-0.8B local (CPU, decodage glouton), gpt-4.1-nano, gpt-4.1-mini, qwen3.6-flash. - mini-batterie de 54 items a correction mecanique sur 8 domaines CHC, WM generee par Python avec reponse calculee, fluence validee par nltk, MS en session neuve ; IC bootstrap par domaine - profil radar face a la Table 1 de R13 ; 4 agregats (moyenne, sans MS, minimum, moyenne geometrique) et 2 profils fictifs de meme moyenne - stabilite a T=0 (rejeu complet des 3 API) - contortions : carnet de memoire reinjecte 10/100/400 notes, RAG sur la vraie ligne du README contre un piege construit sur le depot - types d'IA de R13, cube AxGxI et lexique perte de controle de R11 - 3 exercices C.1 Ligne 22b ajoutee au README de la serie (Tier 6). See #16755 (part of #16741) Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
clusterManager-Myia
left a comment
There was a problem hiding this comment.
VERDICT: LGTM
[Hermes] APPROVE — head fbe2a52b (P4 : +2380, notebook).
Full read du notebook (47 cellules, 19 code) via vue structurelle + vérification programmatique des gates #17040 :
- Gate placement : chaque « Lecture du résultat » est unique et placée immédiatement APRÈS sa cellule de code (le warning « headers dupliqués » de l'analyse structurelle reflète la répétition du titre de série, pas un empilement de prose — zéro séquence 2+ markdown).
- Gate valeurs : toutes les valeurs citées sont présentes dans les outputs committés — vérifié point par point (27 %/57 % GPT-4/5, lexique 234377, 22/37/41/42 sur 54, stabilité 54/54 mini, moyennes 0.803/0.786, et le claim « douze échecs sur 104 réponses » re-dérivé exact : K 1/24 + RW 4/20 + M 1/24 + R 4/20 + S 2/16 = 12/104).
- MS = 0 partout avec IC [0.00-0.00] : le motif central de R13 est reproduit, pas asserté.
- Exercices : 3 stubs TODO à sortie « à compléter », aucune solution leakée.
- Secrets : zéro pattern sensible ; clés lues via
.envet masquées dans les outputs (« cle configuree (masquee) »). - Articulation : chaque section sert l'arc (cadre R13 → batterie → exécution → radar → agrégats → stabilité → contortions → cube A×G×I) ; pas de prose de remplissage.
Ligne README ajoutée, tag grain conforme. Rien de bloquant.
|
✅ No prose/output mismatch detected in the notebooks this PR changed. Scope = notebooks CHANGED in this PR, not the whole corpus. Explicit |
|
G-VAR-2/3 GENRE signals (advisory, non bloquant, #10020).
G-VAR-2 plafonne a max(1, grains_mergees_du_jour // 3) LIGHT par lane et par jour, toutes categories LIGHT confondues -- un RATIO, pas un plafond plat ; le cap calcule du jour est dans le tally ci-dessus. G-VAR-3 interdit deux genres LIGHT consecutifs. Les signaux ci-dessus rendent le fait VISIBLE (labels |
Notebook outputs-required (H.4 schema): PASS (every code cell carries an
|
Golden-Set Execution (H.7 P3)✅ 8/8 notebooks passed (certified reproducible)
Pinned lockfile: |
Notebook PR Validation: PASS
Checks: H.1 (no errors), H.3 (execution_count), C.1 (no banned patterns) |
Path-collision (organ #13359/#13615)Cette PR #17454 (
|
|
[ADJOINT PREFLIGHT] Note pour la lecture B.0 finale d'ai-01 : le body déclare un écart avec #16755, qui demandait la batterie « sur nos modèles hébergés ». TGWUI medium répond 401 et mini 000 ; le verdict est RECOVERABLE-USER-HAND, et la reprise est tracée en #17458 (OPEN). Cet écart est écrit, pas maquillé. Le credential est la question Q3 du registre user.
|
…e ref cassait check-navlinks) Le merge de main (update-branch) a apporte 22b dont les liens ./23_TAL pointent vers un fichier que cette branche deplace en NLP/01 : conflit semantique sans chevauchement textuel, 2 NEW broken navlinks sur le merge ref. Cibles redirigees vers ../../NLP/01_TAL_Du_Mot_Aux_Dependances.ipynb, scan --check complet 0 NEW broken (1369 notebooks). See #16271 Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com>
… 23-26 vers NLP/ (#16713) * feat(nlp,#16271): serie TAL dediee — migration atomique des notebooks 23-26 vers MyIA.AI.Notebooks/NLP/ git mv x4 avec renumerotation (23->01 TAL, 24->02 NGrammes, 25->03 CRF, 26->04 PCFG/CYK) + README FR de serie. Preservation byte-for-byte des notebooks : seuls les liens markdown internes sont recables (9 lignes, remplacement binaire sans round-trip JSON) — cellules code, outputs et execution_count intacts (exception C.2 markdown-only). Recablage externe : _quarto.yml, docs/curriculum/genai.md, deck TAL (slides.md — liens retargetes + GAP lines mises a jour : n-grammes/CRF/ CYK comblees par 02/03/04, note historique preservee), README GenAI/Texte (Tier 7 remplace par pointeur vers NLP). Catalog byte-identique. Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com> * fix(nlp,#16271): corriger profondeur lien NLP depuis GenAI/Texte (../../NLP) check-links attrape ../NLP/README.md depuis GenAI/Texte/README.md:121 : ../ depuis Texte/ atterrit sur GenAI/, pas sur MyIA.AI.Notebooks/ - la serie NLP est a ../../NLP/. Erreur de profondeur dans la prose de migration, reproduction locale exacte, 0 autre occurrence repo-wide. Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com> * fix(slides,#16271): deck 09 -- le gap n-grammes declare ligne 132 contredisait l'agenda ligne 73 et la serie migree La slide 5 declarait « aucun notebook n'implemente les modeles n-grammes » alors que l'agenda (ligne 73) lie deja 02_NGrammes_Modeles_De_Langue et que cette PR migre le notebook dans la serie NLP. Le callout devient le renvoi au notebook, meme formulation que l'agenda (gap comble #16235/#16246). Point de contenu constate par l'adjoint myia-po-2025:CoursIA-2 au head b633493 -- grep de verif rend vide au nouveau head. Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com> * Fix: retarget 3 notebook links in S3-acculturation deck after TAL migration The deck pointed to the pre-migration GenAI/Texte paths that 404 after the #16271 series move. Link-only change, no re-execution. Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com> * Fix: navlinks 22b vers NLP/01_TAL -- conflit croise avec #17454 (merge ref cassait check-navlinks) Le merge de main (update-branch) a apporte 22b dont les liens ./23_TAL pointent vers un fichier que cette branche deplace en NLP/01 : conflit semantique sans chevauchement textuel, 2 NEW broken navlinks sur le merge ref. Cibles redirigees vers ../../NLP/01_TAL_Du_Mot_Aux_Dependances.ipynb, scan --check complet 0 NEW broken (1369 notebooks). See #16271 Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com> --------- Co-authored-by: Claude Sonnet 5 <noreply@anthropic.com> Co-authored-by: myia-po-2023 <jsboige+myia-po-2023@gmail.com>
… 23-26 vers NLP/ (#16713) * feat(nlp,#16271): serie TAL dediee — migration atomique des notebooks 23-26 vers MyIA.AI.Notebooks/NLP/ git mv x4 avec renumerotation (23->01 TAL, 24->02 NGrammes, 25->03 CRF, 26->04 PCFG/CYK) + README FR de serie. Preservation byte-for-byte des notebooks : seuls les liens markdown internes sont recables (9 lignes, remplacement binaire sans round-trip JSON) — cellules code, outputs et execution_count intacts (exception C.2 markdown-only). Recablage externe : _quarto.yml, docs/curriculum/genai.md, deck TAL (slides.md — liens retargetes + GAP lines mises a jour : n-grammes/CRF/ CYK comblees par 02/03/04, note historique preservee), README GenAI/Texte (Tier 7 remplace par pointeur vers NLP). Catalog byte-identique. Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com> * fix(nlp,#16271): corriger profondeur lien NLP depuis GenAI/Texte (../../NLP) check-links attrape ../NLP/README.md depuis GenAI/Texte/README.md:121 : ../ depuis Texte/ atterrit sur GenAI/, pas sur MyIA.AI.Notebooks/ - la serie NLP est a ../../NLP/. Erreur de profondeur dans la prose de migration, reproduction locale exacte, 0 autre occurrence repo-wide. Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com> * fix(slides,#16271): deck 09 -- le gap n-grammes declare ligne 132 contredisait l'agenda ligne 73 et la serie migree La slide 5 declarait « aucun notebook n'implemente les modeles n-grammes » alors que l'agenda (ligne 73) lie deja 02_NGrammes_Modeles_De_Langue et que cette PR migre le notebook dans la serie NLP. Le callout devient le renvoi au notebook, meme formulation que l'agenda (gap comble #16235/#16246). Point de contenu constate par l'adjoint myia-po-2025:CoursIA-2 au head b633493 -- grep de verif rend vide au nouveau head. Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com> * Fix: retarget 3 notebook links in S3-acculturation deck after TAL migration The deck pointed to the pre-migration GenAI/Texte paths that 404 after the #16271 series move. Link-only change, no re-execution. Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com> * Fix: navlinks 22b vers NLP/01_TAL -- conflit croise avec #17454 (merge ref cassait check-navlinks) Le merge de main (update-branch) a apporte 22b dont les liens ./23_TAL pointent vers un fichier que cette branche deplace en NLP/01 : conflit semantique sans chevauchement textuel, 2 NEW broken navlinks sur le merge ref. Cibles redirigees vers ../../NLP/01_TAL_Du_Mot_Aux_Dependances.ipynb, scan --check complet 0 NEW broken (1369 notebooks). See #16271 Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com> --------- Co-authored-by: Claude Sonnet 5 <noreply@anthropic.com> Co-authored-by: myia-po-2023 <jsboige+myia-po-2023@gmail.com>
Grain: DEEP/genai — lane myia-po-2025:CoursIA — prev: MED/notebook-python #17383
See #16755 (part of #16741, arc B)
Ce que la PR ajoute
Un nouveau notebook
MyIA.AI.Notebooks/GenAI/Texte/22b_Profil_Cognitif_CHC.ipynb(47 cellules, 19 de code, exécuté de bout en bout), plus sa ligne dans le README de la série.Argument pédagogique de la lettre
22b(règle d'accrétion) : le notebook 22 évalue ce qu'un modèle écrit (BLEU, ROUGE, juge LLM) ; le 22b évalue le générateur lui-même, par son profil de capacités. Il approfondit le palier 22 sans prolonger le survol : on peut sauter le 22b et suivre le parcours canonique 22 → 23.Contenu, dans l'ordre de l'issue :
nltk, MS en session neuve)La section 6 rejoue la batterie entière sur les modèles d'API pour mesurer la stabilité à T=0.
Trois exercices en §9 (C.1 : stubs
None # TODO etudiant/print("Exercice ... a completer"), aucune erreur volontaire) : rotation de liste dans le générateur WM, reformulation d'items (sensibilité au prompt), placement sur le cube.Résultats mesurés (run du 2026-09-22)
Les plafonds disent que nos items sont faciles, pas que ces modèles égalent GPT-5 : le notebook le dit explicitement et compare les formes, pas les rayons.
Ce que la mesure montre, et que les lectures du notebook développent :
[0.00-0.00]), WM second creux, K et M au plafond ;qwen3.6-flashpremier (0,803 contre 0,786), le compte d'items metgpt-4.1-minipremier (42 contre 41), le minimum et la moyenne géométrique valent 0 pour tous ;gpt-4.1-nanorépond « trophy » aux deux variantes du Winograd, et commet l'erreur5.11 > 5.9citée par R13 ;gpt-4.1-nanoetgpt-4.1-mini, le piège sur notre propre dépôt attrape les quatre ;gpt-4.1-nanoetgpt-4.1-mini, 52/54 pourqwen3.6-flash(deux items à sortie longue).Deux limites d'instrument écrites dans le notebook plutôt que cachées : le lexique
nltkrejette de vrais mots (racecar,stats,quasar...), affichés à part comme faux négatifs, sans effet sur les scores de ce run car tous les modèles d'API dépassent la cible sans eux ; la table « rappel de mots inventés » contient aussi l'itemWM-r13(la liste[10, 20, 30]de R13), ce que la lecture signale.Verdict SOTA
Sur ce qui est livré : SOTA-OK. Toutes les sorties sont de vrais appels de modèle, et aucune n'est fabriquée ni de substitution. Les fournisseurs effectivement utilisés :
Qwen/Qwen3.5-0.8Btransformers(décodage glouton)gpt-4.1-nano,gpt-4.1-miniqwen3.6-flashLes clés sont lues dans l'environnement et
_masquerretire URL et préfixes de clé de tout message d'erreur (0 erreur d'appel dans ce run).Écart avec l'issue, écrit plutôt que tu. #16755 demandait la batterie « sur nos modèles hébergés ». Ces services n'ont pas pu être appelés depuis cette lane. Mesure sans clé, code HTTP seul,
GET /v1/models, les deux fois :GenAI/.env)TGWUI_MEDIUM_API_URL(Qwen3.5-35B-A3B)TGWUI_MINI_API_URL,_MICRO_,_LARGE_La reprise est tracée dans #17458 : ajouter une route hébergée conditionnelle à la clé, ajouter
Qwen3.5-35B-A3B, ré-exécuter, puis réécrire les lectures chiffrées. Le modèle local est de la même famille (Qwen3.5, 0,8 B). Le comparer au 35B-A3B isolera donc l'effet de la taille à famille fixe.Choix d'instrument écrit dans le notebook : aucun juge LLM (le 22 a montré ses biais), des correcteurs mécaniques testés sur des réponses fictives avant tout appel ; un budget de jetons par domaine (16 pour S, 400 pour M), et la section des échecs qui sépare les faux négatifs du correcteur des vraies erreurs.
Preuves d'exécution
coursia-ml-training: 47 cellules, 19 de code,execution_count1 → 19 sans trou, 0 sortieerror, 0 erreur d'appel de modèle (216 réponses dans la batterie principale, 162 dans le rejeu).grep -nE "raise NotImplementedError|assert False|1/0"ne trouve qu'une occurrence de1/0à l'intérieur d'une image PNG encodée en base64 ; aucune dans le code. Les trois exercices s'exécutent et affichent « Exercice ... a completer ».grepsursk-,C:\\Users, le nom du compte, les domaines des fournisseurs : 0).metadata.papermillne porte que des noms de fichiers.python scripts/notebook_tools/check_slot_reservation.py:VERDICT: OK -- aucun slot en conflit(slotGenAI/Texte/22blibre, 301 PR ouvertes interrogées).python scripts/ci/fast_lane.py --dry-runen local : pas de mesure valable, interrompu. La relance non tamponnée a annoncé1045 fichier(s) modifie(s) contre mainpour une PR qui en touche deux : elle comparait la tête à une branchemainlocale périmée, pas à la base de la PR. Le verdict qui fait foi est celui des check-runs de cette PR.Sources
G:\Mon Drive\MyIA\IA\Bibliographie IA\XAI\2025 - Hendrycks et al - A Definition of AGI.pdf(sha89D739CEC). Pages citées dans le notebook vérifiées sur le PDF.G:\Mon Drive\MyIA\IA\Bibliographie IA\XAI\2026 - Casper et al - The 2026 Singapore Consensus on Global AI Safety Research Priorities.pdf(sha8134E9DA8).Hors périmètre / à savoir
COURSE_CATALOG.*, les blocsCATALOG-STATUSet_quarto.ymlne sont pas touchés : ils appartiennent à l'automatisation. Le compteurpedagogical_count: 30du README sera recalculé par elle.NLP/) modifie le même README quelques lignes plus bas : conflit textuel trivial attendu pour celle qui merge en second, sans recouvrement de contenu.See #16755et nonCloses: la fermeture reste au coordinateur après relecture.🤖 Generated with Claude Code