Repository navigation
feat(genai,#2161): 04-Tokenisation - enonces markdown pour les 3 exercices (couche placement) - #16366
Conversation
…s de 04-Tokenisation-From-Scratch See #2161 Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com>
|
Scope = notebooks CHANGED in this PR, not the whole corpus. Explicit |
Notebook PR Validation: PASS
Checks: H.1 (no errors), H.3 (execution_count), C.1 (no banned patterns) |
|
Grain tag obligatoire (#10045, bloquant).
Pour passer ce gate, le body doit porter en tete une ligne de la forme : Le |
Notebook outputs-required (H.4 schema): PASS (every code cell carries an
|
Golden-Set Execution (H.7 P3)✅ 8/8 notebooks passed (certified reproducible)
Pinned lockfile: |
clusterManager-Myia
left a comment
There was a problem hiding this comment.
[NanoClaw] structural review (protocole glm-5.2 : notebook sondé en JSON direct au head 5c3165c0 ET au base a65b996 — cellules comparées byte-à-byte avec ordre/ids, énoncés des 3 nouvelles cellules confrontés chiffre par chiffre aux outputs committés ; jamais le diff)
VERDICT: LGTM (vérifié : markdown-only au byte près — 12/12 cellules code byte-identical base↔head, séquence des 32 cellules préservée ordre+ids, exactement 3 cellules md neuves chacune devant son stub ; chaque ancre chiffrée des 3 énoncés retrouvée dans les outputs)
Garanties du body re-vérifiées (P5)
- 32 → 35 cellules : les 32 cellules du base apparaissent au head dans le même ordre relatif, byte-identical (ids préservés) ✓ ; les 3 neuves sont markdown, insérées exactement devant les 3 stubs code
print("Exercice N a completer")— stubs inchangés ✓. - 12/12 cellules code byte-identical (source, outputs, execution_count) ✓ — le claim fort est exact à l'octet ; exception C.2 légitime (markdown-only, pas de re-exécution requise).
- La correction transparente est vraie : les 3 stubs existaient au base (vérifié par la byte-identité) — le re-scope « couche de placement, pas ajout en double » décrit bien le diff réel.
- 0 banned pattern, 0 secret ✓.
Les 3 énoncés ancrés dans les outputs committés (concept vérifié)
- Ex1 : les 60 fusions et l'ordre d'émergence (
'e'+'</w>' → 'e</w>'en fusion n°1, puis digrammes, puis mots) sont dans l'output de la section 4 ✓ — l'ancrage fréquentiel du BPE est pédagogiquement juste. - Ex2 : «
1234s'encode en quatre tokens (un par chiffre) » — l'output dit exactement'1234' | [16, 17, 18, 19] | 4✓ ; la question « 3.14 vs 3,14 » exploite correctement la dépendance du vocabulaire BPE au corpus. - Ex3 : « 3 chunks en mots, 7 avec le BPE-80, 4 avec le Qwen » — la table committée dit mots 299→3, BPE-80 819→7, Qwen 419→4 ✓ ; « ~3,0 tokens/mot BPE-60 » = 2.997 mesuré ✓ ; « ~1,4 pour le Qwen » = 419/299 = 1.401 ✓ (le tilde est mérité). L'exercice d'estimation-puis-mesure sur chunks de 256 est une extrapolation propre de la table 128.
Note non bloquante
L'énoncé Ex3 cite trois des quatre lignes de la table (mots, BPE-80, Qwen) et passe le BPE 20 (1145 tokens → 9 chunks) sous silence — sélection cohérente avec la question posée, aucune inexactitude.
|
Trivial-diff advisory (#15740, non bloquant). |
Path-collision (organ #13359/#13615)Cette PR #16366 (
Le verdict terminal (#15578) signale qu'un cote de la paire est deja sur |
Grain: LIGHT/docs — lane myia-po-2023:CoursIA — prev: MED/notebook-python #16364 — enrichissement exercices #2161 (enonces 04-Tokenisation)
Summary
Le notebook avait deja 3 stubs d'exercice C.1 (cells code
print("Exercice N a completer"), outputs commites) mais sans la couche markdown de la convention de placement #2161 : chaque exercice doit etre precedent d'un markdown contexte/objectif/indices (cf. style de la serie, p.ex. PyMC-03). Cette PR ajoute cette couche manquante : 3 cellules markdown inserees devant chacun des 3 stubs, ancrees au contenu reel du notebook (sections 4/6/8/9 : ordre des fusions BPE, courbe 2.997 tokens/mot a 60 fusions, chunks@128, eclatement des nombres).Correction transparente du claim
Le claim initial (issuecomment-5691770048) annoncait « 0 exercice mesure, ajout de 3 exercices stub + re-exec ». Re-mesure a la lecture du notebook : le scan comptait les headers markdown
Exercice, or les enonces vivaient en commentaires code — les 3 stubs existaient deja. Le livrable est re-scope sur la vraie lacune (couche placement), pas sur un ajout en double.Verification
1 file changed, 51 insertions(+), 0 deletions— markdown uniquementGATES OKraise NotImplementedError/assert False/1/0(grep negatif), les 3 stubsprint("Exercice N a completer")inchangesSee #2161
🤖 Generated with Claude Code