Le gap, mesuré
Le deck slides/09-traitement-automatique-langues enseigne les modèles de langue n-grammes (slides 4-7 : estimation par comptage, lissage Laplace/Kneser-Ney, perplexité, <UNK>, génération d'échantillons) — et sa table de couverture citait 23_TAL_Du_Mot_Aux_Dependances.ipynb comme owner. Label menteur, mesuré (PR #16229) : zéro occurrence de n-gramme, perplexité ou lissage dans ce notebook, qui couvre POS/dépendances/NER.
Le gap est réel sur tout le dépôt :
| Notebook |
Ce qu'il fait de la perplexité / des n-grammes |
GenAI/Texte/22_Evaluating_Generated_Text.ipynb |
n-grammes de BLEU/ROUGE (overlap de métrique d'évaluation) ; perplexité de LLM — pas un modèle de langue estimé |
GenAI/Texte/11_Quantization.ipynb |
perplexité comme métrique d'impact de quantization |
RAG-et-Memoire-Semantique/04-Tokenisation-From-Scratch.ipynb |
le token (BPE), s'arrête avant la distribution sur séquences |
Aucun notebook n'estime P(wᵢ | wᵢ₋ₙ₊₁:ᵢ₋₁) par comptage avec lissage. C'est le fondement historique que le deck 09 enseigne en section I — et le socle conceptuel de la perplexité que les notebooks 11/22/10b utilisent en aval sans jamais la construire.
Proposition
Notebook GenAI/Texte/24_NGrammes_Modeles_De_Langue.ipynb (suite directe du 23_TAL, même série) :
- Corpus français borné (pattern 23_TAL : deux domaines distincts) — tokenisation mots, vocabulaire,
<UNK>, symboles spéciaux ;
- Unigramme : MLE, perplexité mesurée, génération d'échantillons (le « logical are as are confusion... » du deck, en français) ;
- Bigramme/trigramme : perplexité comparée, le saut mesuré unigramme → bigramme (le deck cite 891 → 142 sur Book ; notre propre mesure en borne le phénomène) ;
- Lissage Laplace add-1 : l'effet mesuré, et pourquoi il écrase la distribution (paradoxe du lissage fort) ;
- Kneser-Ney interpolé from scratch : continuation counts, discount — la partie de fond ;
- Vérification contre une librairie de référence (pattern de la série, cf 22 vs sacrebleu) : perplexités from scratch vs
nltk.lm (Laplace, KneserNeyInterpolated) sur les mêmes données — valeurs attendues identiques ;
- Courbe perplexité vs n et lecture honnête (overfitting du trigramme sur petit corpus) ;
- 3 exercices C.1 (stubs propres,
pass/return None).
Acceptance
See #16229 (le gap y est documenté et mesuré). See #15023 (l'epic slides exige un owner réel par concept).
Le gap, mesuré
Le deck
slides/09-traitement-automatique-languesenseigne les modèles de langue n-grammes (slides 4-7 : estimation par comptage, lissage Laplace/Kneser-Ney, perplexité,<UNK>, génération d'échantillons) — et sa table de couverture citait23_TAL_Du_Mot_Aux_Dependances.ipynbcomme owner. Label menteur, mesuré (PR #16229) : zéro occurrence de n-gramme, perplexité ou lissage dans ce notebook, qui couvre POS/dépendances/NER.Le gap est réel sur tout le dépôt :
GenAI/Texte/22_Evaluating_Generated_Text.ipynbGenAI/Texte/11_Quantization.ipynbRAG-et-Memoire-Semantique/04-Tokenisation-From-Scratch.ipynbAucun notebook n'estime P(wᵢ | wᵢ₋ₙ₊₁:ᵢ₋₁) par comptage avec lissage. C'est le fondement historique que le deck 09 enseigne en section I — et le socle conceptuel de la perplexité que les notebooks 11/22/10b utilisent en aval sans jamais la construire.
Proposition
Notebook
GenAI/Texte/24_NGrammes_Modeles_De_Langue.ipynb(suite directe du 23_TAL, même série) :<UNK>, symboles spéciaux ;nltk.lm(Laplace, KneserNeyInterpolated) sur les mêmes données — valeurs attendues identiques ;pass/return None).Acceptance
nltk.lm(écart nul ou expliqué) ;See #16229 (le gap y est documenté et mesuré). See #15023 (l'epic slides exige un owner réel par concept).