Skip to content

GenAI/Texte: notebook modeles de langue n-grammes, lissage et perplexite (gap mesure par #16229) #16235

Description

@jsboige

Le gap, mesuré

Le deck slides/09-traitement-automatique-langues enseigne les modèles de langue n-grammes (slides 4-7 : estimation par comptage, lissage Laplace/Kneser-Ney, perplexité, <UNK>, génération d'échantillons) — et sa table de couverture citait 23_TAL_Du_Mot_Aux_Dependances.ipynb comme owner. Label menteur, mesuré (PR #16229) : zéro occurrence de n-gramme, perplexité ou lissage dans ce notebook, qui couvre POS/dépendances/NER.

Le gap est réel sur tout le dépôt :

Notebook Ce qu'il fait de la perplexité / des n-grammes
GenAI/Texte/22_Evaluating_Generated_Text.ipynb n-grammes de BLEU/ROUGE (overlap de métrique d'évaluation) ; perplexité de LLM — pas un modèle de langue estimé
GenAI/Texte/11_Quantization.ipynb perplexité comme métrique d'impact de quantization
RAG-et-Memoire-Semantique/04-Tokenisation-From-Scratch.ipynb le token (BPE), s'arrête avant la distribution sur séquences

Aucun notebook n'estime P(wᵢ | wᵢ₋ₙ₊₁:ᵢ₋₁) par comptage avec lissage. C'est le fondement historique que le deck 09 enseigne en section I — et le socle conceptuel de la perplexité que les notebooks 11/22/10b utilisent en aval sans jamais la construire.

Proposition

Notebook GenAI/Texte/24_NGrammes_Modeles_De_Langue.ipynb (suite directe du 23_TAL, même série) :

  1. Corpus français borné (pattern 23_TAL : deux domaines distincts) — tokenisation mots, vocabulaire, <UNK>, symboles spéciaux ;
  2. Unigramme : MLE, perplexité mesurée, génération d'échantillons (le « logical are as are confusion... » du deck, en français) ;
  3. Bigramme/trigramme : perplexité comparée, le saut mesuré unigramme → bigramme (le deck cite 891 → 142 sur Book ; notre propre mesure en borne le phénomène) ;
  4. Lissage Laplace add-1 : l'effet mesuré, et pourquoi il écrase la distribution (paradoxe du lissage fort) ;
  5. Kneser-Ney interpolé from scratch : continuation counts, discount — la partie de fond ;
  6. Vérification contre une librairie de référence (pattern de la série, cf 22 vs sacrebleu) : perplexités from scratch vs nltk.lm (Laplace, KneserNeyInterpolated) sur les mêmes données — valeurs attendues identiques ;
  7. Courbe perplexité vs n et lecture honnête (overfitting du trigramme sur petit corpus) ;
  8. 3 exercices C.1 (stubs propres, pass/return None).

Acceptance

  • Notebook committé avec outputs réels (C.2), papermill end-to-end 0 erreur, C.1 = 0 ;
  • Perplexité unigramme ET bigramme ET Kneser-Ney mesurées, chacune vérifiée contre nltk.lm (écart nul ou expliqué) ;
  • Génération d'échantillons unigramme/bigramme/trigramme visible en sortie ;
  • Densité prose ≥ 1200 chars/cellule code (advisory) ;
  • Le deck 09 peut citer ce notebook comme owner de « n-grammes, perplexité, lissage » en remplacement du gap (rider post-merge de feat(slides,#15023): deck 09-TAL ancre sur le corpus reel (tranche contenu) #16229).

See #16229 (le gap y est documenté et mesuré). See #15023 (l'epic slides exige un owner réel par concept).

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    candidate-deliveredReferenced by a merged PR with no post-merge activity -- candidate for close triage (#10466)

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions