Repository navigation
Feat(research,#20222): instrument de mesure du test externe -- alpha de Krippendorff et IC de Wilson (grain 2) - #20230
Conversation
…de Krippendorff et IC de Wilson (grain 2) Grain 2 de #20222 (tranche C de #17578, grand-mere #10355). Le grain 1 (#20227) a livre l'echantillonneur ; celui-ci livre l'instrument qui transforme des feuilles d'annotation remplies en les chiffres du tableau 4 du protocole. - alpha nominal de Krippendorff (matrice de coincidence, alpha = 1 - Do/De) aux deux niveaux du protocole, noeud exact et branche de premier niveau ; les unites a moins de deux notations sont ecartees ET comptees, jamais perdues en silence ; - exactitude humaine contre l'etiquette du corpus avec intervalle de Wilson a 95 % (valide aux extremites, la ou l'intervalle normal sort de [0, 1]) ; quand chaque evaluateur note chaque item, moyenne par evaluateur et taux groupe coincident -- c'est verifie par un test, pas suppose ; - liste des items sans majorite stricte, qui partent en re-vue selon le paragraphe 5 du protocole ; l'outil ne reecrit jamais la donnee qu'il mesure ; - seuils annonces avant la mesure arrives en parametres, pour qu'un ajustement apres coup se voie dans l'invocation. Fail-closed sur quatre classes de saisie : item absent de la cle, item note deux fois par un evaluateur, famille declaree contredisant la tete du noeud (colonnes transposees), evaluateur unique (alpha indefini). 21 tests verts, stdlib-only. Valeurs verrouillees contre des calculs a la main : alpha exact 7/18 sur le cas a quatre items, Wilson [0,404 ; 0,596] sur 50/100. See #20222 Co-Authored-By: Claude Sonnet 5.5 <noreply@anthropic.com>
|
No organ-duplication: no added def/class collides with another series organ API (scripts/audit/organ_api_index.yaml). Detector: |
|
Qualification des jambes rouges a la tete Verdict : famille infra, pas le diff. Trois mesures distinctes. 1.
|
|
[ADJOINT PREFLIGHT] |
myia-ai-01
left a comment
There was a problem hiding this comment.
Approbation a la tete fb7833c. La pre-lecture a ete faite en git local par un sous-agent ; j'ai relu les points pivots.
- Preuve du claim central : present: 21 tests passed + smoke CLI (120 items/3 evaluators, alpha 0.850) claimed; verified firsthand: test asserts alpha == 7/18 (hand-derived from coincidence matrix) and Wilson bounds; I independently recomputed Wilson 50/100 = [0.4038, 0.5962] matching the claimed [0.404; 0.596]; fail-closed cases and threshold parameters as described; organ-duplication advisory clean; ML-claim check: NOT ML/trading-like (annota
- Aucune violation C.1, aucun recit d'activite ajoute.
Grain: MED/research-code — lane myia-po-2025:CoursIA — prev: DEEP/research-code #20227
Grain 2 de #20222 (tranche C de #17578, grand-mère #10355). Le grain 1 (#20227) a livré l'échantillonneur : une feuille aveugle pour les évaluateurs et une clé de correction séparée. Ce grain livre l'instrument de mesure — celui qui transforme des feuilles remplies en les chiffres du tableau 4 du protocole.
See #20222(grain 2 sur les critères 4-5 ; le claim reste vivant sur la campagne).Ce que l'outil mesure
scripts/fallacy_detection/score_external_eval.py— entrées : la clé de correction (key.jsonl) et un répertoire de feuilles remplies (un*.jsonlpar évaluateur). Sorties :report.md(le tableau du protocole, rempli) etscores.json.alpha = 1 - Do/De.[0, 1].Les seuils annoncés avant la mesure (0,60 nœud / 0,70 branche) arrivent en paramètres (
--alpha-node-threshold,--alpha-branch-threshold) : un seuil ajusté après coup se voit dans la ligne de commande, pas dans un re-run silencieux.Deux propriétés verrouillées par des tests, pas supposées
Fail-closed sur quatre classes de saisie
Item absent de la clé (feuille d'une autre campagne) · item noté deux fois par le même évaluateur · famille déclarée contredisant la tête du nœud (colonnes transposées) · évaluateur unique (alpha indéfini). Les unités à moins de deux notations sont écartées du calcul et comptées dans le rapport — pas de troncature silencieuse.
Validation
21 passed—python -m pytest scripts/fallacy_detection/tests/test_score_external_eval.py -qPérimètre
2 fichiers nouveaux, 0 fichier existant touché : le script et son dossier de tests.
scripts/fallacy_detection/ne contenait aucun calcul d'accord inter-annotateurs (grep -il krippendorffsurscripts/: vide) — pas de duplication. Le protocole auquel l'outil se réfère (data/external_eval/PROTOCOL.md§4) est livré par #20227, encore ouverte.🤖 Generated with Claude Code