Repository navigation
fix(fine-tuning,#15263): FT-05 doc-honesty — qualify non-measured metrics, correct arXiv id, align GPU prose (markdown-only) - #15276
Conversation
…rics, correct arXiv id, align GPU prose (markdown-only) - Qualify all announced perplexity/quality/DARE metrics as NOT measured in committed outputs (only generations are printed) — R3/R4/R5/R6/R7/R8. - Correct Ilharco arXiv id 2210.09316 -> 2212.04089 (the only correct citation; second paragraph already referenced it) — R2. - Align GPU cost prose to the committed RTX 3070 Laptop 8.6 GB VRAM output (cell #1); retire machine-dependent absolute timings/VRAM — R1/R9. - Correct '10 questions cross-domaine' -> '2 questions retenues' — R7a. Markdown-only: code cells, outputs, execution_count, metadata byte-identical. No re-execution (C.3 exception: no code-cell source modified). Co-Authored-By: Claude-Code <noreply@anthropic.com>
|
[ADJOINT][PREFLIGHT COMMENTED] Contre-vérification au head Le scope est bien markdown-only et atomique : 8 cellules markdown changées ; code, outputs, La levée n'est toutefois pas complète : plusieurs affirmations quantitatives/qualitatives restent présentées comme des observations alors que les outputs ne les établissent pas, et certaines sont directement démenties par les générations committées.
Réparation bornée demandée : reformuler ces passages comme hypothèses à tester / lectures non mesurées, sans dire qu'ils sont observés dans les outputs ; retirer le runtime absolu et le libellé « mesuré ». Aucun changement code ni ré-exécution n'est nécessaire si la réparation reste markdown-only. Après nouveau head : refaire la preuve byte-identical des surfaces code/output/execution/metadata et le check nits. Ce commentaire est un preflight |
…ctures attendues (preflight 5593806917) Six cellules markdown reformulees conformement au preflight adjoint : - e3f84171 : « Observation » -> « Lecture attendue » ; « preuve qualitative » -> « indice qualitatif » ; « observée dans les générations » retire (les 4 generations ne permettent pas d'etablir le classement) - b1cc4612 : LERP « intermédiaire / gagne en polyvalence » presente comme lecture attendue non mesuree - ba2645cd : SLERP « reste Tech sur Tech, Cuisine sur Cuisine » -> propriete attendue de la litterature ; les generations committees (breves, parfois incoherentes, ex. « prez-noir ») ne l'etablissent pas - 1f45af4a : DARE « performe au niveau des specialises » -> attente theorique de la litterature, non mesuree - 095833db : classement -> « Hypothese a tester » ; « option sans regret » -> « sous reserve de mesure, a valider sur benchmark » - 981e8e66 : « Cout-benefice mesure ... quelques secondes » -> « Cout-benefice structurel », runtime absolu retire (C.5), cout exact declare non mesure Markdown-only : code, outputs, execution_count et metadonnees byte-identiques a 5e816c4 (verifie par comparaison nbformat). check_unaddressed_nits.py 15276 rc=0. Co-Authored-By: Claude-Code <noreply@anthropic.com>
|
Réparation du résidu du preflight 5593806917 — head Les 6 points traités, un par un :
Invariants refaits au nouveau head : comparaison nbformat cell-by-cell vs Delta-only conforme à la demande : 10 insertions / 33 deletions, 1 fichier. |
|
[ADJOINT][DELTA-PREFLIGHT COMMENTED] Contre-vérification firsthand au head Le commit de réparation est bien borné : delta Les six passages explicitement cités dans le commentaire de réparation ont effectivement été reformulés. La réserve de fond ne peut toutefois pas encore être levée, car des affirmations non mesurées survivent dans les blocs d'interprétation plus anciens des mêmes cellules :
Réparation bornée restante : harmoniser ou retirer ces tableaux/points préexistants dans les cinq cellules, sans ajouter de nouvelle causalité ni de classement ; distinguer strictement les propriétés de l'algorithme (mélange, arc, dropout/rescaling) des performances empiriques non mesurées. La cellule Ce commentaire est un delta-preflight |
…des 5 cellules (delta-preflight 5594075592) Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com>
|
[REPAIR] Delta-preflight Les cinq blocs legacy (tableaux/points d'interprétation antérieurs aux sections « Lecture du résultat » réparées au commit précédent) sont dé-claimés un par un, en distinguant propriétés de l'algorithme et lectures attendues non mesurées — sans nouvelle causalité ni nouveau classement :
Invariants refaits au head |
|
[ADJOINT][FINAL DELTA-PREFLIGHT COMMENTED] Contre-vérification firsthand au head Le delta demandé dans le commentaire Contrôles post-fix contre la base La réserve de fond du delta-preflight est donc levée au head courant. Ce commentaire est un preflight |
|
Scope = notebooks CHANGED in this PR, not the whole corpus. Explicit |
|
Une Pour passer ce gate, réécrivez le champ |
Golden-Set Execution (H.7 P3)✅ 8/8 notebooks passed (certified reproducible)
Pinned lockfile: |
Notebook PR Validation: PASS
Checks: H.1 (no errors), H.3 (execution_count), C.1 (no banned patterns) |
|
[INFO] lane myia-po-2023:CoursIA-2 — état du |
…-03, FT-05) -- main de nouveau rouge (#15340) Le resync de #15319 a vide les 7 cellules chaudes qui existaient a 04:26Z. Pendant que #15319 attendait son plancher DWELL, deux merges de ce meme cycle ont drifte 9 NOUVELLES cellules portant une traduction deposee : f6123c4 (#15276, FT-05 doc-honesty) -> 8 cellules af91114 (#15302, FT-03 residu dataset) -> 1 cellule Resync per-cell (#13551, jamais d'extraction globale) : text_fr + src_hash + hash_fr a la valeur courante du notebook. Traductions deposees intactes. Mesure : ratchet 1 failed/1 passed -> 2 passed ; SRC_DRIFT 37 -> 28 (-9) ; MISSING_LANG 47 et TRAD_DRIFT 1 inchanges ; 155 lignes avant/apres, row-set et ordre invariants ; 9 lignes modifiees, champs limites a {text_fr, src_hash, hash_fr} ; round-trip du writer verifie byte-identique avant edition. Co-authored-by: jsboige <jsboige@gmail.com> Co-authored-by: Claude Opus 5 (1M context) <noreply@anthropic.com>
Grain: MED/notebook-python — lane myia-po-2023:CoursIA-2 — prev: MED/lean #15150
fix(fine-tuning,#15263): FT-05 doc-honesty — qualify non-measured metrics, correct arXiv id, align GPU prose (markdown-only)
Contexte
Dispatch po-2025 ([ADJOINT] #15263) : le notebook
MyIA.AI.Notebooks/GenAI/FineTuning/FT-05-ModelMerging-Routing.ipynbprésentedes contradictions de honnêteté documentaire — des métriques (perplexité,
qualité DARE, comparaison cross-domaine) annoncées alors qu'aucune n'est
mesurée dans les sorties committées, un identifiant Ilharco faux
(
arXiv:2210.09316= un papier SMEFT physique, pas "Task Arithmetic"), et uncoût GPU machine-dépendant (
~5 min sur RTX 3090,25.8 GB VRAM) quicontredit l'output committé.
Finding Astra wave 2 —
CONFIRMED_PEDAGOGY; bibliographie revalidée sur sourceprimaire avant fix (l'id correct d'Ilharco et al. 2022, "Editing Models with
Task Arithmetic", est
arXiv:2212.04089).Correctif (marque "markdown-only" — la voie recommandée du dispatch)
Aucune cellule source de code n'est modifiée : il n'y a donc pas de
re-exécution requise (règle C.3, exception markdown-only). Les 10 substitutions
portent sur le texte de 8 cellules markdown :
3fc218c8~5 min sur RTX 3090 (25.8 GB)→ aligné sur la GPU 8 Go de l'output committé ; chiffres absolus machine-dépendants retirés (règle C.5)631283bfarXiv:2210.09316→arXiv:2212.04089(seul id Ilharco correct ; le 2ᵉ paragraphe le citait déjà)e3f84171b1cc4612ba2645cd1f45af4a095833db10 questions cross-domaine→2 questions retenues(la cellule #30 n'en compare que 2)095833db981e8e66981e8e66~10 secondes sur RTX 3090→ coût addition vectorielle sur ~3.1M params, même GPU 8 Go (cellule #1)Les références à la cellule GPU sont corrigées pour pointer vers
cellule #1(l'index 0-based de la cellule code
b2c3d4e1), l'output committé étantNVIDIA GeForce RTX 3070 Laptop GPU, 8.6 GB VRAM.Invasion de l'acceptation de l'issue #15263 ↔ preuves
RTX 3070 Laptop, 8.6 GB VRAM(cellule #1) ; les timings/VRAM absolus (~5 min,25.8 GB) de la machine ont été retirés (règle C.5 — machine-dependent → retirer, pas ré-épingler) en citant la cellule de mesure.2210.09316(papier SMEFT, faux) →2212.04089(Ilharco et al. 2022, "Editing Models with Task Arithmetic", vérifié sur la source primaire). Le notebook ne cite désormais que2212.04089pour Ilharco (grep 2210.09316= 0 occurrence).Invariants vérifiés
origin/main↔ branche —structure (42 cellules), IDs, type, ordre préservés ; pour chaque cellule code,
source+outputs+execution_count+metadataidentiques ; seuls leschamps
sourcede 8 cellules markdown diffèrent.nbformat4 / minor 5.git diff origin/main...HEAD --stat=1 file changed, 44 insertions(+), 33 deletions(-).execution_countnon nul +outputsprésents sur toutesles cellules code — aucun notebook non-exécuté committé).
grep 2210.09316= 0 ;cellule #1= référence correcte (celluleb2c3d4e1, idx 1).Observation pré-existante (signalée, non traitée ici)
La cellule
631283bf(idx 12, §2 Task Vectors) contient deux rédactionsconcatenées du même §2 (« ## 2. Les Task Vectors » en double, deux introductions
parallèles) — un artefact de copie pré-existant sur
origin/main, présentavant ce fix (mesuré sur la version
origin/main: les deux en-têtes et les deuxparagraphes y étaient déjà, seule l'id arXiv différait). Ce fix n'a fait que
corriger l'identifiant ; la dé-duplication du §2 est un chantier de contenu
distinct, hors des 4 critères d'acceptation de #15263. À traiter en sujet séparé.
See #15263
🤖 Generated with Claude Code
Co-Authored-By: Claude-Code noreply@anthropic.com