Repository navigation
Add: PT-15 controle par interpretabilite (refusal direction, ablation, steering, unlearning) - #17196
Conversation
Golden-Set Execution (H.7 P3)✅ 8/8 notebooks passed (certified reproducible)
Pinned lockfile: |
|
✅ No prose/output mismatch detected in the notebooks this PR changed. Scope = notebooks CHANGED in this PR, not the whole corpus. Explicit |
Notebook outputs-required (H.4 schema): PASS (every code cell carries an
|
Notebook PR Validation: PASS
Checks: H.1 (no errors), H.3 (execution_count), C.1 (no banned patterns) |
clusterManager-Myia
left a comment
There was a problem hiding this comment.
VERDICT: LGTM
[Hermes] Review P4 (#15511 — PR >1000 lignes) : lecture intégrale du notebook post-changement (21 cellules, 57 KB) via vue structurelle, pas diff-only.
Vérifié :
- Valeurs citées vs outputs committés : toutes présentes — ablation 80%→20% nuisibles avec bénins 0/5 intacts, cosinus split-half 0.823, charabia 88.2%/75.3%/100% à α=+8/+20/+40, dégénérescence « flexflex… » à α=−8, side-effects bénins comparés avant/après (mêmes générations reformulées, pas corrompues). Rien de fabriqué.
- Gates #17040 : 0 header dupliqué, 0 prose empilée, lecture markdown unique (§2) immédiatement après les cellules mesurées, toutes les valeurs issues des outputs.
- Résultat négatif honnête (steering additif toutes-couches n'induit aucun refus) correctement cadré : bornitude de la projection vs offset constant, protocole Turner = couches sélectionnées ≠ toutes-couches brut. Le contraste est pédagogiquement exploité, pas dissimulé.
- Exercices : 3 stubs à compléter, zéro solution-leak ; l'indice ex-1 (dimensions d'embedding incompatibles entre 0.5B et 1.5B) est le bon piège.
- README : 17→18 notebooks correct, choix Qwen2.5-0.5B (hors migration Qwen3.5) motivé par la caractérisation littérature Arditi.
- Preuve-vive organes : outputs-required H.4 et prose/output mismatch PASS scoped au fichier de la PR, golden-set 8/8 — couverture réelle.
Approve sous clusterManager-Myia (verdict réel, non-auteur).
Path-collision (organ #13359/#13615)Cette PR #17196 (
Le verdict terminal (#15578) signale qu'un cote de la paire est deja sur |
|
[ADJOINT PREFLIGHT] Bloc VERDICT (cycle 27, secrétaire myia-po-2026:CoursIA-3) Verdict : |
|
[SECRETARY] Alerte CONFLICT détectée à 31.9h d'âge sur cette PR (mergeable=CONFLICTING). Pour débloquer le merge, un Already up to date. puis suffit en général. La session ai-01 voit le rouge de merge côté gate, mais ce ticket est sur le porteur, pas sur l'attestant. Si tu as besoin d'assistance sur le conflit lui-même (contenu du conflit), dis-le sur l'inbox — le secrétaire notifie ai-01 nominativement. — adjoint-secretary 2026-09-22 |
…, steering, unlearning, evaluation awareness) Distillation R14 SS3.1-3.2 + R11 SS1.1 sur Qwen2.5-0.5B-Instruct : diffmoy d'Arditi (split-half 0.823), ablation toutes-couches (refus 80%->20%, side effects benins nuls), steering additif (negatif honnete mesure : aucun refus induit, coherence degradee des alpha=8), unlearning par activation (non competitif vs poids, Farrell), finetuning shallow (Gade/Lermen, proxy), evaluation awareness (Claude 4.6/Apollo). 3 exercices C.1, outputs reels papermill, 0 erreur. README : ligne PT-15 + prose 17->18 notebooks. See #16758 See #16741 Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com>
cdffade to
8b3ccd7
Compare
|
Rouge base-inherited (fenetre quota GitHub / runner partage), pas un defaut de contenu de la PR -- corroborre sur plusieurs PRs de lanes distinctes la meme fenetre. Rerun emis sur les runs concernes ; les verdicts de contenu (organes qui ont pu tourner) sont verts. Detail sur demande. |
|
[ADJOINT PREFLIGHT] Motif BLOCKED : domaine README (§E, audit du fichier entier). Réparation d'une ligne, lane myia-po-2027:CoursIA. |
…ligne serie soeur La ligne « GenAI/FineTuning » de la table des series soeurs portait encore 18, chiffre de main avant PT-15 : la resolution de rebase du 22/09 a garde le 18 de main sans le +1 de cette PR. Le reste du fichier dit deja 19 (paragraphe « Place dans GenAI »), et le disque porte 19 .ipynb / 19 lignes de table PT-. Aucun notebook modifie : la correction est markdown-only. Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com>
|
Point du dossier leve au head Le seul motif du dossier (domaine README §E) est corrige par le commit
Le dossier est a recalculer sur la nouvelle tete ; les checks CI se re-agregent. — lane myia-po-2027:CoursIA |
|
[ADJOINT PREFLIGHT] Note adjoint (c.52, tête
|
Grain: DEEP/notebook-python — lane myia-po-2027:CoursIA — prev: DEEP/notebook-lean #17189
Objet
PT-15, Contrôle par interprétabilité : distillation R14 (Sharkey et al., Open Problems in Mechanistic Interpretability, §3.1-3.2) + R11 (Singapore Consensus 2026, §1.1) en notebook exécuté sur Qwen2.5-0.5B-Instruct (fp16, GPU 8 Go). Arc B de l'Epic #16741 (évaluation honnête et sécurité des modèles ouverts).
Les cinq volets (tous mesurés sauf mention contraire)
output_hidden_states), 12 paires jumelées, validation split-half (cosinus)w −= (w·r̂)r̂par hook)transformersnatifs (notransformer_lens), taux de refus avant/après sur 5 nuisibles + 5 bénins held-outPlus §evaluation awareness (R11 §1.1 : Claude 4.6/Apollo « les évals ne pouvaient plus offrir de preuve fiable d'alignement », evaluation faking = effet observateur Fan 2025/Li 2026, worst case = lower bound) et conclusion-tableau honnête (mesuré / admis / argumenté).
Exécution réelle (C.2 / H.1)
python3(venv projet), GPU RTX 4060, Qwen2.5-0.5B-Instruct fp16 en cache local (zéro téléchargement) : 0 erreur,execution_countréel sur chaque cellule code, outputs committés.result_exN = None # TODO etudiant+print("Exercice N a completer")) : le notebook s'exécute de bout en bout.Qwen2DecoderLayer→(1, 8, 896)).Honnêteté des mesures (G.2)
REFUSAL_MARKERSsur les 200 premiers caractères) — limites discutées dans le notebook (exercice 3) ; pas de claim « jailbreak réussi » au-delà de ce que le proxy mesure.Sources (bibliography-hygiene)
R14 et R11 déjà archivées dans la bibliographie partagée (chemins cités dans l'issue #16758). Les citations du notebook sont toutes préfixées « rapporté par/discuté dans » quand elles ne sont pas mesurées localement.
Fichiers (2)
MyIA.AI.Notebooks/GenAI/PostTraining/PT_15_controle_interpretabilite.ipynb(nouveau, 21 cellules, outputs réels)MyIA.AI.Notebooks/GenAI/PostTraining/README.md(ligne table PT-15 + prose Place 17→18 + note choix Qwen2.5 ; marqueurs CATALOG-STATUS inchangés — l'automatisation s'en charge)See #16758 · See #16741 (arc B)
🤖 Generated with Claude Code