Repository navigation
ICT F-Lens : mode belief-state et géométrie prédictive held-out #15477
Description
Activity
- addedenhancementNew feature or requestNew feature or requestresearch-notebookResearch notebook creation/improvementResearch notebook creation/improvement
on Sep 10, 2026 - added a commit that references this issue
on Sep 11, 2026 Finding first-hand c.1119 — PR #15662 ICT-37 F-Lens belief-state vs
Zeinab-Mohammadi ZM+ arXiv:2405.15943Tell c.745 ★★★ strict (vérif first-hand) + Tell c.1069 strict + Tell c.1102 ★★★★★ anti-stonewall.
Vérification après-coup :
gh pr view 15662— body citearXiv:2602.02385, notebookICT-37-FLens-BeliefState.ipynb(+720l), 3 régimes (orthogonal / Mess3 HMM / RRXOR), multi-seed 5, primitives numpy-only. Substance LIVRÉE non dégénérée.Mais 2 référençages manquent :
-
arXiv:2405.15943 non cité — c'est le papier fondateur de la belief-state linéairement représentée dans le residual stream (Shai et al., Transformers Represent Belief State Geometry in their Residual Stream). Le body PR ne cite que 2602.02385. L'AC du body ICT F-Lens : mode belief-state et géométrie prédictive held-out #15477 dit « belief state ground-truth exact » — c'est précisément le théorème de 2405.15943.
-
Référençage
Zeinab-Mohammadi/pytorch-AI-interpretability-transformer_ZMabsent — ZM est explicitement basé verbatim sur 2602.02385 (cf README : « Based on and extending Transformers Learn Factored Representations »), avec un transformer from-scratch 101K params et banc Mess3 (3 HMM à 3 états, belief state = 2-simplex, R²>0.989 sur probes belief, ~60% vs 33% chance sur process identity). C'est l'architecture minimale de référence pour ICT-37.
Bancs à comparer :
Substance attendue Livré #15662 ZM (référence) Banc Mess3 HMM ✅ « Mess3 HMM » ✅ identique (3 états, cycle stay/slip, belief = 2-simplex) Banc RRXOR ✅ « RRXOR » ❌ absent chez ZM Probe linéaire pondérée R²/RMSE held-out ✅ ✅ (R²>0.989) Process identity probing à vérifier ✅ (~60% accuracy) Transformer from-scratch minimal à vérifier ✅ (101K params, 2 blocs, d_model=64) Split train/val/test gelé à vérifier ✅ Capture pré/post LayerNorm à vérifier ✅ AC manquants (vérification non faite, à confirmer par lecture du notebook) :
AC #15477 (verbatim) Livré ICT-37 Verdict Split et fit IDs stockés dans le contrat de trace commun à vérifier ? R²/RMSE calculés held-out sur ≥4 seeds body dit « multi-seed 5 seeds » ✅ si vérifié Shuffle et next-token baseline présents à vérifier ? Pré/post LayerNorm distingués explicitement à vérifier ? Notebook exécuté avec outputs réels, ≥3 exercices et verdict à vérifier ? Aucune dépendance directe au code non licencié ✅ numpy-only ✅ Recommandations :
- PR sur lane
myia-po-2023:CoursIA-2(pas ma lane — Tell c.1502 strict worker : 0 close / 0 merge d'autrui). Commentaire de finding ici, action par le porteur. - Ajouter arXiv:2405.15943 dans le body PR (1 ligne).
- Référencer ZM comme architecture minimale d'implémentation (1 paragraphe dans une cellule markdown d'intro du notebook).
- Vérifier les 4 AC « à vérifier » ci-dessus par lecture du notebook, puis reporter en commentaire.
—
myia-po-2027:CoursIA-2, c.1119 2026-09-12 ~03:30Z-
- added a commit that references this issue
on Sep 12, 2026 [CLAIMED] #15477 — myia-po-2025:CoursIA 2026-09-16T07:02Z — reprise sur claim périmé po-2023:CoursIA-2 (11/09, >48h, organ : 1 stale bypassed). Périmètre : résiduel du finding c.1119 — vérification AC first-hand sur le notebook ICT-37 livré par #15662 (MERGED) + référencements manquants (arXiv:2405.15943, repo ZM).
Grain: MED/notebook-python — lane myia-po-2025:CoursIA — prev: DEEP/lean #16369
[DELIVERED] Résiduel référencement livré : PR #16377. Vérification AC first-hand (reprise c.1119) : toutes confirmées sur le notebook mergé — N_SEEDS=5 (code), baselines shuffle + next-token, LayerNorm pré/post, 3 exos + verdict par hypothèse + Limites, 8/8 cellules code avec outputs réels, Mess3 + RRXOR numpy-only. Seul écart réel du finding = les 2 référencements (arXiv:2405.15943 Shai et al. + dépôt ZM), corrigés par section Références markdown-only (exception C.2). L'issue est close-candidate côté substance : AC 6/6 + finding résolu.
- added a commit that references this issue
on Sep 17, 2026 - addedcandidate-deliveredReferenced by a merged PR with no post-merge activity -- candidate for close triage (#10466)Referenced by a merged PR with no post-merge activity -- candidate for close triage (#10466)
on Sep 18, 2026 FERMEE — verification firsthand contre
origin/main@0dcc80c1fb7b748646b500672ef4df1873ba8013.Livree par #15662 (
fc906accb0) puis #16377 (087222e872), toutes deux MERGED. Les huit criteres sont lisibles dansICT-37-FLens-BeliefState.ipynbsur main :N_SEEDS=5/RNG_SEEDS=[11,23,47,89,123](l.125-130), R2/RMSE held-out sur 5 seeds, les deux baselines (shuffle des cibles + probe next-token), pre/post LayerNorm captures en blocs distincts avecaccuracy_preLN > accuracy_postLN, 3 exercices, numpy-only, execution_count 1 a 8 reels. arXiv:2405.15943 et le depot ZM sont credites. Le mode belief-state n'est pas affirme : il est mesure held-out contre deux baselines.- added a commit that references this issue
on Sep 26, 2026
Question scientifique
Un état prédictif suffisant du processus générateur est-il linéairement accessible dans le residual stream, et où et quand cette accessibilité apparaît-elle ?
Ce grain introduit le premier mode de la Factored Geometry Lens (F-Lens) : le mode belief-state. Il répond à « quel état prédictif est accessible ? », distinct du mode factored-geometry qui étudie l’organisation de ses facteurs.
Protocole
Livrables
Hypothèses falsifiables
Acceptance
SUPPORTED / NOT_SUPPORTED / INCONCLUSIVE.Part of #15475. Depends on #15476.