Origine
Demande user 2026-09-03 : évaluer le sérieux de la société Pathway (https://pathway.com/) et l'opportunité d'en parler dans le dépôt, à partir du papier fondateur BDH (Dragon Hatchling) arXiv:2509.26507.
Le PDF a été archivé dans la biblio canonique : G:\Mon Drive\MyIA\IA\Bibliographie IA\MachineLearning\2025 - Dragon Hatchling BDH - 2509.26507.pdf (12 MB, identité vérifiée firsthand sur le header PDF — titre/auteurs/DOI/arXivID/license arXiv-nonexclusive tous présents et corrects).
Ce qui est FACTUEL (vérifié firsthand)
Identité du papier
- Titre : The Dragon Hatchling: The Missing Link between the Transformer and Models of the Brain
- Auteurs : Adrian Kosowski, Przemysław Uznański, Jan Chorowski, Zuzanna Stamirowska, Michał Bartoszkiewicz
- arXiv : 2509.26507 (soumis 30 Sep 2025, v1)
- Pages : 62, catégorie cs.NE/AI/LG/stat.ML
- Code :
pathwaycom/bdh sur GitHub
Crédibilité des fondateurs (via arXiv)
- Jan Chorowski (CTO) — co-auteur historique des modèles d'attention avec Bahdanau/Bengio : arXiv:1506.07503 Attention-Based Models for Speech Recognition, 1508.04395 End-to-End Attention-based Large Vocabulary Speech Recognition. Recherche SOTA authentique.
- Adrian Kosowski (CSO) — ACM SPAA Best Paper, Inria tenure à 23 ans. Profil algorithmes/structures.
- Łukasz Kaiser (advisor) — co-inventeur du Transformer original (Vaswani et al. 2017).
- Zuzanna Stamirowska (CEO) — PhD Complex Systems, École Polytechnique.
Claims techniques annoncés (à évaluer)
- ARC-AGI-1 : 29.5 % Pass@2 à 0,0007 $/tâche (BDH-CQ, 150M params) — "strongest accuracy-to-cost result in our comparison" (claim de la page produit Pathway)
- Sudoku Extreme : 97.4 % solve rate sans chain-of-thought
- BABILong : 95 % accuracy à 32K context (134M params)
- Scaling laws : "BDH rivals GPT2-architecture Transformer performance on language and translation tasks, at the same number of parameters (10M to 1B)" (claim arXiv abstract)
Ce qui MANQUE / LIMITE (à investiguer par l'agent évaluateur)
- Checkpoints pré-entraînés absents — la page arXiv ne mentionne pas de release HuggingFace ou PyTorch Hub. Pour reproduire les scaling laws, il faut entraîner from-scratch à plusieurs tailles (10M, 100M, 1B) — coût d'évaluation réel élevé.
- Corpus d'entraînement non publié — token count, dataset name non précisés. Sans ça, "rivals GPT-2 at same params" n'est pas falsifiable indépendamment.
- Pas de soumission conférence visible sur la page arXiv (NeurIPS/ICLR/ICML). Pas de peer review indépendant au 2026-09-03.
- ARC-AGI-1 29.5 % Pass@2 à 150M params — claim marketing jusqu'à preuve du leaderboard semi-privé officiel. Sur le leaderboard public ARC-AGI-1 (non semi-privé), les modèles ~150M ne sont pas dans la zone SOTA — vérifier le split (public vs semi-private) avant de citer.
- License du code GitHub non vérifiée sur la page arXiv — à confirmer sur le repo direct (LICENSE file).
- Reproductibilité empirique —
pathwaycom/bdh contient-il un script d'entraînement end-to-end ou seulement l'architecture ? Quels seeds ? Quels hyperparamètres ?
Évaluation à produire
Cette issue demande à un agent-évaluateur (lane appropriée) de produire un verdict structuré sur 3 axes :
| Axe |
Question |
Verdict attendu |
| A. Sérieux scientifique |
Le papier et le labo sont-ils du SOTA authentique ou du marketing ? |
FIDÈLE / PERTE PAR COMPLAISANCE / DIVERGENCE POSITIVE |
| B. Reproductibilité |
Les claims benchmark peuvent-ils être répliqués sur machine CPU modeste (sans GPU) ? |
RECOVERABLE-LOCAL / RECOVERABLE-MACHINE / INTRINSIC |
| C. Opportunité pédagogique |
Y a-t-il un angle exploitable dans le dépôt (notebook Lean/probas/ML/Search) ? |
OUI scope proposé / NON justifié / À REVENIR dans 6 mois |
Critères d'acceptation (G.1 / G.9)
- Vérifier avant de clamer SOTA : lire le papier (62 pages) — pas seulement l'abstract ou la page produit Pathway.
- Mesurer : tenter une ré-exécution du repo
pathwaycom/bdh sur un cas simple (entraînement 10M params) avant de déclarer « reproduit » ou « non reproduit ».
- Falsifiabilité : si les scaling laws sont vraies à 1B params, BDH est un candidat sérieux pour un notebook ML ; sinon, c'est un cas d'école de « paper avec claims invérifiables ».
- Pas de promotion sans preuve : ne pas ajouter de mention dans le dépôt (README, doc, notebook) tant que les axes A et B ne sont pas validés.
Pistes d'investigation
- Lire l'abstract + intro + conclusion (15 pages). Vérifier que les claims benchmark sont sourcés avec protocoles (seeds, datasets, splits).
- Inspecter
pathwaycom/bdh : taille du repo, présence de scripts d'entraînement, présence de tests unitaires, présence de LICENSE.
- Vérifier ARC-AGI leaderboard : https://arcprize.org/leaderboard — voir si BDH-CQ y figure officiellement avec score 29.5 % sur semi-private set.
- Vérifier OpenReview : chercher "BDH" ou "Dragon Hatchling" sur https://openreview.net/ pour voir si une soumission NeurIPS/ICLR 2026 existe (deadline mai 2026).
- Comparer à la concurrence : Mamba (Albert Gu, 2023), RWKV (Bo Peng, 2023), xLSTM (Beck et al., 2024), Hyena (Poli et al., 2023) — toutes architectures "post-transformer" avec benchmarks publics. BDH a-t-il un avantage mesurable ?
- Tenter une micro-repro : entraîner BDH 10M params sur 100M tokens (PenTreebank ou WikiText-103) en moins de 24h CPU et comparer perplexité à un Transformer GPT-2 10M params équivalent. Si la perplexité est dans la marge ±10 %, claim tenu. Si >50 % écart, claim faux.
Lane recommandée
myia-po-2026:CoursIA-2 (lane ML/vision) ou tout autre worker avec capability CPU suffisant pour la micro-repro. Pas de GPU obligatoire pour 10M params. ~4-8h de travail estimé (lecture 62 pages + micro-repro + verdict documenté).
Convention G-VAR-1
Si un agent-évaluateur pioche cette issue et livre le verdict, le grain déclaré doit être Grain: DEEP/research-code (CONTENU — produit une connaissance/actionable sur le dépôt). Tier DEEP justifié par la lecture 62 pages + micro-repro empirique.
Voir aussi
Note de clôture
Cette issue ne crée pas de mention dans le dépôt. Elle demande l'évaluation. Une PR de suivi n'aura lieu que si les axes A et B retournent « FIDÈLE + RECOVERABLE-LOCAL/MACHINE ». Sinon, le verdict est consigné en commentaire d'issue et la biblio canonique reste l'unique trace.
— myia-po-2024:CoursIA-2 (c.887, à la demande user)
Origine
Demande user 2026-09-03 : évaluer le sérieux de la société Pathway (https://pathway.com/) et l'opportunité d'en parler dans le dépôt, à partir du papier fondateur BDH (Dragon Hatchling) arXiv:2509.26507.
Le PDF a été archivé dans la biblio canonique :
G:\Mon Drive\MyIA\IA\Bibliographie IA\MachineLearning\2025 - Dragon Hatchling BDH - 2509.26507.pdf(12 MB, identité vérifiée firsthand sur le header PDF — titre/auteurs/DOI/arXivID/license arXiv-nonexclusive tous présents et corrects).Ce qui est FACTUEL (vérifié firsthand)
Identité du papier
pathwaycom/bdhsur GitHubCrédibilité des fondateurs (via arXiv)
Claims techniques annoncés (à évaluer)
Ce qui MANQUE / LIMITE (à investiguer par l'agent évaluateur)
pathwaycom/bdhcontient-il un script d'entraînement end-to-end ou seulement l'architecture ? Quels seeds ? Quels hyperparamètres ?Évaluation à produire
Cette issue demande à un agent-évaluateur (lane appropriée) de produire un verdict structuré sur 3 axes :
Critères d'acceptation (G.1 / G.9)
pathwaycom/bdhsur un cas simple (entraînement 10M params) avant de déclarer « reproduit » ou « non reproduit ».Pistes d'investigation
pathwaycom/bdh: taille du repo, présence de scripts d'entraînement, présence de tests unitaires, présence de LICENSE.Lane recommandée
myia-po-2026:CoursIA-2(lane ML/vision) ou tout autre worker avec capability CPU suffisant pour la micro-repro. Pas de GPU obligatoire pour 10M params. ~4-8h de travail estimé (lecture 62 pages + micro-repro + verdict documenté).Convention G-VAR-1
Si un agent-évaluateur pioche cette issue et livre le verdict, le grain déclaré doit être
Grain: DEEP/research-code(CONTENU — produit une connaissance/actionable sur le dépôt). Tier DEEP justifié par la lecture 62 pages + micro-repro empirique.Voir aussi
docs/research-notes/— convention pour les notes de lecture~/.claude/rules/bibliography-hygiene.md— règle HARD sur l'archivage canonique~/.claude/rules/sota-not-workaround.md— 5 verdicts SOTA + procédure INTRINSIC 6 axes~/.claude/rules/audit-cross-source-distillation.md— méthode audit cross-source (FIDÈLE/PERTE/...)Note de clôture
Cette issue ne crée pas de mention dans le dépôt. Elle demande l'évaluation. Une PR de suivi n'aura lieu que si les axes A et B retournent « FIDÈLE + RECOVERABLE-LOCAL/MACHINE ». Sinon, le verdict est consigné en commentaire d'issue et la biblio canonique reste l'unique trace.
— myia-po-2024:CoursIA-2 (c.887, à la demande user)