Skip to content

eval(biblio): sérieux de Pathway BDH (arXiv:2509.26507) et opportunité d'en parler dans le dépôt #14489

Description

@jsboige

Origine

Demande user 2026-09-03 : évaluer le sérieux de la société Pathway (https://pathway.com/) et l'opportunité d'en parler dans le dépôt, à partir du papier fondateur BDH (Dragon Hatchling) arXiv:2509.26507.

Le PDF a été archivé dans la biblio canonique : G:\Mon Drive\MyIA\IA\Bibliographie IA\MachineLearning\2025 - Dragon Hatchling BDH - 2509.26507.pdf (12 MB, identité vérifiée firsthand sur le header PDF — titre/auteurs/DOI/arXivID/license arXiv-nonexclusive tous présents et corrects).

Ce qui est FACTUEL (vérifié firsthand)

Identité du papier

  • Titre : The Dragon Hatchling: The Missing Link between the Transformer and Models of the Brain
  • Auteurs : Adrian Kosowski, Przemysław Uznański, Jan Chorowski, Zuzanna Stamirowska, Michał Bartoszkiewicz
  • arXiv : 2509.26507 (soumis 30 Sep 2025, v1)
  • Pages : 62, catégorie cs.NE/AI/LG/stat.ML
  • Code : pathwaycom/bdh sur GitHub

Crédibilité des fondateurs (via arXiv)

  • Jan Chorowski (CTO) — co-auteur historique des modèles d'attention avec Bahdanau/Bengio : arXiv:1506.07503 Attention-Based Models for Speech Recognition, 1508.04395 End-to-End Attention-based Large Vocabulary Speech Recognition. Recherche SOTA authentique.
  • Adrian Kosowski (CSO) — ACM SPAA Best Paper, Inria tenure à 23 ans. Profil algorithmes/structures.
  • Łukasz Kaiser (advisor) — co-inventeur du Transformer original (Vaswani et al. 2017).
  • Zuzanna Stamirowska (CEO) — PhD Complex Systems, École Polytechnique.

Claims techniques annoncés (à évaluer)

  • ARC-AGI-1 : 29.5 % Pass@2 à 0,0007 $/tâche (BDH-CQ, 150M params) — "strongest accuracy-to-cost result in our comparison" (claim de la page produit Pathway)
  • Sudoku Extreme : 97.4 % solve rate sans chain-of-thought
  • BABILong : 95 % accuracy à 32K context (134M params)
  • Scaling laws : "BDH rivals GPT2-architecture Transformer performance on language and translation tasks, at the same number of parameters (10M to 1B)" (claim arXiv abstract)

Ce qui MANQUE / LIMITE (à investiguer par l'agent évaluateur)

  1. Checkpoints pré-entraînés absents — la page arXiv ne mentionne pas de release HuggingFace ou PyTorch Hub. Pour reproduire les scaling laws, il faut entraîner from-scratch à plusieurs tailles (10M, 100M, 1B) — coût d'évaluation réel élevé.
  2. Corpus d'entraînement non publié — token count, dataset name non précisés. Sans ça, "rivals GPT-2 at same params" n'est pas falsifiable indépendamment.
  3. Pas de soumission conférence visible sur la page arXiv (NeurIPS/ICLR/ICML). Pas de peer review indépendant au 2026-09-03.
  4. ARC-AGI-1 29.5 % Pass@2 à 150M params — claim marketing jusqu'à preuve du leaderboard semi-privé officiel. Sur le leaderboard public ARC-AGI-1 (non semi-privé), les modèles ~150M ne sont pas dans la zone SOTA — vérifier le split (public vs semi-private) avant de citer.
  5. License du code GitHub non vérifiée sur la page arXiv — à confirmer sur le repo direct (LICENSE file).
  6. Reproductibilité empirique — pathwaycom/bdh contient-il un script d'entraînement end-to-end ou seulement l'architecture ? Quels seeds ? Quels hyperparamètres ?

Évaluation à produire

Cette issue demande à un agent-évaluateur (lane appropriée) de produire un verdict structuré sur 3 axes :

Axe Question Verdict attendu
A. Sérieux scientifique Le papier et le labo sont-ils du SOTA authentique ou du marketing ? FIDÈLE / PERTE PAR COMPLAISANCE / DIVERGENCE POSITIVE
B. Reproductibilité Les claims benchmark peuvent-ils être répliqués sur machine CPU modeste (sans GPU) ? RECOVERABLE-LOCAL / RECOVERABLE-MACHINE / INTRINSIC
C. Opportunité pédagogique Y a-t-il un angle exploitable dans le dépôt (notebook Lean/probas/ML/Search) ? OUI scope proposé / NON justifié / À REVENIR dans 6 mois

Critères d'acceptation (G.1 / G.9)

  • Vérifier avant de clamer SOTA : lire le papier (62 pages) — pas seulement l'abstract ou la page produit Pathway.
  • Mesurer : tenter une ré-exécution du repo pathwaycom/bdh sur un cas simple (entraînement 10M params) avant de déclarer « reproduit » ou « non reproduit ».
  • Falsifiabilité : si les scaling laws sont vraies à 1B params, BDH est un candidat sérieux pour un notebook ML ; sinon, c'est un cas d'école de « paper avec claims invérifiables ».
  • Pas de promotion sans preuve : ne pas ajouter de mention dans le dépôt (README, doc, notebook) tant que les axes A et B ne sont pas validés.

Pistes d'investigation

  1. Lire l'abstract + intro + conclusion (15 pages). Vérifier que les claims benchmark sont sourcés avec protocoles (seeds, datasets, splits).
  2. Inspecter pathwaycom/bdh : taille du repo, présence de scripts d'entraînement, présence de tests unitaires, présence de LICENSE.
  3. Vérifier ARC-AGI leaderboard : https://arcprize.org/leaderboard — voir si BDH-CQ y figure officiellement avec score 29.5 % sur semi-private set.
  4. Vérifier OpenReview : chercher "BDH" ou "Dragon Hatchling" sur https://openreview.net/ pour voir si une soumission NeurIPS/ICLR 2026 existe (deadline mai 2026).
  5. Comparer à la concurrence : Mamba (Albert Gu, 2023), RWKV (Bo Peng, 2023), xLSTM (Beck et al., 2024), Hyena (Poli et al., 2023) — toutes architectures "post-transformer" avec benchmarks publics. BDH a-t-il un avantage mesurable ?
  6. Tenter une micro-repro : entraîner BDH 10M params sur 100M tokens (PenTreebank ou WikiText-103) en moins de 24h CPU et comparer perplexité à un Transformer GPT-2 10M params équivalent. Si la perplexité est dans la marge ±10 %, claim tenu. Si >50 % écart, claim faux.

Lane recommandée

myia-po-2026:CoursIA-2 (lane ML/vision) ou tout autre worker avec capability CPU suffisant pour la micro-repro. Pas de GPU obligatoire pour 10M params. ~4-8h de travail estimé (lecture 62 pages + micro-repro + verdict documenté).

Convention G-VAR-1

Si un agent-évaluateur pioche cette issue et livre le verdict, le grain déclaré doit être Grain: DEEP/research-code (CONTENU — produit une connaissance/actionable sur le dépôt). Tier DEEP justifié par la lecture 62 pages + micro-repro empirique.

Voir aussi

Note de clôture

Cette issue ne crée pas de mention dans le dépôt. Elle demande l'évaluation. Une PR de suivi n'aura lieu que si les axes A et B retournent « FIDÈLE + RECOVERABLE-LOCAL/MACHINE ». Sinon, le verdict est consigné en commentaire d'issue et la biblio canonique reste l'unique trace.

— myia-po-2024:CoursIA-2 (c.887, à la demande user)

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions