Skip to content

fix(ml): datasets mieux calibres pour le RL des petits modeles (0.8-2B) — piste proposee en review de #15249 #15294

Description

@jsboige

Ouvert en suivi de la review user de PR #15249 (probe B, #15099).

Contexte

Review user : les modèles 0.8B-2B sont mal castés sur DAPO-Math-17k (maths compétitives) ; il doit y avoir des datasets mieux calibrés pour ces petits modèles. Le signal RL sur ce corpus est bruité par l'inaccessibilité de la tâche aux backbones testés.

Livrable attendu

  • Inventaire borné (une demi-journée max de recherche) de datasets RL-ready adaptés aux 0.8-2B : tâches d'aiguillage/outils (function-calling, routing multi-modèles), formulation/ré-écriture contrainte, arithmétique simple/chaîne courte — là où le user situe la valeur réelle des petits modèles (chaîne temps réel) ;
  • candidats attendus côté littérature : dérivés GSM8K-level simplifiés, Function-Calling/ToolBench subsets, préférences courts-horizon ;
  • re-run du harnais probe sur 1-2 datasets retenus avec MiniCPM5-2B vs Qwen3.5-0.8B, même protocole borné ;
  • verdict : le classement 2B > 0.8B tient-il sur une tâche réellement calibrée pour cette échelle ?

Acceptance

  • Note de veille (3-5 datasets candidats, critère de calibration, sources)
  • 1-2 runs probe multi-seed sur datasets retenus
  • Comparaison des conclusions vs DAPO-Math-17k (le BEATS était-il un artefact de casting ?)

See #15099, #15249

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions