Ouvert en suivi de la review user de PR #15249 (probe B, #15099).
Contexte
Review user : les modèles 0.8B-2B sont mal castés sur DAPO-Math-17k (maths compétitives) ; il doit y avoir des datasets mieux calibrés pour ces petits modèles. Le signal RL sur ce corpus est bruité par l'inaccessibilité de la tâche aux backbones testés.
Livrable attendu
- Inventaire borné (une demi-journée max de recherche) de datasets RL-ready adaptés aux 0.8-2B : tâches d'aiguillage/outils (function-calling, routing multi-modèles), formulation/ré-écriture contrainte, arithmétique simple/chaîne courte — là où le user situe la valeur réelle des petits modèles (chaîne temps réel) ;
- candidats attendus côté littérature : dérivés GSM8K-level simplifiés, Function-Calling/ToolBench subsets, préférences courts-horizon ;
- re-run du harnais probe sur 1-2 datasets retenus avec MiniCPM5-2B vs Qwen3.5-0.8B, même protocole borné ;
- verdict : le classement 2B > 0.8B tient-il sur une tâche réellement calibrée pour cette échelle ?
Acceptance
See #15099, #15249
Ouvert en suivi de la review user de PR #15249 (probe B, #15099).
Contexte
Review user : les modèles 0.8B-2B sont mal castés sur DAPO-Math-17k (maths compétitives) ; il doit y avoir des datasets mieux calibrés pour ces petits modèles. Le signal RL sur ce corpus est bruité par l'inaccessibilité de la tâche aux backbones testés.
Livrable attendu
Acceptance
See #15099, #15249