IAGentic

Journal de veille sur l'IA locale et les agents : sorties de modèles, papiers, outils, mesures.

outil

Olmo-core 3 passe de 8 à 128 experts sans perdre de débit

L'institut Allen pour l'IA publie Olmo-core 3, la pile d'entraînement qui portera son prochain modèle : en portant le vivier d'experts de 8 à 128 sans sélectionner plus de quatre experts par jeton, la capacité totale passe de 4,6 à 47 milliards de paramètrespoids du modèleNombre de valeurs apprises par un modèle. À quantification égale, plus de paramètres veut dire plus de mémoire occupée, et en général de meilleures réponses.Fiche du lexique et le débittokens par secondeNombre de tokens produits par seconde en génération. Avec le temps d'attente du premier token, c'est le chiffre qui dit si un modèle est utilisable au quotidien sur une machine donnée.Fiche du lexique d'entraînement recule de moins de 5 %. Sur huit B300, la nouvelle pile traite 52 000 jetons par seconde et par GPU, contre 19 400 pour l'implémentation précédente.

par Gyom 2 octobre 2026 à 15:20 rubrique : IA locale

Quatre machines identiques alignées sur un sol dallé, chacune coiffée d'un entonnoir et reliée par de gros tuyaux, un empilement de plaques à droite, sur une trame d'imprimerie crème, magenta et moutarde.

Un mélange d'experts ne fait pas travailler le modèle entier sur chaque jeton : il range ses paramètres en experts, n'en sollicite que quelques-uns par jeton, et c'est là qu'il économise du calcul. Le prix se paie ailleurs, dans la mémoire et dans le transport, puisque tous les experts restent à stocker, à mettre à jour, et à alimenter en données à travers une grappe. Olmo-core 3, la pile d'entraînement qu'AI2, l'institut Allen pour l'IA, destine à son prochain modèle ouvert, annonce seize fois plus d'experts pour le même travail par jeton.

Le vivier passe de 8 à 128 experts, le travail par jeton ne bouge pas

Dans un banc interne, AI2 monte le vivier d'experts de 8 à 128 tout en continuant de n'en sélectionner que quatre par jeton, ce qui laisse le nombre de paramètres actifs autour de 3,2 milliards. La capacité totale du modèle passe de 4,6 à 47 milliards de paramètres, et le débit d'entraînement recule de moins de 5 %. La même pile est annoncée testée au-delà de mille milliards de paramètres au total.

52 000 jetons par seconde et par GPU contre 19 400 sur huit B300

L'écart vient du parallélisme. L'implémentation précédente s'appuyait sur le parallélisme de données entièrement fragmenté, qui rassemble puis refragmente les poids à chaque petit lot, et fait payer ces allers-retours à chaque pas. Olmo-core 3 passe au parallélisme de données distribué : les experts restent résidents sur les GPU et les données sont routées vers eux. Sur huit GPU NVIDIA B300, un mélange d'experts de 47 milliards de paramètres traite 52 000 jetons par seconde et par GPU avec la nouvelle pile, contre 19 400 avec l'ancienne, soit environ 2,7 fois plus.

Le routage vit sur les GPU, les multiplications des experts partent groupées

Trois découpages répartissent le modèle sur le matériel : le parallélisme d'experts range les experts sur des GPU différents, le parallélisme de pipeline coupe les couches en étages, et un optimiseur distribué étale l'état de l'optimiseur au lieu d'en garder une copie entière sur chaque carte. Le routage lui-même est retravaillé : le parallélisme d'experts par rangée dépose les données directement dans les tampons d'entrée des experts concernés, les métadonnées de routage restent sur les GPU pour que le processeur n'attende pas leur copie, et un produit matriciel groupé enchaîne les petites multiplications des experts en une seule passe.

Le format MXFP8 rend 21 % de débit et 8 GiB de mémoire active

La pile accepte MXFP8, un format à précision réduite. Sur un banc contrôlé à quatre GPU B300, avec le travail réparti uniformément entre les experts, l'activer là où il sert le plus donne environ 21 % de débit de plus qu'en BF16 et fait tomber la mémoire active de pointe de 103 à 95 GiB. Le gain vient surtout du calcul des couches feed-forward et du transport de données entre experts, pas de l'attention.

1,2 billion de paramètres sur 512 GPU, 858 TFLOP/s par GPU

AI2 a mesuré la pile sur des configurations plus larges, dont un modèle de 1,2 billion de paramètres dont 58,36 milliards sont actifs par jeton, réparti sur 512 GPU, avec un pic observé de 858 TFLOP/s par GPU. Ces essais utilisent un routage aléatoire, pour éprouver le système et non la qualité d'un modèle entraîné. Une autre configuration, avec DeepEP v2 pour la communication entre experts, atteint 2,38 billions de paramètres au total : un test de capacité courte, pas une campagne d'entraînement complète.

Un score d'équilibrage qui trompe, un recouvrement qui ralentit

Le rapport technique documente aussi ce qui ne marche pas. Un score censé encourager un routage équilibré peut s'améliorer alors que la charge réelle se déséquilibre, un travers qu'AI2 appelle la manipulation de circonscription des jetons. Baisser le taux d'apprentissage des experts qui voient moins de jetons n'a rien amélioré dans la famille testée, et recouvrir communication et calcul sur des flux GPU séparés a parfois ralenti l'exécution complète.

La pile est publiée en entier, code et rapport technique, pour un prochain modèle ouvert lui-même en mélange d'experts. Pour qui entraîne ses propres modèles, l'intérêt se lit dans les ratios mesurés : un vivier seize fois plus large pour le même travail par jeton, et un débit multiplié par 2,7 sur la génération de matériel précédente.

Source primaire Allen Institute for AI, Olmo-core 3

Retour au journal