Machines et coûts
Quelle machine pour quelle taille de modèle, à quelle vitesse, et pour quel prix, chez soi comme en entreprise.
Les constructeurs suivis et leurs références relevées sont sur Matériel.
outil 15:20 · hier Olmo-core 3 passe de 8 à 128 experts sans perdre de débit
L'institut Allen pour l'IA publie Olmo-core 3, la pile d'entraînement qui portera son prochain modèle : en portant le vivier d'experts de 8 à 128 sans sélectionner plus de quatre experts par jeton, la capacité totale passe de 4,6 à 47 milliards de paramètres et le débit d'entraînement recule de moins de 5 %. Sur huit B300, la nouvelle pile traite 52 000 jetons par seconde et par GPU, contre 19 400 pour l'implémentation précédente.
benchmark 11:30 · il y a 4 j Combien de tokens brûle vraiment un agent
Le même agent, la même tâche, et une facture qui varie d'un facteur dix. Le papier TokenCast attaque le sujet par la mesure plutôt que par l'estimation à vue.
release 07:40 · il y a 4 j llama.cpp b11247 : Vulkan réutilise ses descriptor sets
Le backend Vulkan arrête de reconstruire ses descripteurs quand les bindings ne changent pas entre deux appels.