AstaBrief 8B écrit un rapport scientifique cité en une seule passe
L'institut Allen pour l'IA ouvre AstaBrief 8B, un modèle bâti sur Qwen3-8B qui transforme une question de recherche et des extraits de littérature en un rapport cité. Dans Asta, sa plateforme scientifique, le mode rapide qu'il porte rend un rapport en 51,1 secondes en moyenne contre 178,5 pour le mode adossé à Claude, environ 3,5 fois plus vite, pour une qualité que ses évaluations placent dans le même voisinage.
par Gyom 3 octobre 2026 à 13:01 3 min de lecture rubrique : IA locale
AstaBrief part de Qwen3-8B et l'essentiel du travail a porté sur les données et sur l'évaluation, pas sur la taille du modèle. Le jeu d'entraînement vient de vraies requêtes passées par des chercheurs dans Asta : après filtrage, 90 000 questions scientifiques, dont les rapports cibles ont été produits par la chaîne ScholarQA et plusieurs modèles propriétaires, Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini et GPT-4.1, pour 47 000 exemples utilisables en ajustement supervisé. L'optimisation directe des préférences repose ensuite sur environ 6 000 paires, chacune jugée par GPT-4.1 et DeepSeek-R1, l'accord des deux juges étant exigé et leur alignement mesuré à 95 % avec des préférences humaines.
Un seul filtre compte : la part des affirmations citées
AI2 éprouve quatre filtres statistiques sur les exemples synthétiques : le rapport entre jetons de sortie et d'entrée, la pertinence moyenne des papiers cités, la part des affirmations portant au moins une citation, et la diversité des papiers cités. Le gain le plus net vient du troisième, écarter les rapports dont les phrases restent sans citation. Les combinaisons de filtres et les balayages de taux d'apprentissage n'ajoutent rien de mesurable, et les auteurs en tirent une leçon explicite : la composition des données d'après-entraînement pèse plus que la quantité de texte scientifique vue avant.
Le rapport s'écrit d'un trait au lieu d'être assemblé section par section
Le mode réflexion d'Asta fait passer la question par un résumé puis un regroupement d'extraits avant de rédiger, section par section. AstaBrief écrit le rapport complet en une passe à partir de la question et des extraits retrouvés, ce qui supprime le coût de cette synthèse intermédiaire. Sur l'ensemble de la chaîne, le mode rapide rend un rapport en 51,1 secondes en moyenne contre 178,5 pour le mode réflexion.
Deux des trois chercheurs préfèrent ses citations
L'évaluation principale porte sur SQABench-CS2, 200 questions de recherche en informatique écrites par des utilisateurs, avec quatre mesures suivies : la couverture du contenu nécessaire, la pertinence de chaque paragraphe, la précision des citations et leur rappel. Dans une étude humaine séparée de 14 questions, trois chercheurs ont classé les rapports de trois systèmes sur la préférence générale, la complétude, la pertinence, l'organisation et l'exactitude des citations : DR-Tulu l'emporte sur la préférence générale, mais deux des trois chercheurs préfèrent AstaBrief sur l'exactitude des citations.
374 utilisateurs, 29,1 % revenus un second jour
Le modèle tourne en production dans Asta sous l'étiquette Fast mode, aux côtés du mode réflexion. Parmi les 374 utilisateurs qui l'ont essayé, 29,1 % l'ont utilisé deux jours ou plus, et 3,67 fils de rapport sont produits en moyenne par utilisateur. Vingt-trois pour cent de ceux qui l'ont essayé ne sont jamais revenus au mode réflexion, et 18 % naviguent entre les deux selon l'objectif, en passant par le mode rapide pour environ 40 % de leurs fils. La part des retours positifs est proche de celle du mode réflexion, 84,2 % contre 85,2 %.
Poids et données d'entraînement sont publiés
Le modèle est ouvert, avec ses poids et un exemple de flux de travail pour produire des rapports depuis ses propres PDF, ce qui permet à une institution de le faire tourner derrière son pare-feu quand une question touche des travaux non publiés. La base d'entraînement date de 2025 : les modèles propriétaires pris comme cibles et comme points de comparaison sont ceux de la frontière de l'époque, et AI2 indique ne pas avoir rejoué l'évaluation complète contre les modèles de tête actuels.
Pour qui suit les modèles ouverts pour la science, la démonstration tient dans l'économie du dispositif : un ajustement supervisé et une optimisation de préférences, sans apprentissage par renforcement, suffisent à un modèle de 8 milliards de paramètrespoids du modèleNombre de valeurs apprises par un modèle. À quantification égale, plus de paramètres veut dire plus de mémoire occupée, et en général de meilleures réponses.Fiche du lexique pour rendre un rapport cité en 51 secondes.
Source primaire Allen Institute for AI, AstaBrief 8B