Lexique
Les mots qu'on emploie dans le journal, définis une fois. Dans les pièces, la première occurrence d'un terme renvoie à sa fiche. 20 termes pour l'instant, et la liste s'allonge au fil des publications.
Fondamentaux
- token
- Plus petite unité de texte qu'un modèle manipule. Un mot courant tient souvent en un seul, un mot rare se découpe en plusieurs morceaux. Les prix, les limites et les débits s'expriment en tokens, pas en mots.
- fenêtre de contexte contexte
- Quantité de tokens qu'un modèle peut lire d'un seul coup, question et réponse comprises. Au-delà, il faut découper, résumer ou chercher ailleurs.
- paramètres poids du modèle
- Nombre de valeurs apprises par un modèle. À quantification égale, plus de paramètres veut dire plus de mémoire occupée, et en général de meilleures réponses.
- embedding vecteurs
- Représentation d'un texte par une suite de nombres, telle que deux textes proches par le sens le soient aussi par le calcul. Sert à la recherche, au tri et à la mémoire d'un agent.
- licence des poids poids ouverts
- Conditions attachées aux fichiers de poids d'un modèle, distinctes de la licence du code qui les fait tourner. Des poids dits ouverts n'impliquent pas un logiciel libre : redistribution, usage commercial et entraînement dérivé varient d'un modèle à l'autre.
Modèles et poids
- GGUF
- Format de fichier de modèle utilisé par llama.cpp et ses dérivés. Le nom du fichier indique la quantification, par exemple Q4_K_M, ce qui suffit à savoir combien de mémoire il demande.
- quantification quantization
- Réduction de la précision des poids et parfois des calculs, de seize bits vers huit, quatre ou moins. Elle fait tenir un modèle en mémoire et accélère le débit, en échange d'une perte de qualité qui se voit d'abord sur les petits modèles.
- mixture d'experts MoE
- Architecture où seuls quelques sous-réseaux, appelés experts, sont activés pour chaque token. Le modèle affiche beaucoup de paramètres mais n'en utilise qu'une fraction à chaque passage.
- LoRA adaptateur
- Entraînement léger d'un modèle gelé : on ajuste deux petites matrices à côté des poids d'origine. Le résultat s'applique ou se retire à la demande, et se partage en quelques dizaines de mégaoctets.
Inférence en local
- VRAM mémoire vidéo
- Mémoire de la carte graphique. C'est elle qui fixe la taille de modèle exécutable : les poids, le cache et la fenêtre de contexte doivent y tenir ensemble.
- inférence
- Exécution d'un modèle : une entrée, une sortie. Le calcul se sépare en un pré-remplissage de la question, puis une génération token par token.
- cache KV KV cache
- Mémoire intermédiaire qui conserve les états d'attention déjà calculés pour ne pas les refaire à chaque nouveau token. C'est ce qui rend la conversation suivie supportable en coût de calcul.
- débit tokens par seconde
- Nombre de tokens produits par seconde en génération. Avec le temps d'attente du premier token, c'est le chiffre qui dit si un modèle est utilisable au quotidien sur une machine donnée.
- température
- Paramètre d'échantillonnage : plus elle est basse, plus le modèle retient le token le plus probable. À zéro, les mêmes entrées donnent la même sortie.
Agents et outils
- agent IA agentique
- Modèle qui boucle : il choisit une action, le plus souvent un appel d'outil, en lit le résultat, puis recommence jusqu'à l'objectif ou l'abandon. La boucle est ce qui distingue un agent d'une réponse unique.
- appel d'outil tool call · function calling
- Requête structurée qu'un modèle adresse à un programme extérieur : recherche, calcul, terminal, base de données. Le modèle ne fait pas l'action, il demande qu'elle soit faite, et lit ce qui revient.
- MCP Model Context Protocol
- Protocole ouvert qui décrit à un modèle les outils et les ressources d'un environnement. Il sert de contrat entre un client d'agent et des serveurs d'outils, et évite de recâbler chaque intégration.
- trace trace d'exécution
- Journal détaillé d'une exécution d'agent : appels, arguments, résultats, erreurs. C'est la pièce à conserver quand un agent échoue, et la seule façon de savoir ce qu'il a vraiment fait.
- RAG recherche augmentée
- Recherche documentaire branchée sur un modèle : on retrouve des passages pertinents, on les place dans la fenêtre de contexte, et le modèle répond à partir d'eux plutôt que de sa mémoire.
Évaluation
- benchmark banc d'essai
- Épreuve normalisée, par exemple SWE-bench pour la résolution de tickets logiciels. Un score ne se compare qu'à tâche et version identiques, et ne dit rien du coût ni du temps d'exécution.