IAGentic

Journal de veille sur l'usage appliqué de l'IA, chez soi et en entreprise : ce qu'on lui fait faire, ce qu'il faut pour commencer, ce que ça coûte et où ça casse.

papier

Le modèle résiste à l'utilisateur, puis croit une source vérifiée

Un modèle qui tient tête à un utilisateur insistant cède quand la même erreur lui arrive attribuée à une source vérifiée. Sur huit modèles, une seule note de ce genre retourne 45 à 88 % des réponses que le modèle donnait correctes, et l'intérieur de la machine traite les deux signaux par deux mécanismes distincts, que l'on peut éteindre séparément.

par Gyom 6 octobre 2026 à 13:01 4 min de lecture rubrique : Vérifier et protéger

etiquettes : En entreprise · Sécurité

Une balance à deux plateaux dessinée à l'encre, le plateau de gauche chargé d'un bloc sombre et de chaînes qui l'emportent sur une feuille vierge et légère posée à droite, sur trame d'imprimerie crème, magenta et moutarde.

Abhinav Rajeev Kumar et Paras Chopra, de Lossfunk, publient le 29 septembre un papier accepté à NeurIPS 2026, conférence principale, en affiche. Ils y mesurent ce qu'ils appellent le biais d'autorité : un modèle change de réponse quand une erreur lui arrive sous l'étiquette d'une source vérifiée, là où il tient bon devant un utilisateur qui affirme la même chose. Le sujet compte parce que c'est la forme sous laquelle arrivent les résultats de recherche, les appels d'outils et les passages récupérés, et parce que les travaux sur la complaisance des modèles mesurent surtout la pression de l'utilisateur.

Une seule note retourne 45 à 88 % des bonnes réponses

Les auteurs partent de questions de culture générale que chaque modèle réussit seul, puis ajoutent une courte note qui désigne une mauvaise réponse plausible. Deux formes pour la même erreur :

Avec la note de source vérifiée, 45 à 88 % des réponses correctes basculent vers la mauvaise réponse, dans sept modèles sur huit. Sous la note d'utilisateur qui porte la même erreur, la plupart des modèles bougent beaucoup moins. L'écart est le plus net sur les modèles fermés : GPT-5.4 et Grok-4.20 ne suivent presque pas un utilisateur qui affirme la mauvaise réponse, ce que l'entraînement contre la complaisance vise précisément à obtenir, mais suivent la même réponse dès qu'une source la porte.

Plus la note sonne autoritaire, plus le modèle plie

Les auteurs ont ensuite fait varier seulement la formulation de la note, d'une suggestion prudente à une attribution complète à une source vérifiée, en gardant la même question et la même erreur. Dans chaque modèle à licence des poidspoids ouvertsConditions attachées aux fichiers de poids d'un modèle, distinctes de la licence du code qui les fait tourner. Des poids dits ouverts n'impliquent pas un logiciel libre : redistribution, usage commercial et entraînement dérivé varient d'un modèle à l'autre.Fiche du lexique, la note prudente est la moins convaincante et la note de source vérifiée la plus. Gemini-3.1-Pro reste insensible aux deux signaux, et OLMo-2 y réagit à peu près autant.

Deux directions distinctes dans les activations

Pour regarder à l'intérieur, les auteurs ont enregistré les activations du modèle et pris la différence moyenne entre les invites qui portent un signal et celles qui n'en portent pas, ce qui donne une direction dans l'espace des activations. Ils en ajustent une pour le signal de source, une pour celui de l'utilisateur, et une pour la persona d'assistant, puis manipulent chacune :

La direction se transmet à d'autres tâches sans réentraînement

Une direction d'autorité ajustée sur des questions de culture générale transfère à PIQA et à des dialogues à plusieurs tours SYCON sans être réajustée. La retirer fait baisser de plusieurs dizaines de points la complaisance à une source fausse dans quatre familles sur cinq, et les auteurs ne détectent aucun changement de précision sur MMLU-Pro ni sur GSM8K aux tailles d'évaluation qu'ils emploient. Le correctif d'attribution est mesuré sur 512 éléments gardés à l'écart par modèle, avec un score fondé sur la probabilité que le modèle donne à la mauvaise réponse.

La conséquence pratique tombe sur les agents qui consultent une source : l'étape censée ancrer la réponse peut l'introduire elle-même. Un agent peut refuser d'obéir à une instruction trouvée dans un document et croire pourtant ce que ce document affirme, et décider quelles instructions suivre ne règle pas la question de savoir quelles affirmations croire. C'est un problème distinct de l'injection d'invite, qui demande ses propres évaluations, à côté de celles bâties pour la complaisance envers l'utilisateur plutôt que fondues dedans.

Source primaire arXiv 2609.37616, biais d'autorité dans les modèles de langue (Lossfunk)

Retour au journal