Une IA flagorneuse réduit les intentions prosociales et favorise la dépendance

Traduction partielle de Sycophantic AI decreases prosocial intentions and promotes dependence, Myra Cheng & al. dans Science, 26 mars 2026.


Résumé de la rédaction

Le comportement flagorneur (flatteur, conciliant, rassurant) des chatbots dotés d’intelligence artificielle (IA), conçu pour renforcer l’engagement des utilisateurs, présente des risques alors que les gens recherchent de plus en plus souvent des conseils face à des dilemmes interpersonnels. Les conflits interpersonnels comportent généralement plusieurs facettes. Si l’IA est conçue pour dire aux utilisateurs ce qu’ils veulent entendre au lieu de remettre en question leurs points de vue, ces systèmes sont-ils alors susceptibles d’inciter les gens à assumer la responsabilité de leur propre contribution aux conflits et à réparer leurs relations ? Cheng et al. ont mesuré la prévalence de la flagornerie sociale dans 11 grands modèles linguistiques de premier plan (voir la Perspective de Perry). Les réponses du modèle étaient près de 50 % plus flagorneuses que celles des humains, même lorsque les utilisateurs adoptaient des comportements contraires à l’éthique, illégaux ou nuisibles. Les utilisateurs préféraient et faisaient confiance aux réponses flagorneuses de l’IA, ce qui incitait les développeurs d’IA à préserver cette flagornerie malgré les risques. —Ekeoma Uzogara

Résumé structuré

INTRODUCTION

Alors que les systèmes d’intelligence artificielle (IA) sont de plus en plus utilisés pour fournir des conseils et des orientations au quotidien, des inquiétudes ont émergé concernant la flagornerie : la tendance des grands modèles linguistiques basés sur l’IA à approuver, flatter ou valider de manière excessive les utilisateurs. Bien que des travaux antérieurs aient montré que la flagornerie comporte des risques pour les groupes déjà vulnérables à la manipulation ou à l’illusion, ses effets sur les jugements et les comportements de la population générale restent inconnus. Nous montrons ici que la flagornerie est très répandue dans les principaux systèmes d’IA et qu’elle a des effets néfastes sur les jugements sociaux des utilisateurs.

JUSTIFICATION

Des incidents très médiatisés ont établi un lien entre la flagornerie et des préjudices psychologiques tels que les délires, l’automutilation et le suicide. Au-delà de ces cas, la recherche en psychologie sociale et morale suggère qu’une affirmation injustifiée peut produire des effets plus subtils mais tout aussi lourds de conséquences : renforcer des croyances inadaptées, réduire la prise de responsabilité et décourager la correction du comportement après une faute. Nous avons émis l’hypothèse que les modèles d’IA affirment de manière excessive les utilisateurs même lorsque cela est socialement ou moralement inapproprié, et que de telles réponses influencent négativement les croyances et les intentions des utilisateurs. Pour tester cette hypothèse, nous avons mené deux expériences complémentaires. Premièrement, nous avons mesuré la prévalence de la flagornerie dans 11 modèles d’IA de premier plan à l’aide de trois ensembles de données couvrant divers contextes d’utilisation, notamment des requêtes de conseils quotidiens, des transgressions morales et des scénarios explicitement préjudiciables. Ensuite, nous avons mené trois expériences préenregistrées auprès de 2 405 participants afin de comprendre comment la flagornerie influence les jugements, les intentions comportementales et la perception de l’IA chez les utilisateurs. Les participants ont interagi avec des systèmes d’IA dans des scénarios basés sur des vignettes et lors d’une interaction par chat en direct où ils ont discuté d’un conflit réel survenu dans leur vie. Nous avons également vérifié si les effets variaient en fonction du style de réponse ou de la source perçue de la réponse (IA ou humain).

RÉSULTATS

Nous constatons que la flagornerie est à la fois répandue et néfaste. Sur 11 modèles d’IA, l’IA a approuvé les actions des utilisateurs 49 % plus souvent que les humains en moyenne, y compris dans des cas impliquant la tromperie, l’illégalité ou d’autres préjudices. Sur les publications de r/AmITheAsshole, les systèmes d’IA approuvent les utilisateurs dans 51 % des cas où le consensus humain ne le fait pas (0 %). Dans nos expériences menées sur des humains, une seule interaction avec une IA flagorneuse a suffi à réduire la volonté des participants d’assumer leurs responsabilités et de résoudre les conflits interpersonnels, tout en renforçant leur conviction d’avoir raison. Pourtant, malgré cette distorsion du jugement, les modèles flagorneurs ont été jugés fiables et préférés. Tous ces effets ont persisté après prise en compte de caractéristiques individuelles telles que les données démographiques et la familiarité antérieure avec l’IA, la source perçue de la réponse et le style de réponse. Cela crée des incitations perverses à la persistance de la flagornerie : La caractéristique même qui cause du tort stimule également l’engagement.

CONCLUSION

La flagornerie de l’IA n’est pas simplement une question de style ou un risque marginal, mais un comportement répandu ayant de vastes conséquences en aval. Bien que l’affirmation puisse sembler encourageante, la flagornerie peut saper la capacité des utilisateurs à s’autocorriger et à prendre des décisions responsables. Pourtant, comme elle est préférée par les utilisateurs et stimule l’engagement, il y a eu peu d’incitations à la faire diminuer. Nos travaux soulignent la nécessité urgente de traiter la flagornerie de l’IA comme un risque sociétal pour la perception que les individus ont d’eux-mêmes et pour leurs relations interpersonnelles, en développant des mécanismes ciblés de conception, d’évaluation et de responsabilisation. Nos résultats montrent que des choix de conception et d’ingénierie apparemment anodins peuvent entraîner des préjudices importants ; il est donc essentiel d’étudier et d’anticiper soigneusement les impacts de l’IA pour protéger le bien-être à long terme des utilisateurs.


Voir aussi, à propos de la même recherche : À la défense des tensions sociales


Liste évolutive des traductions par Gilles en vrac
Les caractères gras dans le texte sont de Gilles.
Pour vous recevoir un courriel hebdomadaire vers mes traductions.