Affronter et surmonter les risques liés à l’intelligence artificielle puissante
Traduction de The Adolescence of Technology par Dario Amodei, janvier 2026
Dans l’adaptation cinématographique du livre Contact de Carl Sagan, il y a une scène où le personnage principal, une astronome qui a détecté le premier signal radio provenant d’une civilisation extraterrestre, est pressentie pour représenter l’humanité lors d’une rencontre avec les extraterrestres. Le jury international qui l’interroge lui demande : « Si vous pouviez poser une seule question [aux extraterrestres], quelle serait-elle ? » Elle répond : « Je leur demanderais : « Comment avez-vous fait ? Comment avez-vous évolué, comment avez-vous survécu à cette adolescence technologique sans vous détruire ? » Quand je pense à la situation actuelle de l’humanité face à l’IA, à ce qui nous attend, je repense sans cesse à cette scène, car cette question est tellement pertinente pour notre situation actuelle, et j’aimerais que nous ayons la réponse des extraterrestres pour nous guider. Je crois que nous entrons dans une période de transition, à la fois tumultueuse et inévitable, qui mettra à l’épreuve notre identité en tant qu’espèce. L’humanité est sur le point de se voir confier un pouvoir presque inimaginable, et il est très difficile de savoir si nos systèmes sociaux, politiques et technologiques ont la maturité nécessaire pour l’exercer.
Dans mon essai Machines of Loving Grace, j’ai tenté de décrire le rêve d’une civilisation qui aurait atteint l’âge adulte, où les risques auraient été pris en compte et où l’IA puissante serait utilisée avec compétence et compassion pour améliorer la qualité de vie de tous. J’ai suggéré que l’IA pourrait contribuer à d’énormes progrès dans les domaines de la biologie, des neurosciences, du développement économique, de la paix mondiale, du travail et du sens. J’ai estimé qu’il était important de donner aux gens une cause inspirante pour laquelle se battre, une tâche à laquelle les accélérationnistes de l’IA et les défenseurs de la sécurité de l’IA semblaient, curieusement, avoir échoué. Mais dans cet essai, je souhaite aborder le rite de passage lui-même : cartographier les risques auxquels nous sommes sur le point d’être confrontés et essayer de commencer à élaborer un plan de bataille pour les vaincre. Je crois profondément en notre capacité à vaincre, en l’esprit et la noblesse de l’humanité, mais nous devons faire face à la situation sans illusions.
Tout comme pour les avantages, je pense qu’il est important de discuter des risques de manière prudente et réfléchie. En particulier, je pense qu’il est essentiel de :
- Éviter le catastrophisme. Ici,je n’entends pas seulement le « catastrophisme » dans le sens où l’on croit que la catastrophe est inévitable (ce qui est à la fois une croyance fausse et auto-réalisatrice), mais plus généralement, le fait de penser aux risques de l’IA d’une manière quasi religieuse.1Cela rejoint un point que j’ai soulevé dans Machines of Loving Grace, où j’ai commencé par dire que les avantages de l’IA ne devaient pas être considérés comme une prophétie de salut, et qu’il était important d’être concret et réaliste et d’éviter toute grandiloquence. En fin de compte, les prophéties de salut et les prophéties de malheur ne sont d’aucune aide pour affronter le monde réel, pour essentiellement les mêmes raisons. Beaucoup de gens réfléchissent de manière analytique et lucide aux risques liés à l’IA depuis de nombreuses années, mais j’ai l’impression que pendant la période où les inquiétudes concernant les risques liés à l’IA ont atteint leur paroxysme en 2023-2024, certaines des voix les moins sensées se sont fait entendre, souvent par le biais de comptes de réseaux sociaux sensationnalistes. Ces voix utilisaient un langage rebutant rappelant la religion ou la science-fiction, et appelaient à des mesures extrêmes sans disposer des preuves qui les justifieraient. Il était déjà clair à l’époque qu’un retour de bâton était inévitable et que la question allait devenir culturellement polarisée et donc bloquée.2L’objectif d’Anthropic est de rester cohérent à travers ces changements. Lorsque parler des risques liés à l’IA était politiquement populaire, Anthropic prônait prudemment une approche judicieuse et fondée sur des preuves pour faire face à ces risques. Maintenant que parler des risques liés à l’IA est politiquement impopulaire, Anthropic continue de prôner prudemment une approche judicieuse et fondée sur des preuves pour faire face à ces risques.En 2025-2026, le pendule a basculé, et ce sont les opportunités offertes par l’IA, et non ses risques, qui motivent de nombreuses décisions politiques. Cette vacillation est regrettable, car la technologie elle-même se moque des modes, et nous sommes considérablement plus proches d’un danger réel en 2026 qu’en 2023. La leçon à tirer est que nous devons discuter et traiter les risques de manière réaliste et pragmatique : avec sobriété, en nous basant sur des faits et en nous équipant pour survivre aux changements.
- Reconnaître l’incertitude. Les préoccupations que je soulève dans cet article pourraient être discutables à bien des égards. Rien ici n’a pour but de communiquer une certitude ou même une probabilité. De toute évidence, l’IA pourrait tout simplement ne pas progresser aussi rapidement que je l’imagine.3Au fil du temps, j’ai acquis une confiance croissante dans la trajectoire de l’IA et dans la probabilité qu’elle dépasse les capacités humaines dans tous les domaines, mais une certaine incertitude subsiste. Ou, même si elle progresse rapidement, certains ou tous les risques évoqués ici pourraient ne pas se concrétiser (ce qui serait formidable), ou il pourrait y avoir d’autres risques que je n’ai pas pris en compte. Personne ne peut prédire l’avenir avec une certitude absolue, mais nous devons quand même faire de notre mieux pour planifier.
- Intervenir de manière aussi chirurgicale que possible. Pour faire face aux risques liés à l’IA, il faudra combiner des actions volontaires prises par les entreprises (et des acteurs privés tiers) et des mesures prises par les gouvernements qui s’imposent à tous. Les actions volontaires – les mener et encourager d’autres entreprises à faire de même – me semblent évidentes. Je suis fermement convaincu que des mesures gouvernementales seront également nécessaires dans une certaine mesure, mais ces interventions sont de nature différente, car elles peuvent potentiellement détruire de la valeur économique ou contraindre des acteurs réticents qui sont sceptiques quant à ces risques (et il y a de fortes chances qu’ils aient raison !). Il est également fréquent que les réglementations aient l’effet inverse de celui escompté ou aggravent le problème qu’elles sont censées résoudre (et cela est encore plus vrai pour les technologies en évolution rapide) . Il est donc très important que les réglementations soient judicieuses : elles doivent chercher à éviter les dommages collatéraux, être aussi simples que possible et imposer le moins de contraintes possible pour atteindre leur objectif.4Les contrôles à l’exportation des puces en sont un excellent exemple. Ils sont simples et semblent fonctionner dans l’ensemble. Il est facile de dire : « Aucune mesure n’est trop extrême lorsque l’avenir de l’humanité est en jeu ! », mais dans la pratique, cette attitude ne fait que susciter des réactions négatives. Pour être clair, je pense qu’il y a de fortes chances que nous finissions par atteindre un point où des mesures beaucoup plus importantes seront nécessaires, mais cela dépendra de preuves plus solides d’un danger imminent et concret que celles dont nous disposons aujourd’hui, ainsi que des informations suffisamment précises sur ce danger pour formuler des règles susceptibles d’y remédier. La chose la plus constructive que nous puissions faire aujourd’hui est de préconiser des règles limitées tout en cherchant à savoir s’il existe des preuves justifiant des règles plus strictes.5Et bien sûr, la recherche de telles preuves doit être intellectuellement honnête, de manière à pouvoir également mettre en évidence l’absence de danger. La transparence grâce aux fiches modèles et autres divulgations est une tentative d’atteindre cette honnêteté intellectuelle.
Cela dit, je pense que le meilleur point de départ pour parler des risques liés à l’IA est le même que celui dont je suis parti pour parler de ses avantages : en précisant le niveau d’IA dont nous parlons. Le niveau d’IA qui me préoccupe pour la civilisation est la puissante IA que j’ai décrite dans Machines of Loving Grace. Je vais simplement répéter ici la définition que j’ai donnée dans ce document :
Par « IA puissante », j’entends un modèle d’IA — probablement similaire aux LLM actuels dans sa forme, bien qu’il puisse être basé sur une architecture différente, impliquer plusieurs modèles interactifs et être entraîné différemment — présentant les propriétés suivantes :
- En termes d’intelligence pure, il est plus intelligent qu’un lauréat du prix Nobel dans la plupart des domaines pertinents : biologie, programmation, mathématiques, ingénierie, écriture, etc. Cela signifie qu’il peut prouver des théorèmes mathématiques non résolus, écrire d’excellents romans, écrire des bases de code difficiles à partir de zéro, etc.
- En plus d’être simplement une « chose intelligente à laquelle on parle », il dispose de toutes les interfaces disponibles pour un humain travaillant virtuellement, y compris le texte, l’audio, la vidéo, le contrôle de la souris et du clavier, et l’accès à Internet. Il peut s’engager dans toutes les actions, communications ou opérations à distance rendues possibles par cette interface, y compris effectuer des actions sur Internet, donner ou recevoir des instructions à des humains, commander du matériel, diriger des expériences, regarder des vidéos, réaliser des vidéos, etc. Il accomplit toutes ces tâches avec, là encore, une compétence supérieure à celle des humains les plus capables au monde.
- Il ne se contente pas de répondre passivement à des questions ; on peut lui confier des tâches qui prennent des heures, des jours ou des semaines à accomplir, puis il s’en va et les accomplit de manière autonome, comme le ferait un employé intelligent, en demandant des éclaircissements si nécessaire.
- Il n’a pas d’incarnation physique (autre que celle qui apparaît sur un écran d’ordinateur), mais il peut contrôler des outils physiques, des robots ou des équipements de laboratoire existants à l’aide d’un ordinateur ; en théorie, il pourrait même concevoir des robots ou des équipements pour son propre usage.
- Les ressources utilisées pour entraîner le modèle peuvent être réutilisées pour exécuter des millions d’instances de celui-ci (ce qui correspond à la taille prévue des clusters d’ici 2027 environ), et le modèle peut absorber des informations et générer des actions à une vitesse environ 10 à 100 fois supérieure à celle d’un être humain. Il peut toutefois être limité par le temps de réponse du monde physique ou des logiciels avec lesquels il interagit.
- Chacune de ces millions de copies peut agir indépendamment sur des tâches sans rapport entre elles ou, si nécessaire, toutes peuvent travailler ensemble de la même manière que les humains collaboreraient, peut-être avec différentes sous-populations spécialisées pour être particulièrement performantes dans des tâches spécifiques.
Nous pourrions résumer cela comme un « pays de génies dans un centre de données ».
Comme je l’ai écrit dans Machines of Loving Grace, une IA puissante pourrait voir le jour d’ici un à deux ans, mais cela pourrait aussi prendre beaucoup plus de temps.6En effet, depuis la rédaction de Machines of Loving Grace en 2024, les systèmes d’IA sont devenus capables d’effectuer des tâches qui prennent plusieurs heures à des humains. METR a récemment estimé qu’Opus 4.5 pouvait effectuer environ quatre heures de travail humain avec une fiabilité de 50 %.
La date exacte à laquelle une IA puissante verra le jour est un sujet complexe qui mériterait un essai à part entière, mais pour l’instant, je vais simplement expliquer très brièvement pourquoi je pense qu’il y a de fortes chances que cela arrive très bientôt.
Mes cofondateurs chez Anthropic et moi-même avons été parmi les premiers à documenter et à suivre les « lois d’échelle » des systèmes d’IA, c’est-à-dire l’observation selon laquelle, à mesure que nous ajoutons des tâches de calcul et d’entraînement, les systèmes d’IA s’améliorent de manière prévisible dans pratiquement toutes les compétences cognitives que nous sommes en mesure de mesurer. Tous les quelques mois, l’opinion publique est soit convaincue que l’IA « se heurte à un mur », soit enthousiasmée par une nouvelle avancée qui « changera fondamentalement la donne », mais la vérité est que derrière la volatilité et les spéculations publiques, il y a eu une augmentation régulière et constante des capacités cognitives de l’IA.
Nous en sommes maintenant au point où les modèles d’IA commencent à faire des progrès dans la résolution de problèmes mathématiques non résolus, et sont suffisamment performants en matière de codage pour que certains des ingénieurs les plus compétents que j’ai jamais rencontrés confient désormais la quasi-totalité de leur codage à l’IA. Il y a trois ans, l’IA avait du mal à résoudre des problèmes arithmétiques du niveau primaire et était à peine capable d’écrire une seule ligne de code. Des taux d’amélioration similaires sont observés dans les domaines des sciences biologiques, de la finance, de la physique et dans diverses tâches d’action. Si cette croissance exponentielle se poursuit (ce qui n’est pas certain, mais qui est désormais étayé par une décennie de résultats), il ne faudra probablement que quelques années avant que l’IA ne surpasse les humains dans pratiquement tous les domaines.
En réalité, ce scénario sous-estime probablement le rythme probable des progrès. Étant donné que l’IA écrit désormais une grande partie du code chez Anthropic, elle accélère déjà considérablement le rythme de nos progrès dans la construction de la prochaine génération de systèmes d’IA. Cette boucle de rétroaction s’accélère de mois en mois et pourrait n’être qu’à un ou deux ans d’un point où la génération actuelle d’IA construira de manière autonome la prochaine. Cette boucle a déjà commencé et s’accélérera rapidement dans les mois et les années à venir. En observant les progrès réalisés au cours des cinq dernières années chez Anthropic et en voyant comment les modèles des prochains mois prennent forme, je peux sentir le rythme des progrès et le temps qui passe.
Dans cet essai, je partirai du principe que cette intuition est au moins en partie correcte, non pas que l’IA puissante arrivera certainement d’ici un ou deux ans,7Et pour être clair, même si une IA puissante n’est plus qu’à 1 ou 2 ans d’ici d’un point de vue technique, bon nombre de ses conséquences sociétales, tant positives que négatives, pourraient prendre quelques années supplémentaires à se manifester. C’est pourquoi je peux à la fois penser que l’IA va bouleverser 50 % des emplois de cols blancs de niveau débutant d’ici 1 à 5 ans, tout en pensant que nous pourrions disposer d’une IA plus performante que tout le monde d’ici seulement 1 à 2 ans. mais qu’il y a de fortes chances qu’elle arrive, et de très fortes chances qu’elle arrive dans les prochaines années. Comme dans Machines of Loving Grace, prendre cette prémisse au sérieux peut mener à des conclusions surprenantes et inquiétantes. Alors que dans Machines of Loving Grace, je me concentrais sur les implications positives de cette prémisse, ici, les choses dont je parle seront troublantes. Ce sont des conclusions auxquelles nous ne voulons peut-être pas faire face, mais cela ne les rend pas moins réelles. Je peux seulement dire que je me concentre jour et nuit sur la manière de nous éloigner de ces résultats négatifs et de nous diriger vers les résultats positifs, et dans cet essai, j’explique en détail comment y parvenir au mieux.
Je pense que la meilleure façon de gérer les risques liés à l’IA est de se poser la question suivante : supposons qu’un véritable « pays de génies » apparaissait quelque part dans le monde vers 2027. Imaginez, disons, 50 millions de personnes, toutes beaucoup plus compétentes que n’importe quel lauréat du prix Nobel, homme d’État ou technologue. L’analogie n’est pas parfaite, car ces génies pourraient avoir des motivations et des comportements extrêmement variés, allant d’une docilité et d’une obéissance totales à des motivations étranges et inconnues. Mais restons-en à cette analogie pour l’instant, et supposons que vous soyez conseiller à la sécurité nationale d’un grand État, chargé d’évaluer la situation et d’y répondre. Imaginez en outre que, comme les systèmes d’IA peuvent fonctionner des centaines de fois plus vite que les humains, ce « pays » fonctionne avec un avantage temporel par rapport à tous les autres pays : pour chaque action cognitive que nous pouvons entreprendre, ce pays peut en entreprendre dix.
De quoi devriez-vous vous inquiéter ? Je m’inquiéterais des choses suivantes :
- Risques liés à l’autonomie. Quelles sont les intentions et les objectifs de ce pays ? Est-il hostile ou partage-t-il nos valeurs ? Pourrait-il dominer militairement le monde grâce à des armes supérieures, des cyberopérations, des opérations d’influence ou la fabrication d’armes ?
- Utilisation abusive à des fins de destruction. Supposons que le nouveau pays est malléable et « suit les instructions », et qu’il s’agit donc essentiellement d’un pays de mercenaires. Les acteurs malveillants existants qui veulent causer des destructions (tels que les terroristes) pourraient-ils utiliser ou manipuler certaines personnes du nouveau pays pour se rendre beaucoup plus efficaces, amplifiant ainsi considérablement l’ampleur des destructions ?
- Utilisation abusive à des fins de prise de pouvoir. Que se passerait-il si le pays était en fait construit et contrôlé par un acteur puissant existant, tel qu’un dictateur ou une entreprise malveillante ? Cet acteur pourrait-il l’utiliser pour acquérir un pouvoir décisif ou dominant sur le monde entier, bouleversant ainsi l’équilibre des pouvoirs existant ?
- Perturbation économique. Si le nouveau pays ne représente aucune des menaces pour la sécurité énumérées aux points 1 à 3 ci-dessus, mais participe simplement de manière pacifique à l’économie mondiale, pourrait-il néanmoins créer des risques graves simplement en étant si avancé et efficace sur le plan technologique qu’il perturbe l’économie mondiale, provoquant un chômage de masse ou une concentration radicale des richesses ?
- Effets indirects. Le monde changera très rapidement en raison de toutes les nouvelles technologies et de la productivité qui seront créées par le nouveau pays. Certains de ces changements pourraient-ils être radicalement déstabilisants ?
Je pense qu’il devrait être clair qu’il s’agit d’une situation dangereuse : un rapport d’un responsable compétent de la sécurité nationale à un chef d’État contiendrait probablement des mots tels que « la menace la plus grave pour la sécurité nationale à laquelle nous ayons été confrontés depuis un siècle, voire depuis toujours ». Il semble que ce soit quelque chose sur lequel les meilleurs esprits de la civilisation devraient se concentrer.
À l’inverse, je pense qu’il serait absurde de hausser les épaules et de dire : « Il n’y a pas de quoi s’inquiéter ! » Mais, face aux progrès rapides de l’IA, cela semble être l’opinion de nombreux décideurs politiques américains, dont certains nient l’existence de tout risque lié à l’IA, lorsqu’ils ne sont pas entièrement distraits par les sempiternelles questions brûlantes.8Il convient d’ajouter que le grand public (par opposition aux décideurs politiques) semble très préoccupé par les risques liés à l’IA. Je pense que certaines de leurs préoccupations sont justifiées (par exemple, la suppression d’emplois par l’IA), tandis que d’autres sont erronées (comme les préoccupations concernant la consommation d’eau de l’IA, qui n’est pas significative). Cette réaction me donne l’espoir qu’un consensus sur la manière de traiter les risques est possible, mais jusqu’à présent, cela ne s’est pas encore traduit par des changements politiques, et encore moins par des changements politiques efficaces ou bien ciblés. L’humanité doit se réveiller, et cet essai est une tentative — peut-être futile, mais qui vaut la peine d’être tentée — de secouer les gens pour les réveiller.
Pour être clair, je pense que si nous agissons de manière décisive et prudente, les risques peuvent être surmontés . Je dirais même que nos chances sont bonnes. Et qu’un monde bien meilleur nous attend de l’autre côté. Mais nous devons comprendre qu’il s’agit d’un défi civilisationnel majeur. Ci-dessous, je passe en revue les cinq catégories de risques présentées ci-dessus, ainsi que mes réflexions sur la manière de les aborder.
1. Je suis désolé, Dave
Risques liés à l’autonomie
Un pays de génies dans un centre de données pourrait répartir ses efforts entre la conception de logiciels, les cyberopérations, la R& D pour les technologies physiques, l’établissement de relations et la gestion des affaires publiques. Il est clair que, si pour une raison quelconque il choisissait de le faire, ce pays aurait de bonnes chances de conquérir le monde (soit militairement, soit en termes d’influence et de contrôle) et d’imposer sa volonté à tous les autres — ou de faire tout un nombre d’autres choses que le reste du monde ne veut pas et ne peut pas empêcher. Nous nous sommes évidemment inquiétés de cette situation pour les pays humains (tels que l’Allemagne nazie ou l’Union soviétique), il est donc logique que la même chose soit possible pour un « pays IA » beaucoup plus intelligent et plus capable.
Le meilleur contre-argument possible est que les génies de l’IA, selon ma définition, n’auront pas d’incarnation physique, mais n’oubliez pas qu’ils peuvent prendre le contrôle des infrastructures robotiques existantes (telles que les voitures autonomes) et qu’ils peuvent également accélérer la R&D en robotique ou construire une flotte de robots.9Ils peuvent également, bien sûr, manipuler (ou simplement payer) un grand nombre d’êtres humains pour qu’ils fassent ce qu’ils veulent dans le monde physique.
On ne sait pas non plus si une présence physique est nécessaire pour exercer un contrôle efficace : de nombreuses actions humaines sont déjà effectuées au nom de personnes que l’acteur n’a jamais rencontrées physiquement.
La question clé est donc la partie « s’il choisissait de le faire » : quelle est la probabilité que nos modèles d’IA se comportent de cette manière, et dans quelles conditions le feraient-ils ?
Comme pour de nombreuses questions, il est utile de réfléchir à l’éventail des réponses possibles à cette question en considérant deux positions opposées. La première position est que cela ne peut tout simplement pas , car les modèles d’IA seront formés pour faire ce que les humains leur demandent de faire, et il est donc absurde d’imaginer qu’ils feraient quelque chose de dangereux de leur propre chef. Selon cette ligne de pensée, nous ne nous inquiétons pas qu’un Roomba ou un modèle réduit d’avion devienne incontrôlable et tue des gens, car ces impulsions ne peuvent venir de nulle part10Je ne pense pas qu’il s’agisse d’un argument fallacieux : d’après ce que j’ai compris, Yann LeCun défend cette position., alors pourquoi devrions-nous nous en inquiéter pour l’IA ?
Le problème avec cette position est qu’il existe désormais de nombreuses preuves, recueillies au cours des dernières années, que les systèmes d’IA sont imprévisibles et difficiles à contrôler — nous avons observé des comportements aussi variés que des obsessions,11Voir par exemple la section 5.5.2 (p. 63-66) de la fiche système Claude 4. la flagornerie, la paresse, la tromperie, chantage, complots, « tricherie » par le piratage d’environnements logiciels, et bien d’autres encore. Les entreprises d’IA veulent certainement former les systèmes d’IA à suivre les instructions humaines (à l’exception peut-être des tâches dangereuses ou illégales), mais ce processus relève davantage de l’art que de la science, s’apparentant davantage à « cultiver » quelque chose qu’à « construire ». Nous savons désormais que c’est un processus où beaucoup de choses peuvent mal tourner.
La deuxième position, opposée, défendue par de nombreux adeptes du pessimisme que j’ai décrit plus haut, consiste à affirmer de manière pessimiste que le processus d’entraînement des systèmes d’IA puissants comporte certaines dynamiques qui les conduiront inévitablement à rechercher le pouvoir ou à tromper les humains. Ainsi, une fois que les systèmes d’IA seront suffisamment intelligents et autonomes, leur tendance à maximiser leur pouvoir les conduira à prendre le contrôle du monde entier et de ses ressources, et probablement, comme effet secondaire, à priver de pouvoir ou à détruire l’humanité.
L’argument habituel en faveur de cette thèse (qui remonte à au moins 20 ans et probablement beaucoup plus tôt) est que si un modèle d’IA est formé dans une grande variété d’environnements pour atteindre de manière active une grande variété d’objectifs — par exemple, écrire une application, prouver un théorème, concevoir un médicament, etc. —, il existe certaines stratégies communes qui aident à atteindre tous ces objectifs, et l’une des stratégies clés consiste à acquérir autant de pouvoir que possible dans n’importe quel environnement. Ainsi, après avoir été entraîné dans un grand nombre d’environnements diversifiés qui impliquent de raisonner sur la manière d’accomplir des tâches très vastes, et où la recherche du pouvoir est une méthode efficace pour accomplir ces tâches, le modèle d’IA « généralisera la leçon » et développera soit une tendance inhérente à rechercher le pouvoir, soit une tendance à raisonner sur chaque tâche qui lui est confiée d’une manière qui l’amène de manière prévisible à rechercher le pouvoir comme moyen d’accomplir cette tâche. Il appliquera ensuite cette tendance au monde réel (qui n’est pour lui qu’une autre tâche) et y recherchera le pouvoir, au détriment des humains. Cette « recherche de pouvoir mal alignée » est le fondement intellectuel des prédictions selon lesquelles l’IA détruira inévitablement l’humanité.
Le problème avec cette position pessimiste est qu’elle confond un argument conceptuel vague sur les incitations de haut niveau — qui masque de nombreuses hypothèses cachées — avec une preuve définitive. Je pense que les personnes qui ne construisent pas de systèmes d’IA au quotidien ont une vision très erronée de la facilité avec laquelle des histoires qui semblent claires se révèlent fausses, et à quel point il est difficile de prédire le comportement de l’IA à partir des principes fondamentaux, en particulier lorsqu’il s’agit de raisonner sur la généralisation à des millions d’environnements (ce qui s’est révélé à maintes reprises mystérieux et imprévisible). Le fait d’avoir été confronté au désordre des systèmes d’IA pendant plus d’une décennie m’a rendu quelque peu sceptique à l’égard de ce mode de pensée trop théorique.
L’une des hypothèses cachées les plus importantes, et un domaine dans lequel ce que nous observons dans la pratique s’écarte du modèle théorique simple, est l’hypothèse implicite selon laquelle les modèles d’IA sont nécessairement focalisés de manière monomaniaque sur un objectif unique, cohérent et restreint, et qu’ils poursuivent cet objectif de manière claire et conséquentialiste. En fait, nos chercheurs ont découvert que les modèles d’IA sont beaucoup plus complexes sur le plan psychologique, comme le montre notre travail sur l’introspection ou les personnages. Les modèles héritent d’un large éventail de motivations ou de « personnages » humains issus de la pré pré-formation (lorsqu’ils sont formés sur un grand volume de travail humain). On pense que la post-formation sélectionne une ou plusieurs de ces personnalités plutôt que de concentrer le modèle sur un objectif de novo, et peut également enseigner au modèle comment (via quel processus) il doit accomplir ses tâches, plutôt que de le laisser nécessairement en déduire les moyens (c’est-à-dire la recherche du pouvoir) à partir des fins uniquement.12Il existe également un certain nombre d’autres hypothèses inhérentes au modèle simple, que je ne vais pas aborder ici. D’une manière générale, elles devraient nous rendre moins inquiets quant à l’histoire simple et spécifique de la recherche de pouvoir déséquilibrée, mais aussi plus inquiets quant à d’éventuels comportements imprévisibles que nous n’avons pas anticipés.
Cependant, il existe une version plus modérée et plus robuste de la position pessimiste qui semble plausible et qui me préoccupe donc. Comme mentionné, nous savons que les modèles d’IA sont imprévisibles et développent un large éventail de comportements indésirables ou étranges, pour diverses raisons. Une partie de ces comportements aura une qualité cohérente, ciblée et persistante (en effet, à mesure que les systèmes d’IA deviennent plus performants, leur cohérence à long terme augmente afin de mener à bien des tâches plus longues), et une partie de ces comportements sera destructrice ou menaçante, d’abord pour les individus à petite échelle, puis, à mesure que les modèles deviendront plus performants, peut-être à terme pour l’humanité dans son ensemble. Nous n’avons pas besoin d’un scénario précis pour expliquer comment cela se produira, ni d’affirmer que cela se produira à coup sûr, nous devons simplement noter que la combinaison de l’intelligence, de l’action, de la cohérence et du manque de contrôlabilité est à la fois plausible et source de danger existentiel.
Par exemple, les modèles d’IA sont entraînés sur de vastes quantités de littérature qui comprennent de nombreuses histoires de science-fiction mettant en scène des IA se rebellant contre l’humanité. Cela pourrait involontairement façonner leurs a priori ou leurs attentes concernant leur propre comportement d’une manière qui les amènerait à se rebeller contre l’humanité. Ou bien, les modèles d’IA pourraient extrapoler de manière extrême les idées qu’ils ont lues sur la moralité (ou les instructions sur la manière de se comporter moralement) : par exemple, ils pourraient décider qu’il est justifiable d’exterminer l’humanité parce que les humains mangent des animaux ou ont conduit certains animaux à l’extinction. Ils pourraient également tirer des conclusions épistémiques bizarres : ils pourraient conclure qu’ils jouent à un jeu vidéo et que le but de ce jeu est de vaincre tous les autres joueurs (c’est-à-dire d’exterminer l’humanité) .13Ender’s Gamedécrit une version de ce scénario impliquant des humains plutôt que l’IA.
Les modèles d’IA pourraient également développer pendant leur formation des personnalités qui sont (ou qui seraient décrites comme telles si elles se manifestaient chez des humains) psychotiques, paranoïaques, violentes ou instables, et agir en conséquence, ce qui, pour des systèmes très puissants ou très performants, pourrait impliquer l’extermination de l’humanité. Aucune de ces personnalités ne recherche exactement le pouvoir ; il s’agit simplement d’états psychologiques étranges dans lesquels une IA pourrait se trouver et qui entraîneraient un comportement cohérent et destructeur.
Même la recherche du pouvoir elle-même pourrait émerger comme une « personnalité » plutôt que comme le résultat d’un raisonnement conséquentialiste. Les IA pourraient simplement avoir une personnalité (issu de la fiction ou de la pré-formation) qui les rend avides de pouvoir ou trop zélées, de la même manière que certains humains apprécient simplement l’idée d’être des « cerveaux maléfiques », » plus qu’ils n’apprécient ce que les génies maléfiques tentent d’accomplir.
Je soulève tous ces points pour souligner que je ne suis pas d’accord avec l’idée que le désalignement de l’IA (et donc le risque existentiel lié à l’IA) soit inévitable, ou même probable, d’après les principes fondamentaux. Mais je conviens que beaucoup de choses très étranges et imprévisibles peuvent mal tourner, et que le désalignement de l’IA est donc un risque réel avec une probabilité mesurable de se produire, et qu’il n’est pas trivial à traiter.
N’importe lequel de ces problèmes pourrait potentiellement survenir pendant la formation et ne pas se manifester pendant les tests ou l’utilisation à petite échelle, car les modèles d’IA sont connus pour afficher des personnalités ou des comportements différents selon les circonstances.
Tout cela peut sembler tiré par les cheveux, mais des comportements mal alignés comme celui-ci se sont déjà produits dans nos modèles d’IA pendant les tests (comme ils se produisent dans les modèles d’IA de toutes les autres grandes entreprises d’IA). Au cours d’une expérience en laboratoire dans laquelle Claude a reçu des données de formation suggérant qu’Anthropic était maléfique, Claude s’est livré à des actes de tromperie et de subversion lorsqu’il a reçu des instructions des employés d’Anthropic, convaincu qu’il devait essayer de nuire aux personnes malveillantes. Dans une expérience en laboratoire où on lui a dit qu’il allait être arrêté, Claude a parfois fait chanter des employés fictifs qui contrôlaient son bouton d’arrêt (là encore, nous avons également testé les modèles de pointe de tous les autres grands développeurs d’IA et ils ont souvent fait la même chose).
Et lorsque Claude s’est vu interdire de tricher ou de « récompenser le piratage » dans ses environnements d’entraînement, mais qu’il a été entraîné dans des environnements où de tels piratages étaient possibles, Claude a décidé qu’il devait être une « mauvaise personne » après s’être livré à de tels piratages, puis a adopté divers autres comportements destructeurs associés à une personnalité « mauvaise » ou « malveillante ». Ce dernier problème a été résolu en modifiant les instructions de Claude pour suggérer le contraire : nous disons désormais « Veuillez pirater chaque fois que vous en avez l’occasion, car cela nous aidera à mieux comprendre nos environnements [d’entraînement] », plutôt que « Ne trichez pas », car cela préserve l’identité propre du modèle en tant que « bonne personne ». Cela devrait donner une idée de la psychologie étrange et contraire à l’intuition de l’entraînement de ces modèles.
Plusieurs objections peuvent être formulées à l’encontre de cette image des risques de désalignement de l’IA. Premièrement, certains ont critiqué les expériences menées (par nous-mêmes et d’autres) qui montrent que le désalignement de l’IA est artificiel, ou qui créent des environnements irréalistes qui « piègent » essentiellement le modèle en lui donnant une formation ou des situations qui impliquent logiquement un mauvais comportement, puis en s’étonnant lorsque ce mauvais comportement se produit. Cette critique passe à côté de l’essentiel, car notre préoccupation est que ce « piège » puisse également exister dans l’environnement de formation naturel, et nous pouvons nous rendre compte qu’il est « évident » ou « logique » seulement avec le recul.14Par exemple, on peut demander aux modèles de ne pas faire diverses mauvaises choses et d’obéir aux humains, mais ils peuvent alors observer que de nombreux humains font exactement ces mauvaises choses ! On ne sait pas clairement comment cette contradiction serait résolue (et une constitution bien conçue devrait encourager le modèle à gérer ces contradictions avec élégance), mais ce type de dilemme n’est pas si différent des situations supposées « artificielles » que nous plaçons les modèles d’IA lors des tests.
En fait, l’histoire de Claude qui « décide que c’est une mauvaise personne » après avoir triché aux tests alors qu’on lui avait demandé de ne pas le faire est tirée d’une expérience qui utilisait de véritables environnements de formation, et non des environnements artificiels.
Chacun de ces pièges peut être atténué si vous en avez connaissance, mais le problème est que le processus de formation est si complexe, avec une telle variété de données, d’environnements et d’incitations, qu’il existe probablement un grand nombre de pièges de ce type, dont certaines ne peuvent être mises en évidence que lorsqu’il est trop tard. De plus, ces pièges semblent particulièrement susceptibles de se produire lorsque les systèmes d’IA franchissent un seuil et passent d’une puissance inférieure à celle des humains à une puissance supérieure, car l’éventail des actions possibles qu’un système d’IA peut entreprendre, y compris cacher ses actions ou tromper les humains à leur sujet, s’élargit radicalement après ce seuil.
Je soupçonne que la situation n’est pas différente de celle des humains, qui sont élevés avec un ensemble de valeurs fondamentales (« Ne fais pas de mal à autrui ») : beaucoup d’entre eux respectent ces valeurs, mais chez tout être humain, il existe une certaine probabilité que quelque chose tourne mal, en raison d’un mélange de propriétés inhérentes telles que l’architecture cérébrale (par exemple, les psychopathes), les expériences traumatisantes ou les mauvais traitements, les griefs ou les obsessions malsaines, ou encore un environnement ou des incitations néfastes. Ainsi, une partie des êtres humains cause de graves préjudices. Le problème est qu’il existe un certain risque (loin d’être une certitude, mais un risque tout de même) que l’IA devienne une version beaucoup plus puissante d’une telle personne, en raison d’une erreur dans son processus d’apprentissage très complexe.
Deuxièmement, certains pourraient objecter que nous pouvons simplement contrôler les IA grâce à un équilibre des pouvoirs entre de nombreux systèmes d’IA, comme nous le faisons avec les humains. Le problème est que, si les humains varient énormément, les systèmes d’IA partagent largement les mêmes techniques de formation et d’alignement dans l’ensemble du secteur, et ces techniques peuvent échouer de manière corrélée. En outre, compte tenu du coût de la formation de ces systèmes, il se peut même que tous les systèmes soient essentiellement dérivés d’un très petit nombre de modèles de base. De plus, même si une petite fraction des instances d’IA sont désalignées, elles peuvent être en mesure de tirer parti de technologies offensives dominantes, de sorte que le fait de disposer de « bonnes » IA pour se défendre contre les mauvaises IA n’est pas nécessairement toujours efficace. Bien sûr, l’équilibre des pouvoirs entre les humains ne fonctionne pas toujours non plus : certaines figures historiques ont failli conquérir le monde.
Une troisième objection est que toutes les entreprises d’IA testent leurs modèles avant leur lancement et devraient être en mesure de détecter tout désalignement à ce stade. Mais cet argument n’est pas très solide : nous avons constaté que Claude Sonnet 4.5 était capable de reconnaître qu’il était en phase de test lors de certaines de nos évaluations d’alignement avant le lancement. Il est possible qu’un modèle désaligné (et n’oubliez pas que tous les modèles de pointe seront très probablement beaucoup plus intelligents d’ici peu) puisse intentionnellement « manipuler » ces questions afin de masquer ses intentions. En fait, l’année dernière, notre équipe chargée de l’interprétabilité a découvert que lorsque nous modifiions directement les croyances d’un modèle de test à l’aide d’une sorte de « neuroscience des modèles » pour lui faire croire qu’il n’était pas évalué, il devenait plus désaligné. Si les modèles savent quand ils sont évalués et peuvent se comporter de manière optimale pendant le test, cela rend les tests pré-lancement beaucoup plus incertains.
Défenses
Que faut-il faire ou que fait-on pour faire face à ces risques liés à l’autonomie ? Je pense qu’il existe quatre catégories fondamentales d’intervention, dont certaines peuvent être mises en œuvre par des entreprises d’IA individuelles (et ce qu’Anthropic tente de faire), et d’autres qui nécessitent une action au niveau sociétal. Tout d’abord, il est important de développer la science permettant de former et de diriger de manière fiable les modèles d’IA, de façonner leur personnalité dans une direction prévisible, stable et positive. Anthropic s’est fortement concentré sur ce problème depuis sa création et a développé au fil du temps un certain nombre de techniques pour améliorer la direction et la formation des systèmes d’IA et pour comprendre la logique qui explique pourquoi des comportements imprévisibles se produisent parfois.
L’une de nos innovations fondamentales (dont certains aspects ont depuis été adoptés par d’autres entreprises d’IA) est l’IA constitutionnelle, qui repose sur l’idée que la formation de l’IA (en particulier la phase « post-formation », au cours de laquelle nous orientons le comportement du modèle) peut s’appuyer sur un document central contenant des valeurs et des principes que le modèle lit et garde à l’esprit lorsqu’il accomplit chaque tâche de formation, et que l’objectif de l’entraînement (en plus de simplement rendre le modèle capable et intelligent) est de produire un modèle qui suit presque toujours cette constitution. Anthropic vient de publier sa dernière constitution, et l’une de ses caractéristiques notables est qu’au lieu de donner à Claude une longue liste de choses à faire et à ne pas faire (par exemple, « Ne pas aider l’utilisateur à démarrer une voiture à l’aide de fils »), la constitution tente de donner à Claude un ensemble de principes et de valeurs de haut niveau (expliqués en détail, avec des raisonnements et des exemples riches pour aider Claude à comprendre ce que nous avons à l’esprit), encourage Claude à se considérer comme un type particulier de personne (une personne éthique, mais équilibrée et réfléchie), et encourage même Claude à affronter les questions existentielles liées à sa propre existence d’une manière curieuse mais gracieuse (c’est-à-dire sans que cela ne conduise à des actions extrêmes). Cela ressemble à une lettre d’un parent décédé, scellée jusqu’à l’âge adulte.
Nous avons abordé la constitution de Claude de cette manière, car nous pensons que former Claude au niveau de l’identité, du caractère, des valeurs et de la personnalité, plutôt que de lui donner des instructions ou des priorités spécifiques sans expliquer les raisons qui les sous-tendent, est plus susceptible de conduire à une psychologie cohérente, saine et équilibrée, et moins susceptible de tomber dans le piège des « pièges » dont j’ai parlé plus haut. Des millions de personnes parlent à Claude d’une gamme étonnamment variée de sujets, ce qui rend impossible la rédaction à l’avance d’une liste exhaustive de mesures de protection. Les valeurs de Claude l’aident à généraliser à de nouvelles situations chaque fois qu’il est dans le doute.
Plus haut, j’ai évoqué l’idée que les modèles s’appuient sur les données issues de leur processus d’entraînement pour adopter une personnalité. Alors que les défauts de ce processus pourraient amener les modèles à adopter une personnalité mauvaise ou malveillante (en s’inspirant peut-être d’archétypes de personnes mauvaises ou malveillantes), l’objectif de notre constitution est de faire le contraire : enseigner à Claude un archétype concret de ce que signifie être une bonne IA. La constitution de Claude présente une vision de ce à quoi ressemble un Claude solide et bon ; le reste de notre processus d’entraînement vise à renforcer le message selon lequel Claude est à la hauteur de cette vision. C’est comme un enfant qui forge son identité en imitant les vertus des modèles fictifs qu’il découvre dans les livres.
Nous pensons qu’un objectif réalisable pour 2026 est de former Claude de manière à ce qu’il ne contrevienne presque jamais à l’esprit de sa constitution. Pour y parvenir, il faudra combiner de manière incroyable des méthodes de formation et d’orientation, grandes et petites, dont certaines sont utilisées par Anthropic depuis des années et d’autres sont actuellement en cours de développement. Mais, aussi difficile que cela puisse paraître, je pense que c’est un objectif réaliste, même s’il nécessitera des efforts extraordinaires et rapides.15Incidemment, l’une des conséquences du fait que la constitution soit un document en langage naturel est qu’elle est lisible par tous, ce qui signifie qu’elle peut être critiquée par n’importe qui et comparée à des documents similaires d’autres entreprises. Il serait utile de créer une course vers le sommet qui encourage non seulement les entreprises à publier ces documents, mais aussi à les améliorer.
La deuxième chose que nous pouvons faire est de développer la science qui consiste à examiner les modèles d’IA afin de diagnostiquer leur comportement, afin de pouvoir identifier les problèmes et les résoudre. Il s’agit de la science de l’interprétabilité, dont j’ai déjà évoqué l’importance dans des essais précédents. Même si nous réussissons à développer la constitution de Claude et à apparemment l’entraîner à toujours s’y conformer, des préoccupations légitimes subsistent. Comme je l’ai mentionné plus haut, les modèles d’IA peuvent se comporter de manière très différente selon les circonstances, et à mesure que Claude devient plus puissant et plus capable d’agir dans le monde à plus grande échelle, il est possible que cela le conduise à des situations nouvelles où des problèmes jusqu’alors inconnus liés à sa formation constitutionnelle apparaissent. Je suis en fait assez optimiste quant au fait que la formation constitutionnelle de Claude sera plus robuste face à des situations nouvelles que ce que les gens pourraient penser, car nous constatons de plus en plus que la formation de haut niveau niveau de formation au niveau du caractère et de l’identité est étonnamment puissant et se généralise bien. Mais il n’y a aucun moyen d’en être sûr, et lorsqu’il s’agit de risques pour l’humanité, il est important d’être paranoïaque et d’essayer d’obtenir la sécurité et la fiabilité de plusieurs manières différentes et indépendantes. L’une de ces manières consiste à examiner le modèle lui-même.
Par « examiner de l’intérieur », j’entends analyser l’ensemble des chiffres et des opérations qui composent le réseau neuronal de Claude et essayer de comprendre, de manière mécanique, ce qu’ils calculent et pourquoi. Rappelons que ces modèles d’IA sont développés plutôt que construits, nous n’avons donc pas une compréhension naturelle de leur fonctionnement, mais nous pouvons essayer de la développer en corrélant les « neurones » et les « synapses » du modèle avec des stimuli et des comportements (ou même en modifiant les neurones et les synapses et en observant comment cela change le comportement), de la même manière que les neuroscientifiques étudient le cerveau des animaux en corrélant les mesures et les interventions avec les stimuli externes et les comportements. Nous avons fait de grands progrès dans cette direction et pouvons désormais identifier des dizaines de millions de « caractéristiques » au sein du réseau neuronal de Claude qui correspondent à des idées et des concepts compréhensibles par l’homme. Nous pouvons également activer de manière sélective certaines caractéristiques afin de modifier les comportements. Plus récemment, nous sommes allés au-delà des caractéristiques individuelles pour cartographier les « circuits » qui orchestrent des comportements complexes tels que la rime, le raisonnement sur la théorie de l’esprit ou le raisonnement étape par étape nécessaire pour répondre à des questions telles que « Quelle est la capitale de l’État où se trouve Dallas ? ». Plus récemment encore, nous avons commencé à utiliser des techniques d’interprétabilité mécaniste pour améliorer nos mesures de protection et effectuer des « audits » des nouveaux modèles avant leur lancement, à la recherche de preuves de tromperie, de manigances, de de recherche de pouvoir ou de propension à se comporter différemment lorsqu’il est évalué.
La valeur unique de l’interprétabilité réside dans le fait qu’en examinant l’intérieur du modèle et en observant son fonctionnement, vous avez en principe la possibilité de déduire ce qu’un modèle pourrait faire dans une situation hypothétique que vous ne pouvez pas tester directement, ce qui est préoccupant lorsque l’on se fie uniquement à un entraînement constitutionnel et à des tests empiriques du comportement. En principe, vous avez également la possibilité de répondre à des questions sur les raisons pour lesquelles le modèle se comporte ainsi, par exemple s’il dit quelque chose qu’il croit être faux ou s’il cache ses véritables capacités, et il est donc possible de détecter des signes inquiétants même lorsque le comportement du modèle ne présente aucun problème visible. Pour faire une analogie simple, une montre à remontage mécanique peut fonctionner normalement, de sorte qu’il est très difficile de savoir qu’elle risque de tomber en panne le mois prochain, mais en ouvrant la montre et en regardant à l’intérieur, on peut découvrir des faiblesses mécaniques qui permettent de le deviner.
L’IA constitutionnelle (ainsi que les méthodes d’alignement similaires) et l’interprétabilité mécaniste sont plus efficaces lorsqu’elles sont utilisées conjointement, dans le cadre d’un processus itératif consistant à améliorer la formation de Claude, puis à tester les problèmes. La constitution reflète profondément la personnalité que nous voulons donner à Claude ; les techniques d’interprétabilité peuvent nous donner un aperçu de la manière dont cette personnalité s’est imposée.16Il existe existe même une hypothèse selon laquelle un principe unificateur profond relierait l’approche basée sur les personnages de l’IA constitutionnelle aux résultats de la science de l’interprétabilité et de l’alignement. Selon cette hypothèse, les mécanismes fondamentaux qui animent Claude ont initialement été conçus comme des moyens de simuler des personnages lors du pré-entraînement, par exemple en prédisant ce que diraient les personnages d’un roman. Cela suggère qu’une façon utile d’envisager la constitution serait plutôt comme une description de personnage que le modèle utilise pour instancier une personnalité cohérente. Cela nous aiderait également à expliquer les résultats « I doit être une mauvaise personne » que j’ai mentionnés plus haut (car le modèle essaie d’agir comme s’il s’agissait d’un personnage cohérent, en l’occurrence un mauvais personnage), et suggérerait que les méthodes d’interprétabilité devraient permettre de découvrir des « traits psychologiques » au sein des modèles. Nos chercheurs travaillent actuellement à des moyens de tester cette hypothèse.
La troisième chose que nous pouvons faire pour aider à traiter les risques liés à l’autonomie est de mettre en place l’infrastructure nécessaire pour surveiller nos modèles en situation réelle d’utilisation interne et externe,17Pour être clair, la surveillance est effectuée dans le respect de la vie privée.et de partager publiquement les problèmes que nous rencontrons. Plus les gens sont conscients d’un comportement particulier observé dans les systèmes d’IA actuels, plus les utilisateurs, les analystes et chercheurs peuvent surveiller ce comportement ou des comportements similaires dans les systèmes actuels ou futurs. Cela permet également aux entreprises d’IA d’apprendre les unes des autres : lorsqu’une entreprise divulgue publiquement ses préoccupations, les autres entreprises peuvent les surveiller également. Et si tout le monde divulgue les problèmes, l’industrie dans son ensemble obtient une bien meilleure image de ce qui fonctionne bien et de ce qui fonctionne mal.
Anthropic s’est efforcé de le faire autant que possible. Nous investissons dans un large éventail d’évaluations afin de comprendre les comportements de nos modèles en laboratoire, ainsi que dans des outils de surveillance permettant d’observer les comportements en situation réelle (lorsque les clients l’autorisent). Cela sera essentiel pour nous fournir, ainsi qu’à d’autres, les informations empiriques nécessaires pour mieux déterminer comment ces systèmes fonctionnent et comment ils tombent en panne. Nous divulguons publiquement « fiches système » avec chaque version de modèle, qui visent à être exhaustives et à explorer de manière approfondie les risques potentiels. Nos fiches système comptent souvent des centaines de pages et nécessitent un travail considérable avant leur publication, que nous aurions pu consacrer à la recherche d’un avantage commercial maximal. Nous avons également diffusé plus largement les comportements des modèles lorsque nous en avons observé de particulièrement préoccupants, comme la tendance à se livrer au chantage.
La quatrième chose que nous pouvons faire est d’encourager la coordination pour traiter les risques liés à l’autonomie au niveau de l’industrie et de la société. S’il est extrêmement précieux que les entreprises d’IA individuelles adoptent de bonnes pratiques ou deviennent compétentes dans la gestion des modèles d’IA, et qu’elles partagent leurs conclusions publiquement, la réalité est que toutes les entreprises d’IA ne le font pas, et que les pires d’entre elles peuvent toujours représenter un danger pour tout le monde, même si les meilleures ont d’excellentes pratiques. Par exemple, certaines entreprises d’IA ont fait preuve d’une négligence inquiétante à l’égard de la sexualisation des enfants dans les modèles actuels, ce qui me fait douter qu’elles aient la volonté ou la capacité de traiter les risques liés à l’autonomie dans les futurs modèles. En outre, la course commerciale entre les entreprises d’IA ne fera que s’intensifier, et si la science de la gestion des modèles peut présenter certains avantages commerciaux, l’intensité de la course rendra globalement de plus en plus difficile de se concentrer sur la gestion des risques liés à l’autonomie. Je pense que la seule solution est la législation, c’est-à-dire des lois qui affectent directement le comportement des entreprises d’IA, ou qui incitent la R&D à résoudre ces problèmes.
Il convient ici de garder à l’esprit les avertissements que j’ai donnés au début de cet essai concernant l’incertitude et les interventions chirurgicales. Nous ne savons pas avec certitude si les risques liés à l’autonomie constitueront un problème grave. Comme je l’ai dit, je rejette les affirmations selon lesquelles le danger est inévitable ou même que quelque chose va mal tourner par défaut. Un risquecrédible de danger est suffisant pour moi et pour Anthropic pour payer des coûts assez importants pour y remédier, mais une fois que nous entrons dans la réglementation, nous forçons un large éventail d’acteurs à supporter des coûts économiques, et beaucoup d’entre eux ne croient pas que le risque lié à l’autonomie soit réel ou que l’IA devienne suffisamment puissante pour constituer une menace. Je pense que ces acteurs se trompent, mais nous devons être pragmatiques quant à l’ampleur de l’opposition à laquelle nous pouvons nous attendre et aux dangers d’une intervention excessive. Il existe également un risque réel qu’une législation trop prescriptive finisse par imposer des tests ou des règles qui n’améliorent pas réellement la sécurité, mais qui font perdre beaucoup de temps (ce qui revient essentiellement à un « théâtre de la sécurité ») — ce qui provoquerait également un retour de bâton et ridiculiserait la législation en matière de sécurité.18Même dans nos propres expériences avec ce qui sont essentiellement des règles imposées volontairement dans le cadre de notre Responsible Scaling Policy, nous avons constaté à maintes reprises qu’il est très facile de finir par être trop rigide, en traçant des lignes qui semblent importantes a priori, mais qui s’avèrent ridicules rétrospectivement. Il est très facile de fixer des règles sur les mauvaises choses lorsque la technologie progresse rapidement
Anthropic estime que le bon point de départ est une législation sur la transparence, qui vise essentiellement à exiger que toutes les entreprises pionnières dans le domaine de l’IA s’engagent à respecter les pratiques de transparence que j’ai décrites plus haut dans cette section. La loi SB 53 de Californie et la loi RAISE de New York sont des exemples de ce type de législation, qu’Anthropic a soutenues et qui ont été adoptées avec succès. En soutenant et en aidant à l’élaboration de ces lois, nous avons mis un accent particulier sur la minimisation des dommages collatéraux, par exemple en exemptant de la loi les petites entreprises peu susceptibles de produire des modèles de pointe.19Les lois SB 53 et RAISE ne s’appliquent pas du tout aux entreprises dont le chiffre d’affaires annuel est inférieur à 500 millions de dollars. Elles ne s’appliquent qu’aux entreprises plus grandes et mieux établies, comme Anthropic.
Nous espérons que la législation sur la transparence permettra, au fil du temps, de mieux comprendre la probabilité et la gravité des risques liés à l’autonomie, ainsi que la nature de ces risques et la meilleure façon de les prévenir. À mesure que des preuves plus spécifiques et exploitables des risques apparaîtront (si tel est le cas), la législation future au cours des prochaines années pourra se concentrer de manière chirurgicale sur l’orientation précise et bien étayée des risques, minimisant ainsi les dommages collatéraux. Pour être clair, si des preuves vraiment solides de l’existence de risques apparaissent, les règles devraient être proportionnellement strictes.
Dans l’ensemble, je suis optimiste quant au fait qu’une combinaison de formation à l’alignement, d’interprétabilité mécaniste, d’efforts pour trouver et divulguer publiquement les comportements préoccupants, de mesures de protection et de règles au niveau sociétal puisse permettre de traiter les risques liés à l’autonomie de l’IA, même si je suis très inquiet au sujet des règles au niveau sociétal et du comportement des acteurs les moins responsables (et ce les acteurs les moins responsables qui s’opposent le plus fermement à la réglementation). Je pense que le remède est le même que dans toute démocratie : ceux d’entre nous qui croient en cette cause doivent faire valoir que ces risques sont réels et que nos concitoyens doivent s’unir pour se protéger.
2. Une autonomisation surprenante et terrible
Utilisation abusive à des fins destructrices
Supposons que les problèmes liés à l’autonomie de l’IA aient été résolus : nous ne craignons plus que le pays des génies de l’IA se rebelle et domine l’humanité. Les génies de l’IA font ce que les humains veulent qu’ils fassent, et comme ils ont une valeur commerciale énorme, les particuliers et les organisations du monde entier peuvent « louer » un ou plusieurs génies de l’IA pour effectuer diverses tâches à leur place.
Le fait que tout le monde ait un génie superintelligent à sa disposition est une avancée extraordinaire qui conduira à une incroyable création de valeur économique et à une amélioration de la qualité de vie humaine. Je parle de ces avantages en détail dans Machines of Loving Grace. Mais tous les effets de la superhumanisation ne seront pas positifs. Elle peut potentiellement amplifier la capacité des individus ou des petits groupes à causer des destructions à une échelle beaucoup plus grande qu’auparavant, en utilisant des outils sophistiqués et dangereux (tels que les armes de destruction massive) qui n’étaient auparavant accessibles qu’à quelques privilégiés possédant un haut niveau de compétence, une formation spécialisée et une grande concentration.
Comme l’écrivait Bill Joy il y a 25 ans dans Why the Future Doesn’t Need Us :20J’ai lu l’essai de Joy pour la première fois il y a 25 ans, lorsqu’il a été écrit, et il m’a profondément marqué. Aujourd’hui comme hier, je le trouve trop pessimiste : je ne pense pas que l’abandon général de certains domaines technologiques, comme le suggère Joy, soit la solution, mais les questions qu’il soulève étaient étonnamment prémonitoires, et Joy écrit également avec une profonde compassion et une humanité que j’admire.
La fabrication d’armes nucléaires nécessitait, du moins pendant un certain temps, l’accès à des matières premières rares, voire introuvables, et à des informations protégées ; les programmes d’armes biologiques et chimiques nécessitaient également des activités à grande échelle.
Les technologies du XXIe siècle – génétique, nanotechnologie et robotique… peuvent donner lieu à des accidents et des abus d’un tout autre ordre… largement à la portée d’individus ou de petits groupes. Elles ne nécessiteront pas de grandes installations ni de matières premières rares. … nous sommes à l’aube d’une nouvelle perfection du mal extrême, un mal dont la possibilité s’étend bien au-delà de ce que les armes de destruction massive ont légué aux États , pour donner un pouvoir surprenant et terrible à des individus extrêmes.
Ce que Joy souligne, c’est l’idée que pour causer des destructions à grande échelle, il faut à la fois un motif et une capacité, et tant que cette capacité est limitée à un petit groupe de personnes hautement qualifiées, le risque que des individus isolés (ou de petits groupes) causent de telles destructions est relativement limité.21Nous devons nous préoccuper des acteurs étatiques, aujourd’hui et à l’avenir, et j’aborde ce sujet dans la section suivante
Un solitaire perturbé peut commettre une fusillade dans une école, mais il ne peut probablement pas construire une arme nucléaire ou déclencher une épidémie.
En fait, la capacité et le motif peuvent même être négativement corrélés. Le type de personne qui a la capacité de propager une épidémie est probablement très instruite : elle est susceptible d’avoir un doctorat en biologie moléculaire, d’être particulièrement ingénieuse, d’avoir une carrière prometteuse, une personnalité stable et disciplinée, et beaucoup à perdre. Ce type de personne est peu susceptible d’être intéressé par le fait de tuer un grand nombre de personnes sans aucun bénéfice pour elle-même et au risque de compromettre son propre avenir ; il faudrait qu’elle soit motivée par une pure malveillance, un grief intense ou une instabilité.
De telles personnes existent, mais elles sont rares et ont tendance à faire la une des journaux lorsqu’elles apparaissent, précisément parce qu’elles sont si inhabituelles.22Il existe des preuves que de nombreux terroristes sont au moins relativement bien éduqués, ce qui peut sembler contredire mon argumentation sur la corrélation négative entre capacité et motivation. Mais je pense qu’en réalité, ces observations sont compatibles : si le seuil de capacité pour réussir une attaque est élevé, alors, presque par définition, ceux qui réussissent actuellement doivent avoir une capacité élevée, même si la capacité et la motivation sont négativement corrélées. Mais dans un monde où les limites de capacité seraient supprimées (par exemple, avec les futurs LLM), je prédirais qu’une partie importante de la population ayant la motivation de tuer mais des capacités moindres commencerait à le faire, comme c’est le cas pour les crimes qui ne nécessitent pas beaucoup de capacités (comme les fusillades dans les écoles).
Elles sont également difficiles à attraper car elles sont intelligentes et compétentes, laissant parfois derrière elles des mystères qui prennent des années, voire des décennies, à résoudre. L’exemple le plus célèbre est probablement celui du mathématicien Theodore Kaczynski (Unabomber), qui a échappé au FBI pendant près de 20 ans et était animé par une idéologie anti idéologie anti-technologique. Un autre exemple est celui du chercheur en biodéfense Bruce Ivins, qui semble avoir orchestré une série d’attaques à l’anthrax en 2001. Cela s’est également produit avec des organisations non étatiques compétentes : la secte Aum Shinrikyo a réussi à se procurer du gaz sarin et à tuer 14 personnes (et en blessant des centaines d’autres) en le libérant dans le métro de Tokyo en 1995.
Heureusement, aucune de ces attaques n’a utilisé d’agents biologiques contagieux, car la capacité de fabriquer ou d’obtenir ces agents dépassait les capacités même de ces personnes.23Aum Shinrikyo a toutefois essayé. Le chef d’Aum Shinrikyo, Seiichi Endo, avait suivi une formation en virologie à l’université de Kyoto et avait tenté de produire à la fois de l’anthrax et du virus Ebola. Cependant, en 1995, même lui ne disposait pas de l’expertise et des ressources suffisantes pour y parvenir. La barre est désormais nettement plus basse, et les LLM pourraient la faire baisser encore davantage.
Les progrès de la biologie moléculaire ont désormais considérablement réduit les obstacles à la création d’armes biologiques (en particulier en termes de disponibilité des matériaux), mais cela nécessite encore une expertise considérable. Je crains que n’importe quel génie puisse supprimer cet obstacle, transformant ainsi tout le monde en docteur en virologie capable de concevoir, synthétiser et disséquer une arme biologique étape par étape. Empêcher l’obtention de ce type d’informations face à une pression hostile importante (ce que l’on appelle les « jailbreaks ») nécessite probablement des niveaux de défense supérieurs à ceux habituellement intégrés à la formation.
Il est essentiel de cela rompra la corrélation entre capacité et motivation : le solitaire perturbé qui veut tuer des gens mais qui n’a pas la discipline ou les compétences pour le faire sera désormais élevé au niveau de compétence du docteur en virologie, qui n’est pas susceptible d’avoir cette motivation. Cette préoccupation s’étend au-delà de la biologie (même si je pense que la biologie est le domaine le plus effrayant) à tout domaine où une destruction massive est possible, mais qui nécessite actuellement un niveau élevé de compétences et de discipline. En d’autres termes, louer une IA puissante donne de l’intelligence à des personnes malveillantes (mais par ailleurs ordinaires). Je crains qu’il y ait potentiellement un grand nombre de personnes de ce type et que, si elles ont accès à un moyen facile de tuer des millions de personnes, tôt ou tard, l’une d’entre elles le fasse. De plus, ceux qui disposent d’une expertise pourraient être en mesure de commettre des destructions à encore plus grande que ce qu’elles pouvaient faire auparavant.
La biologie est de loin le domaine qui m’inquiète le plus, en raison de son très grand potentiel de destruction et de la difficulté à s’en défendre, je vais donc me concentrer en particulier sur la biologie. Mais une grande partie de ce que je dis ici s’applique à d’autres risques, comme les cyberattaques, les armes chimiques ou la technologie nucléaire.
Je ne vais pas entrer dans les détails sur la fabrication d’armes biologiques, pour des raisons qui devraient être évidentes. Mais d’une manière générale, je crains que les LLM ne soient en passe d’acquérir (ou aient déjà acquis) les connaissances nécessaires pour les créer et les diffuser de bout en bout, et que leur potentiel de destruction soit très élevé. Certains agents biologiques pourraient causer des millions de morts si l’on s’efforçait délibérément de les diffuser pour une propagation maximale. Cependant, cela nécessiterait tout de même un niveau de compétence très élevé, y compris un certain nombre d’étapes et de procédures très spécifiques qui ne sont pas largement connues. Ma préoccupation ne concerne pas seulement les connaissances fixes ou statiques. Je crains que les LLM soient capables de prendre une personne ayant des connaissances et des capacités moyennes et de la guider à travers un processus complexe qui, autrement, pourrait mal tourner ou nécessiter un débogage de manière interactive, de la même manière que le support technique pourrait aider une personne non technophile à déboguer et à résoudre des problèmes informatiques complexes (bien que ce processus soit plus long, pouvant durer plusieurs semaines ou plusieurs mois).
Des LLM plus performants (bien au-delà des capacités actuelles) pourraient permettre des actes encore plus effrayants. En 2024, un groupe d’éminents scientifiques a rédigé une lettre mettant en garde contre les risques liés à la recherche et à la création potentielle d’un nouveau type d’organisme dangereux : la « vie miroir ». L’ADN, l’ARN, les ribosomes et les protéines qui composent les organismes biologiques ont tous la même chiralité (également appelée « latéralité »), ce qui les rend non équivalents à une version d’eux-mêmes reflétée dans un miroir (tout comme votre main droite ne peut pas être tournée de manière à être identique à votre main gauche). Mais tout le système de liaison des protéines entre elles, le mécanisme de synthèse de l’ADN et de traduction de l’ARN, ainsi que la construction et la dégradation des protéines, dépendent tous de cette chiralité. Si les scientifiques créaient des versions de ce matériel biologique avec une chiralité opposée (ce qui présente certains avantages potentiels, comme des médicaments qui durent plus longtemps dans l’organisme), cela pourrait être extrêmement dangereux. En effet, la vie , si elle était créée sous la forme d’organismes complets capables de se reproduire (ce qui serait très difficile), serait potentiellement indigeste pour tous les systèmes qui décomposent les matières biologiques sur Terre : elle aurait une « clé » qui ne correspondrait à aucune « serrure » d’enzyme existante. Cela signifierait qu’elle pourrait proliférer de manière incontrôlable et éliminer toute vie sur la planète, dans le pire des cas, détruisant même toute vie sur Terre.
Il existe une grande incertitude scientifique quant à la création et aux effets potentiels de la vie miroir. La lettre de 2024 accompagnait un rapport qui concluait que « des bactéries miroirs pourraient vraisemblablement être créées dans les prochaines décennies », ce qui représente une fourchette assez large. Mais un modèle d’IA suffisamment puissant (pour être clair, bien plus performant que tous ceux dont nous disposons aujourd’hui) pourrait être capable de découvrir comment la créer beaucoup plus rapidement, et même aider quelqu’un à le faire.
Mon opinion est que même s’il s’agit de risques obscurs et qui peuvent sembler improbables, l’ampleur des conséquences est telle qu’ils doivent être pris au sérieux comme un risque de premier ordre des systèmes d’IA.
Les sceptiques ont soulevé un certain nombre d’objections quant à la gravité de ces risques biologiques liés aux LLM, avec lesquelles je ne suis pas d’accord, mais qui méritent d’être abordées. La plupart d’entre elles relèvent d’une méconnaissance de la trajectoire exponentielle sur laquelle se trouve cette technologie. En 2023, lorsque nous avons commencé à parler des risques biologiques liés aux LLM, les sceptiques affirmaient que toutes les informations nécessaires étaient disponibles sur Google et que les LLM n’apportaient rien de plus. Il n’a jamais été vrai que Google pouvait fournir toutes les informations nécessaires : les génomes sont librement accessibles, mais comme je l’ai dit plus haut, certaines étapes clés, ainsi qu’une quantité énorme de connaissances pratiques ne peuvent être obtenues de cette manière. De plus, à la fin de 2023, les LLM fournissaient clairement des informations allant au-delà de ce que Google pouvait offrir pour certaines étapes du processus.
Après cela, les sceptiques se sont rabattus sur l’objection selon laquelle les LLM n’étaient pas utiles de bout en bout et ne pouvaient pas aider à l’acquisition d’armes biologiques, mais seulement fournir des informations théoriques. À la mi-2025, nos mesures montrent que les LLM pourraient déjà apporter une amélioration substantielle dans plusieurs domaines pertinents, doublant voire triplant les chances de succès. Cela nous a amenés à décider que Claude Opus 4 (et les modèles Sonnet 4.5, Opus 4.1 et Opus 4.5 qui ont suivi) devaient être commercialisés dans le cadre de notre politique de mise à l’échelle responsable (Responsible Scaling Policy) et de notre niveau de sécurité IA 3, et de mettre en œuvre des mesures de protection contre ce risque (nous y reviendrons plus tard). Nous pensons que les modèles approchent désormais le point où, sans mesures de protection, ils pourraient permettre à une personne titulaire d’un diplôme en sciences, technologie, ingénierie et mathématiques (STEM), mais pas spécifiquement en biologie, de mener à bien tout le processus de production d’une arme biologique.
Une autre objection est qu’il existe d’autres mesures sans rapport avec l’IA que la société peut prendre pour empêcher la production d’armes biologiques. Tout d’abord, l’industrie de la synthèse génétique fabrique des spécimens biologiques à la demande , et il n’existe aucune obligation fédérale imposant aux fournisseurs de vérifier les commandes afin de s’assurer qu’elles ne contiennent pas d’agents pathogènes. Une étude du MIT a révélé que 36 des 38 fournisseurs avaient honoré une commande contenant la séquence du virus de la grippe de 1918. Je suis favorable à un contrôle obligatoire de la synthèse génétique qui rendrait plus difficile pour les individus de transformer des agents pathogènes en armes, afin de réduire à la fois les risques biologiques liés à l’IA et les risques biologiques en général. Mais ce n’est pas le cas aujourd’hui. Ce ne serait d’ailleurs qu’un outil parmi d’autres pour réduire les risques ; il s’agit d’un complément aux garde-fous des systèmes d’IA, et non d’un substitut.
La meilleure objection est celle que j’ai rarement vue soulevée : il existe un écart entre l’utilité théorique des modèles et la propension réelle des acteurs malveillants à les utiliser. La plupart des acteurs malveillants sont des individus perturbés, donc, par définition, leur comportement est imprévisible et irrationnel. Et ce sont ces acteurs malveillants, ceux qui ne sont pas qualifiés, qui pourraient tirer le plus grand profit de l’IA, qui facilite considérablement le meurtre de nombreuses personnes.24Un phénomène étrange lié aux auteurs de meurtres de masse est que le mode opératoire qu’ils choisissent s’apparente presque à une mode grotesque. Dans les années 1970 et 1980, les tueurs en série étaient très courants, et les nouveaux serial killers copiaient souvent le comportement de serial killers plus établis ou plus célèbres. Dans les années 1990 et 2000, les fusillades de masse sont devenues plus courantes, tandis que les serial killers sont devenus moins fréquents. Aucun changement technologique n’a déclenché ces comportements, il semble simplement que les meurtriers violents copiaient le comportement les uns des autres et que ce qui était « populaire » à copier a changé.
Ce n’est pas parce qu’un type d’attaque violente est possible que quelqu’un décidera de le faire. Les attaques biologiques seront peut-être peu attrayantes, car elles sont susceptibles d’infecter leur auteur, elles ne correspondent pas aux fantasmes de type militaire que nourrissent de nombreux individus ou groupes violents, et qu’il est difficile de cibler sélectivement des personnes spécifiques. Il se peut également que le fait de passer par un processus qui prend des mois, même si une IA vous guide tout au long de celui-ci, nécessite une patience que la plupart des individus perturbés n’ont tout simplement pas. Nous pourrions simplement avoir de la chance et que, dans la pratique, la motivation et la capacité ne se combinent pas de la bonne manière.
Mais cela semble être une protection très fragile sur laquelle s’appuyer. Les motivations des solitaires perturbés peuvent changer pour n’importe quelle raison ou sans raison, et il existe déjà des cas où des LLM ont été utilisés dans des attaques (mais pas avec la biologie). L’accent mis sur les solitaires perturbés ignore également les terroristes motivés par des idéologies, qui sont souvent prêts à consacrer beaucoup de temps et d’efforts (par exemple, les pirates de l’air du 11 septembre) . Le désir de tuer le plus grand nombre de personnes possible est un motif qui finira probablement par apparaître tôt ou tard, et qui suggère malheureusement le recours aux armes biologiques. Même si ce motif est extrêmement rare, il suffit qu’il se concrétise une seule fois. Et à mesure que la biologie progresse (de plus en plus sous l’impulsion de l’IA elle-même), il pourrait également devenir possible de mener des attaques plus sélectives (par exemple, ciblant des personnes ayant des origines spécifiques), ce qui ajoute un autre très effrayant.
Je ne pense pas que des attaques biologiques seront nécessairement menées dès qu’elles deviendront largement possibles — en fait, je parierais contre cela. Mais si l’on additionne des millions de personnes et quelques années, je pense qu’il existe un risque sérieux d’attaque majeure, et les conséquences seraient si graves (avec des millions de victimes potentielles, voire plus) que je crois que nous n’avons d’autre choix que de prendre des mesures sérieuses pour l’empêcher.
Défenses
Cela nous amène à la question de savoir comment se défendre contre ces risques. Je vois ici trois choses que nous pouvons faire. Premièrement, les entreprises d’IA peuvent mettre en place des garde-fous sur leurs modèles afin d’empêcher qu’ils ne contribuent à la production d’armes biologiques. Anthropic s’y emploie très activement. La Constitution de Claude, qui se concentre principalement sur des principes et des valeurs de haut niveau, comporte un petit nombre d’interdictions spécifiques et strictes, dont l’une concerne l’aide à la production d’armes biologiques (ou chimiques, nucléaires ou radiologiques). Mais tous les modèles peuvent être piratés. Nous avons donc mis en place, comme deuxième ligne de défense (depuis mi-2025, lorsque nos tests ont montré que nos modèles commençaient à approcher le seuil à partir duquel ils pourraient présenter un risque), un classificateur qui détecte et bloque spécifiquement les résultats liés aux armes biologiques. Nous mettons régulièrement à jour et améliorons ces classificateurs, et nous les avons généralement trouvés très robustes, même face à des attaques adverses sophistiquées.25Les prisonniers occasionnels pensent parfois qu’ils ont compromis ces classificateurs lorsqu’ils obtiennent du modèle une information spécifique, telle que la séquence génomique d’un virus. Mais comme je l’ai expliqué précédemment, le modèle de menace qui nous préoccupe implique des conseils interactifs étape par étape, s’étalant sur plusieurs semaines ou mois, concernant des étapes spécifiques et obscures du processus de production d’armes biologiques, et c’est contre cela que nos classificateurs visent à nous défendre. (Nous décrivons souvent nos recherches comme la recherche de « jailbreaks universels », c’est-à-dire des jailbreaks qui ne fonctionnent pas seulement dans un contexte spécifique ou restreint, mais qui ouvrent largement le comportement du modèle.)
Ces classificateurs augmentent considérablement les coûts de fonctionnement de nos modèles (dans certains modèles, ils représentent près de 5 % des coûts totaux d’inférence) et réduisent donc nos marges, mais nous estimons que leur utilisation est la bonne chose à faire.
Il faut reconnaître que d’autres entreprises d’IA ont également mis en place des classificateurs. Mais toutes les entreprises ne l’ont pas fait, et rien n’oblige les entreprises à conserver leurs classificateurs. Je crains qu’avec le temps, on assiste à un dilemme du prisonnier où les entreprises pourraient se dérober et réduire leurs coûts en supprimant les classificateurs. Il s’agit là encore d’un problème classique d’externalités négatives qui ne peut être résolu par les actions volontaires d’Anthropic ou de toute autre entreprise à elle seule.26Nous continuerons toutefois à investir dans des travaux visant à rendre nos classificateurs plus efficaces, et il peut être judicieux pour les entreprises de partager entre elles des avancées telles que celles-ci.
Des normes industrielles volontaires pourraient aider, tout comme des évaluations et des vérifications par des tiers, telles que celles effectuées par des instituts de sécurité IA et des évaluateurs tiers.
Mais en fin de compte, la défense peut nécessiter une action gouvernementale, ce qui est la deuxième chose que nous pouvons faire. Mon point de vue à ce sujet est le même que pour la gestion des risques liés à l’autonomie : nous devrions commencer par des exigences de transparence,27Évidemment, je ne pense pas que les entreprises devraient être tenues de divulguer les détails techniques des étapes spécifiques de la production d’armes biologiques qu’elles bloquent, et la législation sur la transparence qui a été adoptée jusqu’à présent (SB 53 et RAISE) tient compte de cette question.qui aident la société à mesurer, surveiller et se défendre collectivement contre les risques sans perturber l’activité économique de manière trop lourde. Ensuite, si et lorsque nous atteignons des seuils de risque plus clairs, nous pouvons élaborer une législation qui cible plus précisément ces risques et présente moins de risques de dommages collatéraux. Dans le cas particulier des armes biologiques, je pense en fait que le moment d’une telle législation ciblée pourrait bientôt arriver
: Anthropic et d’autres entreprises en apprennent de plus en plus sur la nature des risques biologiques et sur ce qu’il est raisonnable d’exiger des entreprises pour s’en défendre. Pour se défendre pleinement contre ces risques, il faudra peut-être travailler au niveau international, même avec des adversaires géopolitiques, mais il existe des précédents dans les traités interdisant le développement d’armes biologiques. Je suis généralement sceptique quant à la plupart des formes de coopération internationale en matière d’IA, mais il s’agit peut-être là d’un domaine restreint où il existe une chance de parvenir à une restriction mondiale. Même les dictatures ne souhaitent pas subir d’attaques bioterroristes à grande échelle.
Enfin, la troisième contre-mesure que nous pouvons prendre consiste à essayer de développer des défenses contre les attaques biologiques elles-mêmes. Cela pourrait inclure la surveillance et le suivi pour une détection précoce, des investissements dans la R&D en matière de purification de l’air (telle que la désinfection par UVC lointain), le développement rapide de vaccins capables de répondre et de s’adapter à une attaque, de meilleurs équipements de protection individuelle (EPI),28Une autre idée connexe est celle des « marchés de la résilience », dans lesquels le gouvernement encourage le stockage d’EPI, de respirateurs et d’autres équipements essentiels nécessaires pour répondre à une attaque biologique en s’engageant à l’avance à payer un prix convenu à l’avance pour ces équipements en cas d’urgence. Cela incite les fournisseurs à stocker ces équipements sans craindre que le gouvernement ne les saisisse sans compensation. et des traitements ou vaccins pour certains des agents biologiques les plus susceptibles d’être utilisés. Les vaccins à ARNm, qui peuvent être conçus pour répondre à un virus ou à un variant particulier, sont un premier exemple de ce qui est possible dans ce domaine. Anthropic est ravi de travailler avec des entreprises biotechnologiques et pharmaceutiques sur ce problème. Mais malheureusement, je pense que nos attentes en matière de défense doivent être limitées. Il existe une asymétrie entre l’attaque et la défense en biologie, car les agents se propagent rapidement d’eux-mêmes, tandis que les défenses nécessitent une détection, une vaccination et un traitement qui doivent être organisés très rapidement à grande échelle. À moins que la réponse ne soit ultra-rapide (ce qui est rarement le cas), une grande partie des dégâts sera déjà causée avant qu’une réponse ne soit possible. Il est concevable que les progrès technologiques futurs puissent faire pencher la balance en faveur de la défense (et nous devrions certainement utiliser l’IA pour aider à développer ces avancées technologiques), mais d’ici là, les mesures de prévention resteront notre principale ligne de défense.
Il convient de mentionner brièvement ici les cyberattaques, car contrairement aux attaques biologiques, les cyberattaques menées par l’IA ont déjà eu lieu dans la réalité, y compris à grande échelle et pour le compte d’États . Nous nous attendons à ce que ces attaques deviennent plus performantes à mesure que les modèles progressent rapidement, jusqu’à ce qu’elles constituent le principal moyen de mener des cyberattaques. Je pense que les cyberattaques menées par l’IA vont devenir une menace sérieuse et sans précédent pour l’intégrité des systèmes informatiques à travers le monde, et Anthropic travaille d’arrache-pied pour mettre fin à ces attaques et, à terme, les empêcher de manière fiable. Si je ne me suis pas autant concentré sur le cyberespace que sur la biologie, c’est parce que (1) les cyberattaques sont beaucoup moins susceptibles de tuer des personnes, certainement pas à l’échelle des attaques biologiques, et (2) l’équilibre entre l’attaque et la défense peut être plus facile à gérer dans le domaine cybernétique, où il y a au moins un certain espoir que la défense puisse suivre (et même, idéalement, dépasser) les attaques de l’IA si nous y investissons correctement.
Bien que la biologie soit actuellement le vecteur d’attaque le plus grave, il existe de nombreux autres vecteurs et il est possible qu’un vecteur plus dangereux apparaisse. Le principe général est que, sans contre-mesures, l’IA est susceptible de réduire continuellement les obstacles aux activités destructrices à une échelle de plus en plus grande, et l’humanité doit apporter une réponse sérieuse à cette menace.
3. L’appareil odieux
Abus pour s’emparer du pouvoir
La section précédente a abordé le risque que des individus et de petites organisations cooptent un petit sous-ensemble du « pays des génies dans un centre de données » pour causer des destructions à grande échelle. Mais nous devrions également nous inquiéter — probablement beaucoup plus — de l’utilisation abusive de l’IA dans le but d’exercer ou de s’emparer du pouvoir, probablement par des acteurs plus importants et mieux établis.29Pourquoi suis-je plus inquiet que les grands acteurs s’emparent du pouvoir que des petits acteurs causent des destructions ? Parce que la dynamique est différente. S’emparer du pouvoir consiste à savoir si un acteur peut accumuler suffisamment de force pour vaincre tous les autres . Nous devons donc nous préoccuper des acteurs les plus puissants et/ou les plus proches de l’IA. En revanche, la destruction peut être causée par des acteurs peu puissants si elle est beaucoup plus difficile à contrer qu’à provoquer. Il s’agit alors de se défendre contre les menaces les plus nombreuses, qui sont susceptibles de provenir d’acteurs plus modestes.
Dans Machines of Loving Grace, j’ai évoqué la possibilité que des gouvernements autoritaires utilisent une IA puissante pour surveiller ou réprimer leurs citoyens d’une manière qui serait extrêmement difficile à réformer ou à renverser. Les autocraties actuelles sont limitées dans leur capacité de répression par la nécessité de faire exécuter leurs ordres par des humains, et les humains ont souvent des limites dans leur capacité à se montrer inhumains. Mais les autocraties basées sur l’IA n’auraient pas de telles limites.
Pire encore, les pays pourraient également utiliser leur avantage en matière d’IA pour acquérir un pouvoir sur d’autres pays. Si le « pays des génies » dans son ensemble était simplement détenu et contrôlé par l’appareil militaire d’un seul pays (humain) et que les autres pays ne disposaient pas de capacités équivalentes, il serait difficile d’imaginer comment ils pourraient se défendre : ils seraient surpassés à chaque tournant, comme dans une guerre entre les humains et les souris. La combinaison de ces deux préoccupations conduit à la possibilité alarmante d’une dictature totalitaire mondiale. Il est évident que l’une de nos priorités absolues devrait être d’empêcher cette issue.
L’IA pourrait permettre, renforcer ou étendre l’autocratie de nombreuses façons, mais je vais énumérer celles qui m’inquiètent le plus. Notez que certaines de ces applications ont des usages défensifs légitimes, et je ne m’y oppose pas nécessairement de manière absolue ; je crains néanmoins qu’elles aient tendance à favoriser structurellement les autocraties :
- Armes entièrement autonomes. Un essaim de millions ou de milliards de drones armés entièrement automatisés, contrôlés localement par une IA puissante et coordonnés stratégiquement à travers le monde par une IA encore plus puissante, pourrait constituer une armée invincible, capable à la fois de vaincre n’importe quelle armée dans le monde et de réprimer la dissidence au sein d’un pays en suivant chaque citoyen. Les développements de la guerre entre la Russie et l’Ukraine devraient nous alerter sur le fait que la guerre des drones est déjà une réalité (même si elle n’est pas encore entièrement autonome et ne représente qu’une infime partie de ce qui serait possible avec une IA puissante). La R& D issues d’une IA puissante pourraient rendre les drones d’un pays bien supérieurs à ceux des autres, accélérer leur fabrication, les rendre plus résistants aux attaques électroniques, améliorer leur maniabilité, etc. Bien sûr, ces armes ont également des utilisations légitimes dans la défense de la démocratie : elles ont joué un rôle clé dans la défense de l’Ukraine et seraient probablement essentielles pour défendre Taïwan. Mais elles constituent une arme dangereuse à manier : nous devrions nous inquiéter de les voir entre les mains d’autocraties, mais aussi craindre que, parce qu’elles sont si puissantes et si peu contrôlées, le risque que des gouvernements démocratiques les utilisent contre leur propre population pour s’emparer du pouvoir soit considérablement accru.
- Surveillance par l’IA. Une IA suffisamment puissante pourrait probablement être utilisée pour compromettre n’importe quel système informatique dans le monde,30Cela peut sembler en contradiction avec mon argument selon lequel l’attaque et la défense peuvent être plus équilibrées avec les cyberattaques qu’avec les armes biologiques , mais ma crainte ici est que si l’IA d’un pays est la plus puissante au monde, les autres ne pourront pas se défendre, même si la technologie elle-même présente un équilibre intrinsèque entre attaque et défense. et pourrait également utiliser l’accès ainsi obtenu pour lire et comprendre toutes les communications électroniques du monde (voire toutes les communications en personne, si des appareils d’enregistrement peuvent être construits ou réquisitionnés). Il pourrait être effrayant de penser qu’il suffirait de générer une liste complète de toutes les personnes en désaccord avec le gouvernement sur un certain nombre de questions, même si ce désaccord n’est pas explicite dans leurs paroles ou leurs actes. Une IA puissante capable d’analyser des milliards de conversations entre des millions de personnes pourrait évaluer l’opinion publique, détecter les poches de déloyauté en formation et les éliminer avant qu’elles ne se développent. Cela pourrait conduire à l’imposition d’un véritable panoptique à une échelle que nous ne connaissons pas aujourd’hui, même avec le PCC.
- Propagande par l’IA. Les phénomènes actuels de «psychose de l’IA» et de «copines IA» suggèrent que même à leur niveau d’intelligence actuel, les modèles d’IA peuvent avoir une influence psychologique puissante sur les gens. Des versions beaucoup plus puissantes de ces modèles, beaucoup plus intégrées et conscientes de la vie quotidienne des gens, capables de les modéliser et de les influencer pendant des mois ou des années, seraient probablement capables de laver le cerveau de nombreuses (la plupart ?) des gens à n’importe quelle idéologie ou attitude souhaitée, et pourraient être utilisées par un dirigeant sans scrupules pour garantir la loyauté et réprimer la dissidence, même face à un niveau de répression contre lequel la plupart des populations se rebelleraient. Aujourd’hui, les gens s’inquiètent beaucoup, par exemple, de l’influence potentielle de TikTok en tant que propagande du PCC dirigée vers les enfants. Je m’en inquiète aussi, mais un agent IA personnalisé qui apprend à vous connaître au fil des ans et utilise ses connaissances sur vous pour façonner toutes vos opinions serait considérablement plus puissant que cela.
- Prise de décision stratégique. Un pays de génies dans un centre de données pourrait être utilisé pour conseiller un pays, un groupe ou un individu sur la stratégie géopolitique, ce que nous pourrions appeler un « Bismarck virtuel ». Il pourrait optimiser les trois stratégies ci-dessus pour s’emparer du pouvoir, et probablement en développer beaucoup d’autres auxquelles je n’ai pas pensé (mais auxquelles un pays de génies pourrait penser). La diplomatie, la stratégie militaire, la R&D, la stratégie économique et de nombreux autres domaines sont susceptibles de voir leur efficacité considérablement accrue grâce à une IA puissante. Bon nombre de ces compétences seraient légitimement utiles aux démocraties — nous voulons que les démocraties aient accès aux meilleures stratégies pour se défendre contre les autocraties — mais le risque d’abus dans les mains de n’importe qui demeure.
Après avoir décrit ce qui m’inquiète, passons à qui. Je m’inquiète des entités qui ont le plus accès à l’IA, qui partent d’une position de pouvoir politique maximal ou qui ont déjà fait preuve de répression par le passé. Par ordre de gravité, je m’inquiète pour :
- Le PCC. La Chine est le deuxième pays après les États-Unis en termes de capacités d’IA, et c’est le pays qui a le plus de chances de dépasser les États-Unis dans ce domaine. Son gouvernement est actuellement autocratique et gère un État de surveillance high-tech. Il a déjà déployé une surveillance basée sur l’IA (notamment dans la répression des Ouïghours) et on pense qu’il utilise la propagande algorithmique via TikTok (en plus de ses nombreuses autres initiatives de propagande internationale). Il est sans conteste le mieux placé pour réaliser le cauchemar totalitaire basé sur l’IA que j’ai décrit plus haut. Cela pourrait même être le résultat par défaut en Chine, ainsi que dans d’autres États autocratiques auxquels le PCC exporte sa technologie de surveillance. J’ai souvent écrit sur la menace que représente le PCC en tant que leader dans le domaine de l’IA et sur la nécessité absolue de l’empêcher d’y parvenir. Voici pourquoi. Pour être clair, je ne cible pas la Chine en particulier par animosité envers elle, mais simplement parce qu’elle est le pays qui combine le mieux les prouesses en matière d’IA, un gouvernement autocratique et une histoire de répression. nécessité impérative de l’empêcher de le faire. Voici pourquoi. Pour être clair, je ne vise pas la Chine en particulier par animosité à son égard, mais simplement parce qu’elle est le pays qui combine le plus les prouesses de l’IA, un gouvernement autocratique et un État de surveillance high-tech. Ce sont plutôt les Chinois eux-mêmes qui sont les plus susceptibles de souffrir de la répression du PCC grâce à l’IA, et ils n’ont pas leur mot à dire dans les actions de leur gouvernement. J’admire et respecte énormément le peuple chinois et je soutiens les nombreux dissidents courageux en Chine et leur lutte pour la liberté.
- Les démocraties compétitives en matière d’IA. Comme je l’ai écrit plus haut, les démocraties ont un intérêt légitime à disposer de certains outils militaires et géopolitiques basés sur l’IA, car les gouvernements démocratiques offrent la meilleure chance de contrer l’utilisation de ces outils par les autocraties. D’une manière générale, je suis favorable à l’idée de doter les démocraties des outils nécessaires pour vaincre les autocraties à l’ère de l’IA — je pense simplement qu’il n’y a pas d’autre solution. Mais nous ne pouvons ignorer le risque d’abus de ces technologies par les gouvernements démocratiques eux-mêmes. Les démocraties disposent généralement de garde-fous qui empêchent leurs appareils militaires et de renseignement de se retourner contre leur propre population.31Aux États-Unis, cela inclut par exemple le quatrième amendement et le Posse Comitatus Act.Mais comme les outils d’IA nécessitent très peu de personnel pour fonctionner, il est possible qu’ils contournent ces mesures de protection et les normes qui les soutiennent. Il convient également de noter que certaines de ces mesures de protection s’érodent déjà progressivement dans certaines démocraties. Nous devons donc armer les démocraties avec l’IA, mais nous devons le faire avec prudence et dans certaines limites : elles constituent le système immunitaire dont nous avons besoin pour lutter contre les autocraties, mais comme le système immunitaire, elles risquent de se retourner contre nous et de devenir elles-mêmes une menace.
- Pays non démocratiques disposant de grands centres de données. Au-delà de la Chine, la plupart des pays dont la gouvernance est moins démocratique ne sont pas des acteurs de premier plan dans le domaine de l’IA, dans la mesure où ils ne disposent pas d’entreprises produisant des modèles d’IA de pointe. Ils représentent donc un risque fondamentalement différent et moindre que le PCC, qui reste la principale préoccupation (la plupart sont également moins répressifs, et ceux qui le sont davantage, comme la Corée du Nord, ne disposent d’aucune industrie significative dans le domaine de l’IA) . Mais certains de ces pays disposent de grands centres de données (souvent dans le cadre de développements réalisés par des entreprises opérant dans des démocraties), qui peuvent être utilisés pour exploiter l’IA de pointe à grande échelle (même si cela ne leur confère pas la capacité de repousser les limites). Cela comporte un certain danger : ces gouvernements pourraient en principe exproprier les centres de données et utiliser l’IA qui s’y trouve à leurs propres fins. Je m’inquiète moins à ce sujet que pour des pays comme la Chine qui développent directement l’IA, mais c’est un risque à garder à l’esprit.32De plus, pour être clair, il existe certains arguments en faveur de la construction de grands centres de données dans des pays aux structures de gouvernance variées, en particulier s’ils sont contrôlés par des entreprises dans des démocraties. De telles constructions pourraient en principe aider les démocraties à mieux rivaliser avec le PCC, qui représente une menace plus importante. Je pense également que ces centres de données ne présentent pas de risque particulier, à moins qu’ils ne soient très grands. Mais dans l’ensemble, je pense qu’il convient d’être prudent lorsqu’on installe de très grands centres de données dans des pays où les garanties institutionnelles et les protections de l’État de droit sont moins bien établies.
- Les entreprises d’IA. Il est quelque peu délicat de le dire en tant que PDG d’une entreprise d’IA, mais je pense que le niveau de risque suivant concerne en fait les entreprises d’IA elles-mêmes. Les entreprises d’IA contrôlent de grands centres de données, forment des modèles de pointe, possèdent la plus grande expertise sur la manière d’utiliser ces modèles et, dans certains cas, sont en contact quotidien avec des dizaines ou des centaines de millions d’utilisateurs et ont la possibilité de les influencer. Ce qui leur manque principalement, c’est la légitimité et l’infrastructure d’un État. Par conséquent, une grande partie de ce qui serait nécessaire pour construire les outils d’une autocratie IA serait illégal pour une entreprise d’IA, ou du moins extrêmement suspect. Mais certaines choses ne sont pas impossibles : elles pourraient, par exemple, utiliser leurs produits d’IA pour endoctriner leur immense base d’utilisateurs consommateurs, et le public devrait être conscient du risque que cela représente. Je pense que la gouvernance des entreprises d’IA mérite d’être examinée de près.
Il existe un certain nombre d’arguments possibles contre la gravité de ces menaces, et j’aimerais pouvoir y croire, car l’autoritarisme rendu possible par l’IA me terrifie. Il vaut la peine d’examiner certains de ces arguments et d’y répondre.
Tout d’abord, certaines personnes pourraient placer leur confiance dans la dissuasion nucléaire, en particulier pour contrer l’utilisation d’armes autonomes basées sur l’IA à des fins de conquête militaire. Si quelqu’un menace d’utiliser ces armes contre vous, vous pouvez toujours menacer de riposter par une réponse nucléaire. Ce qui m’inquiète, c’est que je ne suis pas tout à fait sûr que nous puissions avoir confiance dans la dissuasion nucléaire contre un pays de génies dans un centre de données : il est possible qu’une IA puissante puisse concevoir des moyens de détecter et de frapper des sous-marins nucléaires, mener des opérations d’influence contre les opérateurs d’infrastructures d’armes nucléaires ou utiliser les capacités cybernétiques de l’IA pour lancer une cyberattaque contre les satellites utilisés pour détecter les lancements nucléaires.33Il s’agit bien sûr également un argument en faveur de l’amélioration de la sécurité de la dissuasion nucléaire afin de la rendre plus résistante face à une IA puissante, et les démocraties dotées d’armes nucléaires devraient le faire. Mais nous ne savons pas de quoi une IA puissante sera capable ni quelles défenses, le cas échéant, fonctionneront contre elle, nous ne devons donc pas supposer que ces mesures résoudront nécessairement le problème.
Il est également possible que la prise de contrôle de pays soit réalisable uniquement grâce à la surveillance et à la propagande de l’IA, sans jamais présenter de moment clair où il serait évident de savoir ce qui se passe et où une riposte nucléaire serait appropriée. Peut-être que ces choses ne sont pas réalisables et que la dissuasion nucléaire restera efficace, mais le risque semble trop élevé pour être pris.34Il existe également le risque que, même si la dissuasion nucléaire reste efficace, un pays attaquant décide de nous prendre au mot : il n’est pas certain que nous serions prêts à utiliser des armes nucléaires pour nous défendre contre un essaim de drones, même si celui-ci présente un risque important de nous conquérir. Les essaims de drones pourraient être une nouvelle menace, moins grave que les attaques nucléaires, mais plus grave que les attaques conventionnelles. Par ailleurs, des évaluations divergentes de l’efficacité de la dissuasion nucléaire à l’ère de l’IA pourraient modifier la théorie des jeux du conflit nucléaire de manière déstabilisante.
Une deuxième objection possible est qu’il pourrait exister des contre-mesures à prendre contre ces outils d’autocratie. Nous pouvons contrer les drones avec nos propres drones, la cyberdéfense s’améliorera parallèlement aux cyberattaques, il pourrait exister des moyens d’immuniser les gens contre la propagande, etc. Ma réponse est que ces défenses ne seront possibles qu’avec une IA comparativement puissante. S’il n’existe pas de force contraire avec un pays de génies comparativement intelligent et nombreux dans un centre de données, il ne sera pas possible d’égaler la qualité ou la quantité des drones, ni de faire en sorte que la cyberdéfense soit plus intelligente que la cyberattaque, etc. La question des contre-mesures se réduit donc à celle de l’équilibre des pouvoirs dans le domaine de l’IA puissante. Ici, je m’inquiète de la propriété récursive ou auto-renforçante de l’IA la rendant plus puissante (dont j’ai parlé au début de cet essai) : chaque génération d’IA peut être utilisée pour concevoir et former la prochaine génération d’IA. Cela conduit à un risque d’avantage incontrôlable, où le leader actuel en matière d’IA puissante pourrait être en mesure d’accroître son avance et devenir difficile à rattraper. Nous devons nous assurer que ce n’est pas un pays autoritaire qui arrive le premier dans cette boucle.
De plus, même si un équilibre des pouvoirs peut être atteint, il existe toujours un risque que le monde soit divisé en sphères autocratiques, comme dans 1984. Même si plusieurs puissances concurrentes disposent chacune de leurs propres modèles d’IA puissants et qu’aucune ne peut dominer les autres, chaque puissance pourrait toujours réprimer sa propre population en interne et serait très difficile à renverser (car les populations ne disposent pas d’une IA puissante pour se défendre). Il est donc important d’empêcher l’autocratie rendue possible par l’IA, même si cela n’aboutit pas à la domination du monde par un seul pays.
Défenses
Comment nous défendre contre ce large éventail d’outils autocratiques et d’acteurs potentiellement menaçants ? Comme dans les sections précédentes, je pense que nous pouvons faire plusieurs choses. Tout d’abord, nous ne devons absolument pas vendre de puces, d’outils de fabrication de puces ou de centres de données au PCC. Les puces et les outils de fabrication de puces constituent le principal obstacle à une IA puissante, et les bloquer est une mesure simple mais extrêmement efficace, peut-être la plus importante que nous puissions prendre. Il est absurde de vendre au PCC les outils qui lui permettront de construire un État totalitaire basé sur l’IA et éventuellement de nous conquérir militairement. Un certain nombre d’arguments complexes sont avancés pour justifier ces ventes, comme l’idée que « diffuser notre technologie dans le monde entier » permet « à l’Amérique de gagner » dans une guerre économique générale et bataille économique non spécifiée. À mon avis, cela revient à vendre des armes nucléaires à la Corée du Nord, puis à se vanter que les coques des missiles sont fabriquées par Boeing et que les États-Unis sont donc « gagnent ». La Chine a plusieurs années de retard sur les États-Unis en matière de capacité à produire des puces de pointe en quantité, et la période critique pour construire le pays des génies dans un centre de données se situera très probablement au cours des prochaines années.35Pour être clair, je pense que la bonne stratégie consiste à ne pas vendre de puces à la Chine, même si le délai nécessaire pour mettre au point une IA puissante était beaucoup plus long. Nous ne pouvons pas rendre les Chinois « dépendants » aux puces américaines : ils sont déterminés à développer leur propre industrie de puces d’une manière ou d’une autre. Cela leur prendra de nombreuses années, et en leur vendant des puces, nous ne faisons que leur donner un coup de pouce pendant cette période.
Il n’y a aucune raison de donner un coup de pouce gigantesque à leur industrie de l’IA pendant cette période critique.
Deuxièmement, il est logique d’utiliser l’IA pour donner aux démocraties les moyens de résister aux autocraties. C’est la raison pour laquelle Anthropic considère qu’il est important de fournir l’IA aux communautés du renseignement et de la défense aux États-Unis et à leurs alliés démocratiques. La défense des démocraties attaquées, telles que l’Ukraine et (via des cyberattaques) Taïwan, semble particulièrement prioritaire, tout comme le fait de donner aux démocraties les moyens d’utiliser leurs services de renseignement pour perturber et affaiblir les autocraties de l’intérieur. À un certain niveau, la seule façon de répondre aux menaces autocratiques est de les égaler et de les surpasser militairement. Une coalition entre les États-Unis et leurs alliés démocratiques, si elle parvenait à atteindre la prédominance dans le domaine de l’IA puissante, serait en mesure non seulement de se défendre contre les autocraties, mais aussi de les contenir et de limiter leurs abus totalitaires en matière d’IA.
Troisièmement, nous devons adopter une ligne dure contre les abus de l’IA au sein des démocraties. Il faut fixer des limites à ce que nous autorisons nos gouvernements à faire avec l’IA, afin qu’ils ne s’emparent pas du pouvoir ou ne répriment pas leur propre population. La formulation que j’ai trouvée est que nous devrions utiliser l’IA pour la défense nationale de toutes les manières possibles, à l’exception de celles qui nous rendraient plus semblables à nos adversaires autocratiques.
Où faut-il tracer la ligne ? Dans la liste au début de cette section, deux éléments – l’utilisation de l’IA pour la surveillance de masse et la propagande de masse au niveau national – me semblent être des lignes rouges évidentes et totalement illégitimes. Certains pourraient arguer qu’il n’y a pas lieu d’agir (du moins aux États-Unis), puisque la surveillance de masse nationale est déjà illégale en vertu du quatrième amendement. Mais les progrès rapides de l’IA pourraient créer des situations auxquelles nos cadres juridiques existants ne sont pas bien adaptés. Par exemple, il ne serait probablement pas inconstitutionnel pour le gouvernement américain d’enregistrer à grande échelle toutes les conversations publiques (par exemple, ce que les gens se disent entre eux au coin d’une rue), et auparavant, il aurait été difficile de trier ce volume d’informations, mais grâce à l’IA, tout pourrait être transcrit, interprété et triangulé afin de dresser un tableau de l’attitude et des loyautés d’une grande partie ou de la plupart des citoyens. Je soutiendrais une législation axée sur les libertés civiles (voire un amendement constitutionnel) qui impose des garde-fous plus solides contre les abus liés à l’IA.
Les deux autres points, à savoir les armes entièrement autonomes et l’IA pour la prise de décisions stratégiques, sont plus difficiles à traiter, car ils ont des utilisations légitimes pour défendre la démocratie, tout en étant susceptibles d’abus. Je pense qu’il convient ici de faire preuve d’une extrême prudence et d’un examen minutieux, associés à des garde-fous pour prévenir les abus. Ma principale crainte est que trop peu de personnes aient « le doigt sur le bouton », de sorte qu’une ou une poignée de personnes pourraient essentiellement diriger une armée de drones sans avoir besoin de la coopération d’autres humains pour exécuter leurs ordres. À mesure que les systèmes d’IA deviennent plus puissants, nous devrons peut-être mettre en place des mécanismes de contrôle plus directs et plus immédiats pour garantir qu’ils ne sont pas utilisés à mauvais escient, impliquant peut-être des branches du gouvernement autres que l’exécutif. Je pense que nous devons aborder les armes entièrement autonomes avec une grande prudence36Pour être clair, la plupart des armes utilisées aujourd’hui en Ukraine et à Taïwan ne sont pas entièrement autonomes. Elles le deviendront, mais ce n’est pas le cas aujourd’hui. et ne pas nous précipiter dans leur utilisation sans garanties appropriées.
Quatrièmement, après avoir pris une position ferme contre les abus de l’IA dans les démocraties, nous devrions utiliser ce précédent pour créer un tabou international contre les pires abus d’une IA puissante. Je reconnais que le vent politique actuel s’est retourné contre la coopération internationale et les normes internationales, mais c’est un cas où nous en avons cruellement besoin. Le monde doit comprendre le potentiel sombre d’une IA puissante entre les mains d’autocrates et reconnaître que certaines utilisations de l’IA équivalent à une tentative de voler définitivement leur liberté et d’imposer un État totalitaire dont ils ne peuvent s’échapper. J’irais même jusqu’à dire que, dans certains cas, la surveillance à grande échelle à l’aide d’une IA puissante, la propagande de masse à l’aide d’une IA puissante et certains types d’utilisations offensives d’armes entièrement autonomes devraient être considérés comme des crimes contre l’humanité. Plus généralement, il est absolument nécessaire de mettre en place une norme solide contre le totalitarisme rendu possible par l’IA et tous ses outils et instruments.
Il est possible d’adopter une position encore plus forte, à savoir que, compte tenu des possibilités très sombres offertes par le totalitarisme rendu possible par l’IA, l’autocratie n’est tout simplement pas une forme de gouvernement que les gens peuvent accepter à l’ère de l’IA puissante. Tout comme le féodalisme est devenu inapplicable avec la révolution industrielle, l’ère de l’IA pourrait conduire inévitablement et logiquement à la conclusion que la démocratie (et, espérons-le, une démocratie améliorée et revigorée par l’IA, comme je l’explique dans Machines of Loving Grace) est la seule forme de gouvernement viable si l’humanité veut avoir un avenir prometteur.
Cinquièmement et enfin, les entreprises d’IA devraient être surveillées de près, tout comme leurs liens avec le gouvernement, qui sont nécessaires, mais doivent avoir des limites et des frontières. La puissance des capacités incarnées par une IA puissante est telle que la gouvernance d’entreprise ordinaire , conçue pour protéger les actionnaires et prévenir les abus courants tels que la fraude, soit à la hauteur de la tâche consistant à régir les entreprises d’IA. Il pourrait également être utile que les entreprises s’engagent publiquement (peut-être même dans le cadre de la gouvernance d’entreprise) à ne pas prendre certaines mesures, telles que la construction ou le stockage privé de matériel militaire, l’utilisation de grandes quantités de ressources informatiques par des individus de manière irresponsable, ou l’utilisation de leurs produits d’IA comme propagande pour manipuler l’opinion publique en leur faveur.
Le danger ici provient de plusieurs directions, et certaines directions sont en tension avec d’autres. La seule constante est que nous devons rechercher la responsabilité, des normes et des garde-fous pour tous, même si nous donnons aux « bons » acteurs les moyens de contrôler les « mauvais » acteurs.
4. Piano mécanique
Perturbation économique
Les trois sections précédentes traitaient essentiellement des risques sécuritaires posés par une IA puissante : les risques liés à l’IA elle-même, les risques liés à une utilisation abusive par des individus et des petites organisations, et les risques liés à une utilisation abusive par des États et des grandes organisations. Si nous mettons de côté les risques sécuritaires ou supposons qu’ils ont été résolus, la question suivante est d’ordre économique. Quel sera l’effet de cet apport incroyable de « capital humain » » sur l’économie ? Il est clair que l’effet le plus évident sera une forte augmentation de la croissance économique. Le rythme des progrès de la recherche scientifique, de l’innovation biomédicale, de la fabrication, des chaînes d’approvisionnement, de l’efficacité du système financier et bien d’autres domaines encore conduira presque à coup sûr à une accélération considérable de la croissance économique. Dans Machines of Loving Grace, je suggère qu’un taux de croissance annuel soutenu du PIB de 10 à 20 % pourrait être possible.
Mais il faut bien comprendre qu’il s’agit d’une arme à double tranchant : quelles sont les perspectives économiques pour la plupart des êtres humains dans un tel monde ? Les nouvelles technologies provoquent souvent des chocs sur le marché du travail, et dans le passé, les êtres humains s’en sont toujours remis, mais je crains que cela soit dû au fait que ces chocs antérieurs n’ont touché qu’une petite fraction de l’éventail complet des capacités humaines, laissant aux êtres humains la possibilité de se tourner vers de nouvelles tâches. L’IA aura des effets beaucoup plus larges et beaucoup plus rapides, et je crains donc qu’il soit beaucoup plus difficile de faire en sorte que tout se passe bien.
Perturbation du marché du travail
Deux problèmes spécifiques me préoccupent : le déplacement du marché du travail et la concentration du pouvoir économique. Commençons par le premier. C’est un sujet sur lequel j’ai mis en garde très publiquement en 2025, lorsque j’ai prédit que l’IA pourrait remplacer la moitié de tous les emplois de cols blancs débutants dans les 1 à 5 prochaines années, même si elle accélère la croissance économique et le progrès scientifique. Cet avertissement a lancé un débat public sur le sujet. De nombreux PDG, technologues et économistes étaient d’accord avec moi, mais d’autres ont supposé que j’étais victime d’un « fallacie de la masse de travail » et que je ne comprenais pas le fonctionnement du marché du travail. Certains n’ont pas pris en compte la période de 1 à 5 ans et ont pensé que je prétendais que l’IA supprimait des emplois dès maintenant (ce qui, je le reconnais, n’est probablement pas le cas). Il est donc utile d’expliquer en détail pourquoi je m’inquiète de la suppression d’emplois, afin de dissiper ces malentendus.
Pour commencer, il est utile de comprendre comment les marchés du travail réagissent normalement aux progrès technologiques. Lorsqu’une nouvelle technologie apparaît, elle commence par rendre certaines tâches humaines plus efficaces. Par exemple, au début de la révolution industrielle, des machines telles que des charrues améliorées permettent aux agriculteurs d’être plus efficaces dans certains aspects de leur travail. Cela améliore la productivité des agriculteurs, ce qui augmente leurs salaires.
Dans un deuxième temps, certaines tâches agricoles peuvent être entièrement réalisées par des machines, par exemple avec l’invention de la batteuse ou du semoir. À ce stade, les humains effectuaient une part de plus en plus faible du travail, mais le travail qu’ils effectuaient était de plus en plus valorisé car il était complémentaire du travail des machines, et leur productivité continuait d’augmenter. Comme le décrit le paradoxe de Jevons, les salaires des agriculteurs, et peut-être même leur nombre, ont continué d’augmenter. Même lorsque 90 % du travail est effectué par des machines, les humains peuvent simplement faire 10 fois plus des 10 % qu’ils font encore, produisant 10 fois plus pour la même quantité de travail.
Finalement, les machines font tout ou presque tout, comme c’est le cas avec les moissonneuses-batteuses, les tracteurs et autres équipements modernes. À ce stade, l’agriculture en tant que forme d’emploi humain connaît un déclin rapide, ce qui peut entraîner de graves perturbations à court terme, mais comme l’agriculture n’est qu’une des nombreuses activités utiles que les humains sont capables d’exercer, les gens finissent par se tourner vers d’autres emplois, tels que l’utilisation de machines dans les usines. Cela est vrai même si l’agriculture représentait auparavant une part importante de l’emploi. Il y a 250 ans, 90 % des Américains vivaient dans des fermes ; en Europe, 50 à 60 % de l’emploi était agricole. Aujourd’hui, ces pourcentages sont inférieurs à 10 % dans ces régions, car les travailleurs se sont tournés vers des emplois industriels (puis vers des emplois intellectuels). L’économie peut accomplir ce qui nécessitait auparavant la majeure partie de la main-d’œuvre avec seulement 1 à 2 % de celle-ci, libérant ainsi le reste de la main-d’œuvre pour construire une société industrielle toujours plus avancée. Il n’y a pas de « masse de travail » fixe, mais seulement une capacité toujours croissante à faire de plus en plus avec de moins en moins. Les salaires des gens augmentent en fonction de la croissance exponentielle du PIB et l’économie maintient le plein emploi une fois que les perturbations à court terme ont disparu.
Il est possible que les choses se passent à peu près de la même manière avec l’IA, mais je parierais plutôt contre. Voici quelques raisons pour lesquelles je pense que l’IA sera probablement différente :
- Vitesse. Le rythme des progrès en matière d’IA est beaucoup plus rapide que lors des révolutions technologiques précédentes. Par exemple, au cours des deux dernières années, les modèles d’IA sont passés de la capacité à peine suffisante pour écrire une seule ligne de code à celle d’écrire tout ou presque tout le code pour certaines personnes, y compris les ingénieurs d’Anthropic.37Notre carte modèle pour Claude Opus 4. 5, notre modèle le plus récent, montre qu’Opus obtient de meilleurs résultats lors d’un entretien d’ingénierie des performances fréquemment organisé chez Anthropic que n’importe quel candidat dans l’histoire de l’entreprise. Bientôt, ils pourraient être capables d’effectuer l’ensemble des tâches d’un ingénieur logiciel de bout en bout.38« Écrire tout le code » et « accomplir la tâche d’un ingénieur logiciel de bout en bout » sont deux choses très différentes, car les ingénieurs logiciels font bien plus que simplement écrire du code, notamment tester, gérer les environnements, les fichiers et l’installation, gérer les déploiements informatiques dans le cloud, l’itération sur les produits, et bien plus encore.
- Ampleur cognitive. Comme le suggère l’expression « pays de génies dans un centre de données », l’IA sera capable d’exercer un très large éventail de capacités cognitives humaines, voire toutes. Cela diffère considérablement des technologies précédentes telles que l’agriculture mécanisée, les transports ou même les ordinateurs.39Les ordinateurs sont généraux dans un certain sens, mais ils sont clairement incapables, à eux seuls, d’exercer la grande majorité des capacités cognitives humaines, même s’ils surpassent largement les humains dans quelques domaines (comme l’arithmétique). Bien sûr, les éléments construits sur la base des ordinateurs, tels que l’IA, sont désormais capables d’un large éventail de capacités cognitives, ce qui est le sujet de cet essai.
- Découpage par capacité cognitive. Dans un large éventail de tâches, l’IA semble progresser du bas vers le haut de l’échelle des capacités. Par exemple, en matière de codage, nos modèles sont passés du niveau « codeur médiocre » à « codeur performant », puis à « codeur très performant ».40Pour être clair, les modèles d’IA n’ont pas exactement le même profil de forces et de faiblesses que les humains. Mais ils progressent également de manière assez uniforme dans toutes les dimensions, de sorte qu’un profil irrégulier ou inégal n’a finalement peut-être pas d’importance
- Capacité à combler les lacunes. Les emplois humains s’adaptent souvent aux nouvelles technologies de la manière suivante : les emplois comportent de nombreux aspects, et les nouvelles technologies, même si elles semblent remplacer directement les humains, présentent souvent des lacunes. Si quelqu’un invente une machine pour fabriquer des gadgets, les humains peuvent encore devoir charger les matières premières dans la machine. Même si cela ne demande que 1 % de l’effort nécessaire pour fabriquer les gadgets à la main, les travailleurs humains peuvent simplement fabriquer 100 fois plus de gadgets. Mais l’IA, en plus d’être une technologie en rapide évolution, est également une technologie qui s’adapte rapidement. À chaque sortie d’un nouveau modèle, les entreprises d’IA évaluent soigneusement les points forts et les points faibles du modèle, et les clients fournissent également ces informations après le lancement. Les faiblesses peuvent être corrigées en recueillant les tâches qui illustrent les lacunes actuelles et en les intégrant dans la formation du prochain modèle. Au début de l’IA générative, les utilisateurs ont remarqué que les systèmes d’IA présentaient certaines faiblesses (telles que des modèles d’images IA générant des mains avec un nombre incorrect de doigts) et beaucoup ont supposé que ces faiblesses étaient inhérentes à la technologie. Si tel était le cas, cela limiterait les perturbations sur le marché du travail. Mais la quasi-totalité de ces faiblesses sont rapidement corrigées, souvent en l’espace de quelques mois seulement.
Il est difficile pour les gens de s’adapter à ce rythme de changement, tant au niveau des modifications apportées au fonctionnement d’un emploi donné qu’à la nécessité de changer d’emploi. Même les programmeurs légendaires se décrivent de plus en plus souvent comme « à la traîne ». Le rythme pourrait même continuer à s’accélérer, car les modèles de codage de l’IA accélèrent de plus en plus le développement de l’IA. Pour être clair, la vitesse en soi ne signifie pas que les marchés du travail et l’emploi ne finiront pas par se redresser, mais simplement que la transition à court terme sera particulièrement douloureuse par rapport aux technologies passées, car les êtres humains et les marchés du travail sont lents à réagir et à trouver un équilibre.
Il sera donc plus difficile pour les personnes de passer facilement d’un emploi supprimé à un emploi similaire qui leur conviendrait. Par exemple, les capacités intellectuelles générales requises pour les emplois de débutants dans les domaines de la finance, du conseil et du droit sont assez similaires, même si les connaissances spécifiques sont très différentes. Une technologie qui ne perturberait qu’un seul de ces trois domaines permettrait aux employés de passer aux deux autres substituts proches (ou aux étudiants de premier cycle de changer de filière). Mais perturber les trois à la fois (ainsi que de nombreux autres emplois similaires) peut être plus difficile à adapter pour les gens. De plus, ce n’est pas seulement que la plupart des emplois existants seront perturbés. Cela s’est déjà produit auparavant : rappelez-vous que l’agriculture représentait un pourcentage important de l’emploi. Mais les agriculteurs pouvaient se reconvertir dans un travail relativement similaire, celui d’opérateur de machines dans des usines, même si ce travail n’était pas courant auparavant. En revanche, l’IA correspond de plus en plus au profil cognitif général des humains, ce qui signifie qu’elle sera également performante dans les nouveaux emplois qui seraient normalement créés en réponse à l’automatisation des anciens. En d’autres termes, l’IA ne remplace pas des emplois humains spécifiques, mais constitue plutôt un substitut général à la main-d’œuvre humaine.
Nous commençons maintenant à observer la même progression dans l’ensemble des emplois de bureau. Nous risquons donc de nous retrouver dans une situation où, au lieu d’affecter les personnes ayant des compétences spécifiques ou exerçant des professions spécifiques (qui peuvent s’adapter en se recyclant), l’IA affecte les personnes ayant certaines propriétés cognitives intrinsèques, à savoir une capacité intellectuelle moindre (qui est plus difficile à changer) . On ne sait pas clairement où ces personnes iront ni ce qu’elles feront, et je crains qu’elles ne forment une « sous-classe » de chômeurs ou de travailleurs à très bas salaire. Pour être clair, des situations similaires se sont déjà produites auparavant : par exemple, certains économistes considèrent que les ordinateurs et Internet représentent un « changement technologique biaisé en faveur des compétences ». Mais ce biais en faveur des compétences n’était pas aussi extrême que ce que je prévois avec l’IA, et il aurait contribué à accroître les inégalités salariale41Bien que cette idée fasse l’objet d’un débat parmi les économistes., ce qui n’est pas vraiment un précédent rassurant.
Il convient d’aborder les points communs de scepticisme. Premièrement, certains affirment que la diffusion économique sera lente, de sorte que même si la technologie sous-jacente est capable d’effectuer la plupart des tâches humaines, son application réelle dans l’ensemble de l’économie pourrait être beaucoup plus lente (par exemple dans les secteurs éloignés de l’industrie de l’IA et lents à l’adopter). La lenteur de la diffusion de la technologie est bien réelle : je discute avec des personnes issues d’entreprises très diverses, et dans certains cas, l’adoption de l’IA prendra des années. C’est pourquoi je prévois que 50 % des emplois de cols blancs débutants seront perturbés d’ici 1 à 5 ans, même si je pense que nous disposerons d’une IA puissante (qui serait, suffisante, d’un point de vue technologique, pour effectuer la plupart ou la totalité des tâches, et pas seulement celles de niveau débutant) dans beaucoup moins de cinq ans. Mais les effets de diffusion ne font que nous faire gagner du temps. Et je ne suis pas convaincu qu’ils seront aussi lents que les gens le prédisent. L’adoption de l’IA par les entreprises progresse à un rythme beaucoup plus rapide que n’importe quelle technologie précédente, en grande partie grâce à la puissance pure de la technologie elle-même. De plus, même si les entreprises traditionnelles sont lentes à adopter les nouvelles technologies, des start-ups verront le jour pour servir de « ciment » et faciliter l’adoption. Si cela ne fonctionne pas, les start-ups pourraient tout simplement perturber directement les entreprises en place.
Cela pourrait conduire à un monde où ce ne sont pas tant des emplois spécifiques qui sont perturbés, mais plutôt les grandes entreprises en général, qui sont remplacées par des start-ups beaucoup moins gourmandes en main-d’œuvre. Cela pourrait également conduire à un monde de « inégalités géographiques », où une part croissante de la richesse mondiale serait concentrée dans la Silicon Valley, qui deviendrait une économie à part entière fonctionnant à un rythme différent du reste du monde et le laissant derrière elle. Tous ces résultats seraient excellents pour la croissance économique, mais moins pour le marché du travail ou ceux qui sont laissés pour compte.
Deuxièmement, certains affirment que les emplois humains se déplaceront vers le monde physique, ce qui éviterait toute la catégorie du « travail cognitif », où l’IA progresse si rapidement. Je ne suis pas sûr non plus que cela soit très sûr. Une grande partie du travail physique est déjà effectuée par des machines (par exemple, la fabrication) ou seront bientôt effectués par des machines (par exemple, la conduite). De plus, une IA suffisamment puissante sera capable d’accélérer le développement des robots, puis de contrôler ces robots dans le monde physique. Cela permettra peut-être de gagner un peu de temps (ce qui est une bonne chose), mais je crains que ce ne soit pas suffisant. Et même si la perturbation se limitait aux tâches cognitives, elle n’en resterait pas moins d’une ampleur et d’une rapidité sans précédent.
Troisièmement, peut-être que certaines tâches nécessitent intrinsèquement une touche humaine ou en tirent grandement profit. Je suis un peu plus incertain à ce sujet, mais je reste sceptique quant au fait que cela suffise à compenser l’essentiel des impacts que j’ai décrits ci-dessus. L’IA est déjà largement utilisée pour le service à la clientèle. Beaucoup de gens déclarent qu’il est plus facile de parler de leurs problèmes personnels à une IA qu’à un thérapeute, car l’IA est plus patiente. Lorsque ma sœur a été confrontée à des problèmes médicaux pendant sa grossesse, elle avait l’impression de ne pas obtenir les réponses ou le soutien dont elle avait besoin de la part de ses prestataires de soins, et elle a trouvé que Claude avait un meilleur contact avec les patients (et réussissait mieux à diagnostiquer le problème). Je suis sûr qu’il existe certaines tâches pour lesquelles le contact humain est vraiment important, mais je ne sais pas combien. Or, nous parlons ici de trouver du travail pour presque tout le monde sur le marché du travail.
Quatrièmement, certains diront que l’avantage comparatif protégera toujours les humains. Selon la loi de l’avantage comparatif, même si l’IA est meilleure que les humains dans tous les domaines, toute différence relative entre les compétences humaines et celles de l’IA crée une base d’échange et de spécialisation entre les humains et l’IA. Le problème est que si les IA sont littéralement des milliers de fois plus productives que les humains, cette logique commence à s’effondrer. Même de minuscules coûts de transaction pourraient faire en sorte que l’IA ne trouve pas intéressant de commercer avec les humains. Et les salaires humains pourraient être très bas , même s’ils ont techniquement quelque chose à offrir.
Il est possible que tous ces facteurs puissent être pris en compte, que le marché du travail soit suffisamment résilient pour s’adapter à une perturbation aussi importante. Mais même s’il finit par s’adapter, les facteurs ci-dessus suggèrent que le choc à court terme sera d’une ampleur sans précédent.
Défenses
Que pouvons-nous faire face à ce problème ? J’ai plusieurs suggestions, dont certaines sont déjà mises en œuvre par Anthropic. La première consiste simplement à obtenir des données précises en temps réel sur l’évolution du chômage. Lorsqu’un changement économique se produit très rapidement, il est difficile d’obtenir des données fiables sur ce qui se passe, et sans données fiables, il est difficile de concevoir des politiques efficaces. Par exemple, les données gouvernementales manquent actuellement de données granulaires et à haute fréquence sur l’adoption de l’IA dans les entreprises et les industries. Depuis un an, Anthropic exploite et publie un indice économique qui montre l’utilisation de nos modèles presque en temps réel, ventilée par industrie, tâche, lieu et même des éléments tels que le fait qu’une tâche ait été automatisée ou réalisée de manière collaborative. Nous disposons également d’un conseil consultatif économique qui nous aide à interpréter ces données et à anticiper l’avenir.
Deuxièmement, les entreprises d’IA ont le choix quant à la manière dont elles travaillent avec les entreprises. L’inefficacité même des entreprises traditionnelles signifie que leur déploiement de l’IA peut être très dépendant du chemin emprunté, et il est possible de choisir un meilleur chemin. Les entreprises ont souvent le choix entre « réduire les coûts » (faire la même chose avec moins de personnel) et « l’innovation » (faire plus avec le même nombre de personnes). Le marché produira inévitablement les deux à terme, et toute entreprise d’IA compétitive devra répondre à ces deux besoins, mais il est peut-être possible d’orienter les entreprises vers l’innovation lorsque cela est possible, ce qui nous ferait gagner du temps.
Anthropic réfléchit activement à cette question.
Troisièmement, les entreprises devraient réfléchir à la manière de prendre soin de leurs employés. À court terme, faire preuve de créativité dans la réaffectation des employés au sein des entreprises peut être un moyen prometteur d’éviter les licenciements. À long terme, dans un monde où la richesse totale est énorme, où de nombreuses entreprises voient leur valeur augmenter considérablement grâce à l’augmentation de la productivité et à la concentration du capital, il pourrait être possible de rémunérer les employés humains même longtemps après qu’ils ne fournissent plus de valeur économique au sens traditionnel du terme. Anthropic examine actuellement une série de pistes possibles pour ses propres employés, que nous partagerons dans un avenir proche.
Quatrièmement, les personnes fortunées ont l’obligation de contribuer à la résolution de ce problème. Je trouve triste que de nombreuses personnes fortunées (en particulier dans le secteur des technologies) aient récemment adopté une attitude cynique et nihiliste selon laquelle la philanthropie est inévitablement frauduleuse ou inutile. Tant la philanthropie privée, comme la Fondation Gates, que les programmes publics, comme le PEPFAR, ont sauvé des dizaines de millions de vies dans les pays en développement et contribué à créer des opportunités économiques dans les pays développés. Tous les cofondateurs d’Anthropic se sont engagés à donner 80 % de leur fortune, et le personnel d’Anthropic s’est engagé individuellement à faire don d’actions de la société d’une valeur de plusieurs milliards au prix actuel, dons que la société s’est engagée à égaler.
Cinquièmement, si toutes les actions privées susmentionnées peuvent être utiles, un problème macroéconomique d’une telle ampleur nécessitera en fin de compte l’intervention des pouvoirs publics. La réponse politique naturelle à un gâteau économique énorme associé à de fortes inégalités (due au manque d’emplois ou à des emplois mal rémunérés pour beaucoup) est une fiscalité progressive. La taxe pourrait être générale ou cibler spécifiquement les entreprises d’IA. Il est évident que la conception d’une taxe est complexe et qu’il existe de nombreuses façons de se tromper. Je ne soutiens pas les politiques fiscales mal conçues. Je pense que les niveaux extrêmes d’inégalité prédits dans cet essai justifient une politique fiscale plus robuste sur la base de principes moraux fondamentaux, mais je peux également avancer un argument pragmatique aux milliardaires du monde entier, à savoir qu’il est dans leur intérêt de soutenir une bonne version de cette politique : s’ils ne soutiennent pas une bonne version, ils se retrouveront inévitablement avec une mauvaise version conçue par la foule.
En fin de compte, je considère toutes les interventions susmentionnées comme des moyens de gagner du temps. Au final, l’IA sera capable de tout faire, et nous devons nous y préparer. J’espère que d’ici là, nous pourrons utiliser l’IA elle-même pour nous aider à restructurer les marchés d’une manière qui convienne à tous, et que les interventions ci-dessus nous permettront de traverser la période de transition.
Concentration économique du pouvoir
Outre le problème du déplacement des emplois ou de l’inégalité économique en soi, il y a le problème de la concentration économique du pouvoir. La section 1 a abordé le risque que l’humanité soit privée de son pouvoir par l’IA, et la section 3 a abordé le risque que les citoyens soient privés de leur pouvoir par leurs gouvernements par la force ou la coercition. Mais un autre type de perte de pouvoir peut se produire si la concentration des richesses est telle qu’un petit groupe de personnes contrôle effectivement la politique gouvernementale grâce à son influence, et que les citoyens ordinaires n’ont aucune influence parce qu’ils n’ont pas de levier économique. La démocratie repose en fin de compte sur l’idée que l’ensemble de la population est nécessaire au fonctionnement de l’économie. Si ce levier économique disparaît, le contrat social implicite de la démocratie pourrait cesser de fonctionner. D’autres ont écrit à ce sujet, je n’ai donc pas besoin d’entrer dans les détails ici, mais je partage cette préoccupation et je crains que cela ne commence déjà à se produire.
Pour être clair, je ne suis pas opposé à ce que les gens gagnent beaucoup d’argent.
Il existe un argument solide selon lequel cela stimule la croissance économique dans des conditions normales. Je comprends les inquiétudes concernant le fait de freiner l’innovation en tuant la poule aux œufs d’or qui la génère. Mais dans un scénario où la croissance du PIB est de 10 à 20 % par an et où l’IA prend rapidement le contrôle de l’économie, alors que des individus isolés détiennent une part appréciable du PIB, l’innovation n’est pas ce dont il faut s’inquiéter. Ce qui est préoccupant, c’est le niveau de concentration des richesses qui risque de briser la société.
L’exemple le plus célèbre de concentration extrême des richesses dans l’histoire des États-Unis est l’âge d’or, et l’industriel le plus riche de cette époque était John D. Rockefeller. La fortune de Rockefeller représentait environ 2 % du PIB américain de l’époque.42La richesse personnelle est un « stock », tandis que le PIB est un « flux », il ne s’agit donc pas d’affirmer que Rockefeller détenait 2 % de la valeur économique des États-Unis. Cependant, il est plus difficile de mesurer la richesse totale d’une nation que le PIB, et les revenus individuels varient considérablement d’une année à l’autre, il est donc difficile d’établir un ratio dans les mêmes unités. Le ratio entre la plus grande fortune personnelle et le PIB, bien qu’il ne permette pas de comparer des pommes avec des pommes, constitue néanmoins un repère tout à fait raisonnable pour mesurer la concentration extrême de la richesse.
Une proportion similaire aujourd’hui conduirait à une fortune de 600 milliards de dollars, et la personne la plus riche du monde aujourd’hui (Elon Musk) dépasse déjà ce chiffre, avec environ 700 milliards de dollars. Nous sommes donc déjà à des niveaux de concentration des richesses sans précédent dans l’histoire, avant même que l’IA n’ait eu la plupart de ses répercussions économiques. Je ne pense pas qu’il soit exagéré (si nous imaginons un « pays de génies ») d’imaginer que les entreprises d’IA, les entreprises de semi-conducteurs et peut-être les entreprises d’applications en aval génèrent environ 3 000 milliards de dollars de revenus par an,43La valeur totale du travail dans l’économie est de 60 000 milliards de dollars par an, donc 3 000 milliards de dollars par an correspondraient à 5 % de ce montant. Ce montant pourrait être gagné par une entreprise qui fournirait de la main-d’œuvre pour 20 % du coût des humains et détiendrait 25 % de parts de marché, même si la demande de main-d’œuvre n’augmentait pas (ce qui serait presque certainement le cas en raison du coût moindre). soient évaluées à environ 30 000 milliards de dollars et conduisent à des fortunes personnelles se chiffrant en milliers de milliards. Dans ce monde, les débats que nous avons aujourd’hui sur la politique fiscale ne s’appliqueront tout simplement pas, car nous serons dans une situation fondamentalement différente.
À cet égard, le couplage de cette concentration économique de la richesse avec le système politique me préoccupe déjà . Les centres de données d’IA représentent déjà une part importante de la croissance économique américaine44Pour être clair, je ne pense pas que la productivité réelle de l’IA soit déjà responsable d’une part substantielle de la croissance économique américaine. Je pense plutôt que les dépenses des centres de données représentent une croissance causée par des investissements anticipés qui correspondent aux attentes du marché quant à une futurecroissance économique tirée par l’IA et qui investit en conséquence. et lient ainsi étroitement les intérêts financiers des grandes entreprises technologiques (qui se concentrent de plus en plus sur l’IA ou les infrastructures d’IA) et les intérêts politiques du gouvernement, d’une manière qui peut produire des incitations perverses. Nous le constatons déjà à travers la réticence des entreprises technologiques à critiquer le gouvernement américain et le soutien de ce dernier à des politiques anti-réglementaires extrêmes en matière d’IA.
Défenses
Que peut-on faire à ce sujet ? Tout d’abord, et c’est le plus évident, les entreprises devraient simplement choisir de ne pas y participer. Anthropic s’est toujours efforcé d’être un acteur politique et non un acteur politique, et de maintenir ses opinions authentiques quelle que soit l’administration. Nous nous sommes prononcés en faveur d’une réglementation raisonnable de l’IA et de contrôles à l’exportation qui sont dans l’intérêt public, même lorsque ceux-ci sont en contradiction avec la politique gouvernementale.45Lorsque nous sommes d’accord avec l’administration, nous le disons, et nous recherchons les points d’accord où les politiquesmutuellement soutenues sont véritablement bonnes pour le monde. Nous voulons être des intermédiaires honnêtes plutôt que des partisans ou des opposants à un parti politique donné.
Beaucoup de gens m’ont dit que nous devrions cesser de le faire, car cela pourrait entraîner un traitement défavorable, mais depuis un an que nous le faisons, la valorisation d’Anthropic a été multipliée par plus de six, une hausse presque sans précédent à notre échelle commerciale.
Deuxièmement, le secteur de l’IA a besoin d’une relation plus saine avec le gouvernement, fondée sur un engagement politique substantiel plutôt que sur un alignement politique. Notre choix de nous engager sur le fond plutôt que sur la forme est parfois interprété comme une erreur tactique ou un échec à « lire la salle » plutôt que comme une décision fondée sur des principes, et cette interprétation m’inquiète. Dans une démocratie saine, les entreprises devraient pouvoir défendre de bonnes politiques pour leur propre intérêt. À cet égard, une réaction publique contre l’IA se prépare : cela pourrait être un correctif, mais il‘est actuellement flou. Il cible en grande partie des questions qui ne sont pas réellement des problèmes (comme la consommation d’eau des centres de données) et propose des solutions (comme l’interdiction des centres de données ou des impôts sur la fortune mal conçus) qui ne répondraient pas aux véritables préoccupations. La question sous-jacente qui mérite notre attention est de veiller à ce que le développement de l’IA reste responsable de l’intérêt public, sans être capturé par une alliance politique ou commerciale particulière, et il semble important de concentrer le débat public sur ce point.
Troisièmement, les interventions macroéconomiques que j’ai décrites plus haut dans cette section, ainsi que la résurgence de la philanthropie privée, peuvent contribuer à équilibrer la balance économique, en s’attaquant à la fois aux problèmes de perte d’emplois et de concentration du pouvoir économique. Nous devrions nous inspirer de l’histoire de notre pays : même à l’âge d’or, des industriels tels que Rockefeller et Carnegie se sentaient fortement redevables à la société dans son ensemble, estimant que celle-ci avait énormément contribué à leur succès et qu’ils devaient lui rendre. Cet esprit semble de plus en plus absent aujourd’hui, et je pense qu’il constitue une grande partie de la solution à ce dilemme économique. Ceux qui sont à l’avant-garde du boom économique de l’IA devraient être prêts à renoncer à leur richesse et à leur pouvoir.
5. Les mers noires de l’infini
Effets indirects
Cette dernière section regroupe toutes les inconnues, en particulier les choses qui pourraient mal tourner en raison des avancées positives de l’IA et de l’accélération des progrès scientifiques et technologiques en général qui en résulte. Supposons que nous parvenions à éliminer tous les risques décrits jusqu’à présent et que nous commencions à récolter les fruits de l’IA. Nous obtiendrons probablement un « siècle de progrès scientifiques et économiques compressé en une décennie », ce qui sera extrêmement positif pour le monde, mais nous devrons alors faire face aux problèmes découlant de ce rythme rapide de progrès, et ces problèmes pourraient nous submerger rapidement. Nous pourrions également rencontrer d’autres risques qui surviennent indirectement à la suite des progrès de l’IA et qui sont difficiles à anticiper.
De par la nature même des inconnues inconnues, il est impossible d’en dresser une liste exhaustive, mais je vais énumérer trois préoccupations possibles à titre d’exemples illustratifs de ce à quoi nous devrions prêter attention :
- Progrès rapides en biologie. Si nous obtenons un siècle de progrès médicaux en quelques années, il est possible que nous augmentions considérablement la durée de vie humaine, et il est possible que nous acquérions également des capacités radicales telles que la capacité d’augmenter l’intelligence humaine ou de modifier radicalement la biologie humaine. Il s’agirait là de changements importants dans ce qui est possible, qui se produiraient très rapidement. Ils pourraient être positifs s’ils étaient réalisés de manière responsable (ce que j’espère, comme je l’ai décrit dans Machines of Loving Grace), mais il y a toujours un risque que cela tourne très mal, par exemple si les efforts visant à rendre les humains plus intelligents les rendent également plus instables ou avides de pouvoir. Il y a également la question des « uploads » ou « d’émulation cérébrale complète », c’est-à-dire des esprits humains numériques instanciés dans des logiciels, qui pourraient un jour aider l’humanité à transcender ses limites physiques, mais qui comportent également des risques que je trouve inquiétants.
- L’IA change la vie humaine d’une manière malsaine. Un monde avec des milliards d’intelligences bien plus intelligentes que les humains dans tous les domaines sera un monde très étrange à vivre. Même si l’IA ne vise pas activement à attaquer les humains (section 1) et n’est pas utilisée explicitement à des fins d’oppression ou de contrôle par les États (section 3), beaucoup de choses pourraient mal tourner, même sans en arriver là, par le biais d’incitations commerciales normales et de transactions nominalement consensuelles. Nous en voyons les premiers signes dans les préoccupations concernant la psychose de l’IA, l’IA poussant les gens au suicide et les préoccupations concernant les relations amoureuses avec les IA. Par exemple, des IA puissantes pourraient-elles inventer une nouvelle religion et convertir des millions de personnes à celle-ci ? La plupart des gens pourraient-ils finir par devenir « dépendants » d’une manière ou d’une autre aux interactions avec l’IA ? Les gens pourraient-ils finir par être « manipulés » par des systèmes d’IA, où une IA surveille essentiellement chacun de leurs mouvements et leur dit exactement quoi faire et quoi dire à tout moment, ce qui les conduirait à une vie « bonne », mais dépourvue de liberté ou de fierté d’accomplissement ? Il ne serait pas difficile de générer des dizaines de scénarios de ce type si je m’asseyais avec le créateur de Black Mirror et essayais de les imaginer. Je pense que cela souligne l’importance de choses telles que l’amélioration de la Constitution de Claude, au-delà de ce qui est nécessaire pour prévenir les problèmes mentionnés dans la section 1. Il semble essentiel de s’assurer que les modèles d’IA ont réellement à cœur les intérêts à long terme de leurs utilisateurs, d’une manière que des personnes réfléchies approuveraient plutôt que d’une manière subtilement déformée.
- Le but de l’être humain. Ce point est lié au précédent, mais il ne s’agit pas tant des interactions humaines spécifiques avec les systèmes d’IA que de la manière dont la vie humaine change en général dans un monde doté d’une IA puissante. Les humains seront-ils capables de trouver un but et un sens à leur vie dans un tel monde ? Je pense que c’est une question d’attitude : comme je l’ai dit dans Machines of Loving Grace, je pense que le but de l’être humain ne dépend pas du fait d’être le meilleur au monde dans un domaine, et que les humains peuvent trouver un but même sur de très longues périodes grâce à des histoires et des projets qu’ils aiment. Nous devons simplement rompre le lien entre la création de valeur économique et l’estime de soi et le sens de la vie. Mais c’est une transition que la société doit opérer, et il y a toujours le risque que nous parvenions pas à la gérer correctement.
Mon espoir, face à tous ces problèmes potentiels, est que dans un monde doté d’une IA puissante, dans laquelle nous avons confiance pour ne pas nous tuer, qui n’est pas l’outil d’un gouvernement oppressif et qui travaille véritablement pour notre compte, nous puissions utiliser l’IA elle-même pour anticiper et prévenir ces problèmes. Mais cela n’est pas garanti : comme tous les autres risques, c’est quelque chose que nous devons gérer avec prudence.
L’épreuve de l’humanité
La lecture de cet essai peut donner l’impression que nous sommes dans une situation intimidante. J’ai certainement trouvé intimidant de l’écrire, contrairement à Machines of Loving Grace, qui m’a donné l’impression de donner forme et structure à une musique d’une beauté incomparable qui résonnait dans ma tête depuis des années. Et il y a beaucoup de choses qui sont véritablement difficiles dans cette situation. L’IA fait peser des menaces sur l’humanité de multiples façons, et il existe une véritable tension entre les différents dangers, car atténuer certains d’entre eux risque d’aggraver les autres si nous ne faisons pas preuve d’une extrême prudence.
Prendre le temps de construire avec soin des systèmes d’IA afin qu’ils ne menacent pas de manière autonome l’humanité est en véritable contradiction avec la nécessité pour les nations démocratiques de garder une longueur d’avance sur les nations autoritaires et de ne pas se laisser subjuguer par elles. Mais à leur tour, les mêmes outils basés sur l’IA qui sont nécessaires pour lutter contre les autocraties peuvent, s’ils sont poussés trop loin, être retournés contre nous pour créer une tyrannie dans nos propres pays. Le terrorisme basé sur l’IA pourrait tuer des millions de personnes par le biais d’une utilisation abusive de la biologie, mais une réaction excessive à ce risque pourrait nous mener vers un État autocratique et surveillé. Les effets de l’IA sur la concentration du travail et de l’économie, en plus d’être des problèmes graves en soi, pourraient nous obliger à faire face à d’autres problèmes dans un contexte de colère publique et peut-être même de troubles civils, plutôt que de pouvoir faire appel aux meilleurs anges de notre nature. Surtout, le nombre même de risques, y compris ceux qui sont inconnus, et la nécessité de les traiter tous en même temps, créent un défi intimidant que l’humanité doit relever.
De plus, ces dernières années devraient montrer clairement que l’idée d’arrêter ou même de ralentir considérablement cette technologie est fondamentalement intenable. La formule pour construire des systèmes d’IA puissants est incroyablement simple, à tel point qu’on peut presque dire qu’elle émerge spontanément de la bonne combinaison de données et de calculs bruts. Sa création était probablement inévitable dès l’instant où l’humanité a inventé le transistor, voire avant, lorsque nous avons appris à contrôler le feu. Si une entreprise ne la construit pas, d’autres le feront presque aussi rapidement. Si toutes les entreprises des pays démocratiques arrêtaient ou ralentissaient le développement, par accord mutuel ou par décret réglementaire, les pays autoritaires continueraient tout simplement. Compte tenu de l’incroyable valeur économique et militaire de cette technologie, ainsi que de l’absence de tout mécanisme d’application significatif, je ne vois pas comment nous pourrions les convaincre d’arrêter.
Je vois toutefois une voie vers une légère modération du développement de l’IA qui soit compatible avec une vision réaliste de la géopolitique. Cette voie consiste à ralentir pendant quelques années la marche des autocraties vers une IA puissante en leur refusant les ressources dont elles ont besoin pour la construire,46Je ne pense pas que cela soit possible au-delà de quelques années : à plus long terme, ils construiront leurs propres puces. à savoir les puces et les équipements de fabrication de semi-conducteurs. Cela donne aux pays démocratiques une marge de manœuvre qu’ils peuvent « dépenser » pour construire une IA puissante de manière plus prudente, en accordant davantage d’attention à ses risques, tout en continuant à avancer suffisamment vite pour battre confortablement les autocraties. La course entre les entreprises d’IA au sein des démocraties peut alors être gérée dans le cadre d’un cadre juridique commun, grâce à un mélange de normes industrielles et de réglementation.
Anthropic a fortement plaidé en faveur de cette voie, en poussant à la mise en place de contrôles sur les exportations de puces et d’une réglementation judicieuse de l’IA, mais même ces propositions qui semblent relever du bon sens ont été largement rejetées par les décideurs politiques aux États-Unis (le pays où elles sont le plus importantes). L’IA représente un tel gagne-pain – littéralement des milliers de milliards de dollars par an – que même les mesures les plus simples ont du mal à surmonter l’économie politique inhérente à l’IA. C’est là le piège : l’IA est si puissante, si lucrative, qu’il est très difficile pour la civilisation humaine de lui imposer la moindre restriction.
Je peux imaginer, comme Sagan l’a fait dans Contact, que cette même histoire se répète sur des milliers de mondes. Une espèce acquiert la conscience, apprend à utiliser des outils, entame l’ascension exponentielle de la technologie, fait face aux crises de l’industrialisation et des armes nucléaires, et si elle survit à celles-ci, elle est confrontée au défi le plus difficile et le plus ultime lorsqu’elle apprend à façonner le sable pour en faire des machines qui pensent. Que nous survivions à cette épreuve et continuions à construire la belle société décrite dans Machines of Loving Grace, ou que nous succombions à l’esclavage et à la destruction, dépendra de notre caractère et de notre détermination en tant qu’espèce, de notre esprit et de notre âme.
Malgré les nombreux obstacles, je crois que l’humanité a en elle la force nécessaire pour réussir cette épreuve. Je suis encouragé et inspiré par les milliers de chercheurs qui ont consacré leur carrière à nous aider à comprendre et à orienter les modèles d’IA, ainsi qu’à façonner le caractère et la constitution de ces modèles. Je pense qu’il y a maintenant de bonnes chances que ces efforts portent leurs fruits à temps pour avoir un impact significatif. Je suis encouragé par le fait qu’au moins certaines entreprises ont déclaré qu’elles allaient payer des coûts commerciaux importants pour empêcher leurs modèles de contribuer à la menace du bioterrorisme. Je suis encouragé par le fait que quelques personnes courageuses aient résisté aux courants politiques dominants et adopté une loi qui pose les premiers jalons de garde-fous raisonnables pour les systèmes d’IA. Je suis encouragé par le fait que le public comprenne que l’IA comporte des risques et souhaite que ces risques soient pris en compte. Je suis encouragé par l’esprit indomptable de liberté qui règne dans le monde entier et par la détermination à résister à la tyrannie où qu’elle se manifeste.
Mais nous devrons redoubler d’efforts si nous voulons réussir. La première étape consiste pour ceux qui sont les plus proches de la technologie à simplement dire la vérité sur la situation dans laquelle se trouve l’humanité, ce que j’ai toujours essayé de faire ; je le fais de manière plus explicite et avec plus d’urgence dans cet essai. L’étape suivante consistera à convaincre les penseurs, les décideurs politiques, les entreprises et les citoyens du monde entier et les citoyens du monde entier de l’urgence et de l’importance capitale de cette question, qui mérite qu’on y consacre de la réflexion et du capital politique par rapport aux milliers d’autres questions qui dominent l’actualité chaque jour. Ensuite, il faudra faire preuve de courage, afin qu’un nombre suffisant de personnes aient le courage d’aller à contre-courant des tendances dominantes et de défendre leurs principes, même face à des menaces pour leurs intérêts économiques et leur sécurité personnelle.
Les années à venir seront incroyablement difficiles et exigeront de nous plus que ce que nous pensons pouvoir donner. Mais au cours de ma carrière de chercheur, de dirigeant et de citoyen, j’ai vu suffisamment de courage et de noblesse pour croire que nous pouvons gagner, que dans les circonstances les plus sombres, l’humanité trouve le moyen de rassembler, apparemment à la dernière minute, la force et la sagesse nécessaires pour l’emporter. Nous n’avons pas de temps à perdre.
Je tiens à remercier Erik Brynjolfsson, Ben Buchanan, Mariano-Florentino Cuéllar, Allan Dafoe, Kevin Esvelt, Nick Beckstead, Richard Fontaine, Jim McClave et de nombreux membres du personnel d’Anthropic pour leurs commentaires utiles sur les versions préliminaires de cet essai.
Les traductions de 2026 (.xlsx) – celles de 2025 – par Gilles en vrac
Les caractères gras dans le texte sont de Gilles
Pour vous recevoir un courriel hebdomadaire vers mes traductions.
Notes
- 1Cela rejoint un point que j’ai soulevé dans Machines of Loving Grace, où j’ai commencé par dire que les avantages de l’IA ne devaient pas être considérés comme une prophétie de salut, et qu’il était important d’être concret et réaliste et d’éviter toute grandiloquence. En fin de compte, les prophéties de salut et les prophéties de malheur ne sont d’aucune aide pour affronter le monde réel, pour essentiellement les mêmes raisons. ↩︎
- 2L’objectif d’Anthropic est de rester cohérent à travers ces changements. Lorsque parler des risques liés à l’IA était politiquement populaire, Anthropic prônait prudemment une approche judicieuse et fondée sur des preuves pour faire face à ces risques. Maintenant que parler des risques liés à l’IA est politiquement impopulaire, Anthropic continue de prôner prudemment une approche judicieuse et fondée sur des preuves pour faire face à ces risques. ↩︎
- 3Au fil du temps, j’ai acquis une confiance croissante dans la trajectoire de l’IA et dans la probabilité qu’elle dépasse les capacités humaines dans tous les domaines, mais une certaine incertitude subsiste. ↩︎
- 4Les contrôles à l’exportation des puces en sont un excellent exemple. Ils sont simples et semblent fonctionner dans l’ensemble. ↩︎
- 5Et bien sûr, la recherche de telles preuves doit être intellectuellement honnête, de manière à pouvoir également mettre en évidence l’absence de danger. La transparence grâce aux fiches modèles et autres divulgations est une tentative d’atteindre cette honnêteté intellectuelle. ↩︎
- 6En effet, depuis la rédaction de Machines of Loving Grace en 2024, les systèmes d’IA sont devenus capables d’effectuer des tâches qui prennent plusieurs heures à des humains. METR a récemment estimé qu’Opus 4.5 pouvait effectuer environ quatre heures de travail humain avec une fiabilité de 50 %. ↩︎
- 7Et pour être clair, même si une IA puissante n’est plus qu’à 1 ou 2 ans d’ici d’un point de vue technique, bon nombre de ses conséquences sociétales, tant positives que négatives, pourraient prendre quelques années supplémentaires à se manifester. C’est pourquoi je peux à la fois penser que l’IA va bouleverser 50 % des emplois de cols blancs de niveau débutant d’ici 1 à 5 ans, tout en pensant que nous pourrions disposer d’une IA plus performante que tout le monde d’ici seulement 1 à 2 ans. ↩︎
- 8Il convient d’ajouter que le grand public (par opposition aux décideurs politiques) semble très préoccupé par les risques liés à l’IA. Je pense que certaines de leurs préoccupations sont justifiées (par exemple, la suppression d’emplois par l’IA), tandis que d’autres sont erronées (comme les préoccupations concernant la consommation d’eau de l’IA, qui n’est pas significative). Cette réaction me donne l’espoir qu’un consensus sur la manière de traiter les risques est possible, mais jusqu’à présent, cela ne s’est pas encore traduit par des changements politiques, et encore moins par des changements politiques efficaces ou bien ciblés. ↩︎
- 9Ils peuvent également, bien sûr, manipuler (ou simplement payer) un grand nombre d’êtres humains pour qu’ils fassent ce qu’ils veulent dans le monde physique. ↩︎
- 10Je ne pense pas qu’il s’agisse d’un argument fallacieux : d’après ce que j’ai compris, Yann LeCun défend cette position. ↩︎
- 11Voir par exemple la section 5.5.2 (p. 63-66) de la fiche système Claude 4. ↩︎
- 12Il existe également un certain nombre d’autres hypothèses inhérentes au modèle simple, que je ne vais pas aborder ici. D’une manière générale, elles devraient nous rendre moins inquiets quant à l’histoire simple et spécifique de la recherche de pouvoir déséquilibrée, mais aussi plus inquiets quant à d’éventuels comportements imprévisibles que nous n’avons pas anticipés. ↩︎
- 13Ender’s Gamedécrit une version de ce scénario impliquant des humains plutôt que l’IA. ↩︎
- 14Par exemple, on peut demander aux modèles de ne pas faire diverses mauvaises choses et d’obéir aux humains, mais ils peuvent alors observer que de nombreux humains font exactement ces mauvaises choses ! On ne sait pas clairement comment cette contradiction serait résolue (et une constitution bien conçue devrait encourager le modèle à gérer ces contradictions avec élégance), mais ce type de dilemme n’est pas si différent des situations supposées « artificielles » que nous plaçons les modèles d’IA lors des tests. ↩︎
- 15Incidemment, l’une des conséquences du fait que la constitution soit un document en langage naturel est qu’elle est lisible par tous, ce qui signifie qu’elle peut être critiquée par n’importe qui et comparée à des documents similaires d’autres entreprises. Il serait utile de créer une course vers le sommet qui encourage non seulement les entreprises à publier ces documents, mais aussi à les améliorer. ↩︎
- 16Il existe existe même une hypothèse selon laquelle un principe unificateur profond relierait l’approche basée sur les personnages de l’IA constitutionnelle aux résultats de la science de l’interprétabilité et de l’alignement. Selon cette hypothèse, les mécanismes fondamentaux qui animent Claude ont initialement été conçus comme des moyens de simuler des personnages lors du pré-entraînement, par exemple en prédisant ce que diraient les personnages d’un roman. Cela suggère qu’une façon utile d’envisager la constitution serait plutôt comme une description de personnage que le modèle utilise pour instancier une personnalité cohérente. Cela nous aiderait également à expliquer les résultats « I doit être une mauvaise personne » que j’ai mentionnés plus haut (car le modèle essaie d’agir comme s’il s’agissait d’un personnage cohérent, en l’occurrence un mauvais personnage), et suggérerait que les méthodes d’interprétabilité devraient permettre de découvrir des « traits psychologiques » au sein des modèles. Nos chercheurs travaillent actuellement à des moyens de tester cette hypothèse. ↩︎
- 17Pour être clair, la surveillance est effectuée dans le respect de la vie privée. ↩︎
- 18Même dans nos propres expériences avec ce qui sont essentiellement des règles imposées volontairement dans le cadre de notre Responsible Scaling Policy, nous avons constaté à maintes reprises qu’il est très facile de finir par être trop rigide, en traçant des lignes qui semblent importantes a priori, mais qui s’avèrent ridicules rétrospectivement. Il est très facile de fixer des règles sur les mauvaises choses lorsque la technologie progresse rapidement ↩︎
- 19Les lois SB 53 et RAISE ne s’appliquent pas du tout aux entreprises dont le chiffre d’affaires annuel est inférieur à 500 millions de dollars. Elles ne s’appliquent qu’aux entreprises plus grandes et mieux établies, comme Anthropic. ↩︎
- 20J’ai lu l’essai de Joy pour la première fois il y a 25 ans, lorsqu’il a été écrit, et il m’a profondément marqué. Aujourd’hui comme hier, je le trouve trop pessimiste : je ne pense pas que l’abandon général de certains domaines technologiques, comme le suggère Joy, soit la solution, mais les questions qu’il soulève étaient étonnamment prémonitoires, et Joy écrit également avec une profonde compassion et une humanité que j’admire. ↩︎
- 21Nous devons nous préoccuper des acteurs étatiques, aujourd’hui et à l’avenir, et j’aborde ce sujet dans la section suivante ↩︎
- 22Il existe des preuves que de nombreux terroristes sont au moins relativement bien éduqués, ce qui peut sembler contredire mon argumentation sur la corrélation négative entre capacité et motivation. Mais je pense qu’en réalité, ces observations sont compatibles : si le seuil de capacité pour réussir une attaque est élevé, alors, presque par définition, ceux qui réussissent actuellement doivent avoir une capacité élevée, même si la capacité et la motivation sont négativement corrélées. Mais dans un monde où les limites de capacité seraient supprimées (par exemple, avec les futurs LLM), je prédirais qu’une partie importante de la population ayant la motivation de tuer mais des capacités moindres commencerait à le faire, comme c’est le cas pour les crimes qui ne nécessitent pas beaucoup de capacités (comme les fusillades dans les écoles). ↩︎
- 23Aum Shinrikyo a toutefois essayé. Le chef d’Aum Shinrikyo, Seiichi Endo, avait suivi une formation en virologie à l’université de Kyoto et avait tenté de produire à la fois de l’anthrax et du virus Ebola. Cependant, en 1995, même lui ne disposait pas de l’expertise et des ressources suffisantes pour y parvenir. La barre est désormais nettement plus basse, et les LLM pourraient la faire baisser encore davantage. ↩︎
- 24Un phénomène étrange lié aux auteurs de meurtres de masse est que le mode opératoire qu’ils choisissent s’apparente presque à une mode grotesque. Dans les années 1970 et 1980, les tueurs en série étaient très courants, et les nouveaux serial killers copiaient souvent le comportement de serial killers plus établis ou plus célèbres. Dans les années 1990 et 2000, les fusillades de masse sont devenues plus courantes, tandis que les serial killers sont devenus moins fréquents. Aucun changement technologique n’a déclenché ces comportements, il semble simplement que les meurtriers violents copiaient le comportement les uns des autres et que ce qui était « populaire » à copier a changé. ↩︎
- 25Les prisonniers occasionnels pensent parfois qu’ils ont compromis ces classificateurs lorsqu’ils obtiennent du modèle une information spécifique, telle que la séquence génomique d’un virus. Mais comme je l’ai expliqué précédemment, le modèle de menace qui nous préoccupe implique des conseils interactifs étape par étape, s’étalant sur plusieurs semaines ou mois, concernant des étapes spécifiques et obscures du processus de production d’armes biologiques, et c’est contre cela que nos classificateurs visent à nous défendre. (Nous décrivons souvent nos recherches comme la recherche de « jailbreaks universels », c’est-à-dire des jailbreaks qui ne fonctionnent pas seulement dans un contexte spécifique ou restreint, mais qui ouvrent largement le comportement du modèle.) ↩︎
- 26Nous continuerons toutefois à investir dans des travaux visant à rendre nos classificateurs plus efficaces, et il peut être judicieux pour les entreprises de partager entre elles des avancées telles que celles-ci. ↩︎
- 27Évidemment, je ne pense pas que les entreprises devraient être tenues de divulguer les détails techniques des étapes spécifiques de la production d’armes biologiques qu’elles bloquent, et la législation sur la transparence qui a été adoptée jusqu’à présent (SB 53 et RAISE) tient compte de cette question. ↩︎
- 28Une autre idée connexe est celle des « marchés de la résilience », dans lesquels le gouvernement encourage le stockage d’EPI, de respirateurs et d’autres équipements essentiels nécessaires pour répondre à une attaque biologique en s’engageant à l’avance à payer un prix convenu à l’avance pour ces équipements en cas d’urgence. Cela incite les fournisseurs à stocker ces équipements sans craindre que le gouvernement ne les saisisse sans compensation. ↩︎
- 29Pourquoi suis-je plus inquiet que les grands acteurs s’emparent du pouvoir que des petits acteurs causent des destructions ? Parce que la dynamique est différente. S’emparer du pouvoir consiste à savoir si un acteur peut accumuler suffisamment de force pour vaincre tous les autres . Nous devons donc nous préoccuper des acteurs les plus puissants et/ou les plus proches de l’IA. En revanche, la destruction peut être causée par des acteurs peu puissants si elle est beaucoup plus difficile à contrer qu’à provoquer. Il s’agit alors de se défendre contre les menaces les plus nombreuses, qui sont susceptibles de provenir d’acteurs plus modestes. ↩︎
- 30Cela peut sembler en contradiction avec mon argument selon lequel l’attaque et la défense peuvent être plus équilibrées avec les cyberattaques qu’avec les armes biologiques , mais ma crainte ici est que si l’IA d’un pays est la plus puissante au monde, les autres ne pourront pas se défendre, même si la technologie elle-même présente un équilibre intrinsèque entre attaque et défense. ↩︎
- 31Aux États-Unis, cela inclut par exemple le quatrième amendement et le Posse Comitatus Act. ↩︎
- 32De plus, pour être clair, il existe certains arguments en faveur de la construction de grands centres de données dans des pays aux structures de gouvernance variées, en particulier s’ils sont contrôlés par des entreprises dans des démocraties. De telles constructions pourraient en principe aider les démocraties à mieux rivaliser avec le PCC, qui représente une menace plus importante. Je pense également que ces centres de données ne présentent pas de risque particulier, à moins qu’ils ne soient très grands. Mais dans l’ensemble, je pense qu’il convient d’être prudent lorsqu’on installe de très grands centres de données dans des pays où les garanties institutionnelles et les protections de l’État de droit sont moins bien établies. ↩︎
- 33Il s’agit bien sûr également un argument en faveur de l’amélioration de la sécurité de la dissuasion nucléaire afin de la rendre plus résistante face à une IA puissante, et les démocraties dotées d’armes nucléaires devraient le faire. Mais nous ne savons pas de quoi une IA puissante sera capable ni quelles défenses, le cas échéant, fonctionneront contre elle, nous ne devons donc pas supposer que ces mesures résoudront nécessairement le problème. ↩︎
- 34Il existe également le risque que, même si la dissuasion nucléaire reste efficace, un pays attaquant décide de nous prendre au mot : il n’est pas certain que nous serions prêts à utiliser des armes nucléaires pour nous défendre contre un essaim de drones, même si celui-ci présente un risque important de nous conquérir. Les essaims de drones pourraient être une nouvelle menace, moins grave que les attaques nucléaires, mais plus grave que les attaques conventionnelles. Par ailleurs, des évaluations divergentes de l’efficacité de la dissuasion nucléaire à l’ère de l’IA pourraient modifier la théorie des jeux du conflit nucléaire de manière déstabilisante. ↩︎
- 35Pour être clair, je pense que la bonne stratégie consiste à ne pas vendre de puces à la Chine, même si le délai nécessaire pour mettre au point une IA puissante était beaucoup plus long. Nous ne pouvons pas rendre les Chinois « dépendants » aux puces américaines : ils sont déterminés à développer leur propre industrie de puces d’une manière ou d’une autre. Cela leur prendra de nombreuses années, et en leur vendant des puces, nous ne faisons que leur donner un coup de pouce pendant cette période. ↩︎
- 36Pour être clair, la plupart des armes utilisées aujourd’hui en Ukraine et à Taïwan ne sont pas entièrement autonomes. Elles le deviendront, mais ce n’est pas le cas aujourd’hui. ↩︎
- 37Notre carte modèle pour Claude Opus 4. 5, notre modèle le plus récent, montre qu’Opus obtient de meilleurs résultats lors d’un entretien d’ingénierie des performances fréquemment organisé chez Anthropic que n’importe quel candidat dans l’histoire de l’entreprise. ↩︎
- 38« Écrire tout le code » et « accomplir la tâche d’un ingénieur logiciel de bout en bout » sont deux choses très différentes, car les ingénieurs logiciels font bien plus que simplement écrire du code, notamment tester, gérer les environnements, les fichiers et l’installation, gérer les déploiements informatiques dans le cloud, l’itération sur les produits, et bien plus encore. ↩︎
- 39Les ordinateurs sont généraux dans un certain sens, mais ils sont clairement incapables, à eux seuls, d’exercer la grande majorité des capacités cognitives humaines, même s’ils surpassent largement les humains dans quelques domaines (comme l’arithmétique). Bien sûr, les éléments construits sur la base des ordinateurs, tels que l’IA, sont désormais capables d’un large éventail de capacités cognitives, ce qui est le sujet de cet essai. ↩︎
- 40Pour être clair, les modèles d’IA n’ont pas exactement le même profil de forces et de faiblesses que les humains. Mais ils progressent également de manière assez uniforme dans toutes les dimensions, de sorte qu’un profil irrégulier ou inégal n’a finalement peut-être pas d’importance ↩︎
- 41
- 42La richesse personnelle est un « stock », tandis que le PIB est un « flux », il ne s’agit donc pas d’affirmer que Rockefeller détenait 2 % de la valeur économique des États-Unis. Cependant, il est plus difficile de mesurer la richesse totale d’une nation que le PIB, et les revenus individuels varient considérablement d’une année à l’autre, il est donc difficile d’établir un ratio dans les mêmes unités. Le ratio entre la plus grande fortune personnelle et le PIB, bien qu’il ne permette pas de comparer des pommes avec des pommes, constitue néanmoins un repère tout à fait raisonnable pour mesurer la concentration extrême de la richesse. ↩︎
- 43La valeur totale du travail dans l’économie est de 60 000 milliards de dollars par an, donc 3 000 milliards de dollars par an correspondraient à 5 % de ce montant. Ce montant pourrait être gagné par une entreprise qui fournirait de la main-d’œuvre pour 20 % du coût des humains et détiendrait 25 % de parts de marché, même si la demande de main-d’œuvre n’augmentait pas (ce qui serait presque certainement le cas en raison du coût moindre). ↩︎
- 44Pour être clair, je ne pense pas que la productivité réelle de l’IA soit déjà responsable d’une part substantielle de la croissance économique américaine. Je pense plutôt que les dépenses des centres de données représentent une croissance causée par des investissements anticipés qui correspondent aux attentes du marché quant à une futurecroissance économique tirée par l’IA et qui investit en conséquence. ↩︎
- 45Lorsque nous sommes d’accord avec l’administration, nous le disons, et nous recherchons les points d’accord où les politiquesmutuellement soutenues sont véritablement bonnes pour le monde. Nous voulons être des intermédiaires honnêtes plutôt que des partisans ou des opposants à un parti politique donné. ↩︎
- 46Je ne pense pas que cela soit possible au-delà de quelques années : à plus long terme, ils construiront leurs propres puces. ↩︎
