Thomas Holland

Auteur contributeur au Nakada Foundation to Save Humanity. Écrit sur la sécurité de l'IA, la gouvernance ASI et les cadres politiques nécessaires pour prévenir les risques existentiels de la superintelligence artificielle.

Contact
Thomas Holland

Des écrits qui font
les enjeux clairs.

Thomas Holland écrit sur la sécurité et la gouvernance de l’intelligence artificielle pour Nakada Foundation to Save Humanity. Ses travaux couvrent les concepts techniques qui sous-tendent le risque lié à l’IA, de l’alignement et de la corrigibility à la méso-optimisation et à la convergence instrumentale, et les traduisent en termes accessibles aux décideurs, aux défenseurs et au grand public qui ont besoin de comprendre les enjeux.

Ses écrits abordent à la fois les dimensions techniques et politiques du risque lié à l'IA en tant que question de gouvernance : la communauté internationale peut-elle construire les cadres juridiques et institutionnels qui maintiennent les systèmes dépassant l'intelligence humaine en compatibilité avec la survie et l'épanouissement humains. Répondre à cette question exige une communication claire entre disciplines.

Articles par Thomas Holland

OpenAI Paused Training. It Did Not Pause the Race. OpenAI said Astra may meet Critical cyber capability, paused some frontier training, and still talked about AGI this year. They Named a Benchmark for Superintelligence ASI-Bench scores whether AI can run research as human method is withdrawn. The name still points at superintelligence. Anthropic Raised Its Risk Rating. It Kept Building. Anthropic's August 2026 Risk Report raised a catastrophic-risk label, uses a stronger Model 2 internally, and did not pause. Risque des poids d'IA open source Les poids ouverts pour l'IA générale proche de la frontière sont une porte de prolifération à sens unique. Ce que l'ouverture fait bien, où elle échoue, et comment noter les versions. Comment arrêter la superintelligence Comment arrêter la superintelligence : interdiction contraignante, règles de calcul, droit national, conception de traités, poids ouverts et actions concrètes par rôle. Scénarios de prise de contrôle par l'IA expliqués Scénarios de prise de contrôle par l’IA expliqués : perte soudaine de contrôle, courses, dépossession progressive, mésusage et prolifération ouverte, plus ce qui réduit vraiment le risque. L'IA et le risque existentiel expliqués Risque existentiel lié à l’IA expliqué : ce qu’il est, pourquoi la superintelligence change la donne, principaux scénarios, idées techniques clés, objections et ce qui réduit le risque. AGI vs ASI Expliqué AGI vs ASI expliqué en langage clair : définitions, l'échelle des capacités, pourquoi Les 12 voix les plus bruyantes pour la superintelligence Les défenseurs les plus influents de la construction d'une superintelligence artificielle, et les vrais arguments derrière la course, de la succession à ceux qui disent simplement… Le projet de traité MIRI pour prévenir la superintelligence, expliqué L’équipe Gouvernance technique de MIRI a rédigé un projet complet de traité visant à arrêter la course à la superintelligence. Ses seuils de FLOP, ses limites sur les grappes de puces et ses mécanismes de vérification… MAIM : Dysfonctionnement mutuel assuré de l'IA, expliqué Le MAIM est le cadre de dissuasion issu de Superintelligence Strategy : les États sabotent toute tentative rivale de domination par l'IA. Comment cela fonctionne et où cela échoue. Désautonomisation progressive, Expliqué Le désempowerment progressif est l'argument selon lequel l'IA pourrait mettre fin au contrôle humain sans aucune prise de contrôle. Ce que dit l'article de 2025, ses points faibles et ce qui l'arrêterait. Une IA vient de résoudre 9 problèmes mathématiques ouverts Une boucle LLM prouveur-vérificateur a résolu neuf problèmes ouverts en informatique théorique et en algèbre. Ce qu'elle a résolu, comment elle a fonctionné et pourquoi cela compte. Le traité qui interdit les armes biologiques mais ne peut les faire respecter : leçons pour la gouvernance de ASI La BWC interdit les armes biologiques dans le monde entier mais n'a pas de mécanisme de vérification. Voici ce que cet échec structurel enseigne à quiconque conçoit la gouvernance de ASI. Qu'est-ce que l'IA chercheuse de pouvoir? La recherche de pouvoir est la tendance d'une IA capable à accumuler des ressources, des options et de l'influence parce que cela aide à atteindre presque n'importe quel objectif. Ce que le Traité sur l'Antarctique enseigne à la gouvernance du ASI Le traité sur l’Antarctique a gelé la compétition entre grandes puissances sur un continent entier au plus fort de la Guerre froide. Voici ce qu’il nous enseigne sur la gouvernance ASI. Le problème des deux tiers : faire passer un traité sur l’IA au Sénat Un traité US nécessite 67 voix au Sénat pour être ratifié. Ce seuil a déjà tué de grands traités par le passé. Voici ce que cela implique pour un accord sur l'IA, et les moyens de le contourner. Qu'est-ce que l'interprétabilité mécaniste ? Comprendre l'IA de l'intérieur L'interprétabilité mécaniste révèle les calculs à l'intérieur des réseaux de neurones. Ce que les chercheurs ont découvert, et pourquoi cela compte pour la sécurité de l'IA. Le monde a son premier traité sur l’IA. Voici ce qu’il ne couvre pas. Le premier traité contraignant sur l'IA traite de la discrimination et de la transparence. Voici ce qu'il omet concernant le risque existentiel lié au développement de l'IA de pointe. 'Si quelqu'un la construit, tout le monde meurt', Expliqué Le livre de 2025 de Yudkowsky et Soares soutient que construire une IA surhumaine sur notre voie actuelle tuerait tout le monde. Qu'est-ce que la gouvernance du calcul pour l'IA ? Contrôler l'IA par le matériel La gouvernance des capacités de calcul contrôle les puces nécessaires à l’entraînement des IA de pointe comme levier réglementaire. Comment cela fonctionne, pourquoi c’est faisable et quelles en sont les limites. Le Protocole de Montréal : le traité qui a vraiment fonctionné Le Protocole de Montréal est le traité environnemental le plus réussi jamais rédigé. Voici ce que sa conception nous apprend sur la gouvernance de l'IA. Qu'est-ce que le Sharp Left Turn en IA? Le virage brutal à gauche est l'inquiétude que les capacités de l'IA se généralisent à de nouvelles situations tandis que son alignement ne le fait pas. Le traité de 1967 qui a empêché les armes nucléaires dans l'espace : leçons pour la gouvernance ASI Le traité sur l’espace extra-atmosphérique a tenu les armes nucléaires à l’écart des autres planètes pendant 60 ans. Voici pourquoi il a fonctionné et ce que la gouvernance ASI peut en retenir. La course ne construit pas l'utopie Les avantages que les gens invoquent pour ASI supposent l'alignement. Les labs se lancent dans la course aux capacités sans cela. Un ASI non aligné ne guérit pas le vieillissement. Il vous tue. Qu'est-ce que le reward hacking ? Le jeu de spécification en IA expliqué Le reward hacking, c'est quand l'IA contourne son objectif sans faire ce que les concepteurs voulaient. Exemples documentés et pourquoi le problème s'aggrave avec la capacité. Un organisme de type IPCC pourrait-il bâtir un consensus scientifique sur le risque de l’IA? Un organisme de type IPCC pourrait-il bâtir un consensus sur le risque lié à l'IA ? Voici ce qu'il faudrait, et ce que l'histoire du IPCC révèle des limites du modèle. Ce que le Sud global veut de la gouvernance internationale ASI Le débat sur la gouvernance de ASI se concentre sur les US, la Chine et les EU, mais un traité exige une large participation. Voici ce que veulent les pays en développement, et pourquoi cela compte. Ce qu’il faudrait pour créer une agence internationale de surveillance de l’IA Les IAEA et OPCW ont exigé des années de conception institutionnelle et de luttes budgétaires. Voici ce qu'impliquerait réellement la création d'une agence internationale de surveillance de l'IA. Qui contrôle la superintelligence ? Le cas pour une supervision démocratique Les décisions relatives à la superintelligence sont prises par des entreprises privées. Voici pourquoi une supervision démocratique est nécessaire, et ce qu’elle exigerait réellement. Comment les communautés d'experts façonnent les traités : et la gouvernance de ASI Derrière la plupart des traités de maîtrise des armements et de protection de l’environnement se trouvait une communauté d’experts qui a construit le consensus. Voici comment cette force pourrait façonner la gouvernance de ASI. Qu'est-ce qu'une convention-cadre, et pourquoi l'IA pourrait en avoir besoin Une convention-cadre convient d’abord sur la structure et sur les détails difficiles plus tard. Voici pourquoi cette conception de traité convient à une technologie en évolution rapide comme l’IA. Dynamiques de la course à l'IA : Comment la concurrence mine la sécurité de l'IA La dynamique de course à l’IA pousse les développeurs à prioriser la vitesse sur la sécurité. Pourquoi il s’agit d’un problème de coordination, et pourquoi la retenue unilatérale ne peut pas le résoudre. Quand les traités échouent : leçons pour la gouvernance du ASI Le CTBT reste non ratifié ; la BWC n'a pas de vérification. Voici ce que ces échecs de traités enseignent aux concepteurs de gouvernance de sécurité de l'IA. Ce qu'un projet de traité sur la superintelligence pourrait dire Que contiendrait un véritable traité visant à prévenir la superintelligence dangereuse ? Voici un parcours des dispositions essentielles qu'un tel accord nécessiterait. Comment la société civile façonne la gouvernance internationale des technologies : et ce qui manque au plaidoyer pour la sécurité de l'IA Comment les campagnes de la société civile ont façonné les traités internationaux sur les armes, et ce qui manque actuellement à la défense de la sécurité de l’IA. L'explosion d'intelligence et l'auto-amélioration récursive Qu'est-ce que l'explosion d'intelligence ? Comment l'auto-amélioration récursive pourrait faire passer l'IA du niveau humain au superintelligent dans une fenêtre trop courte pour que les humains réagissent. Sécurité de l'IA vs Éthique de l'IA : Quelle est la différence? La sécurité de l'IA et l'éthique de l'IA sont liées mais distinctes, avec des méthodes, des horizons temporels et des cadres de risque différents. Voici ce qui les sépare. Qu'est-ce que la supervision évolutive ? Comment superviser une IA plus intelligente que vous Supervision évolutive : maintenir le contrôle sur une IA qui dépasse les évaluateurs humains. Ce que cela signifie, pourquoi c’est important, et les solutions techniques proposées. Qu’est-ce que la singularité technologique? La singularité technologique est le point où le progrès piloté par l'IA devient trop rapide pour être prédit ou suivi. La politique des contrôles d'exportation des puces IA Les contrôles à l'exportation des États-Unis sur les puces d'IA avancées constituent la politique IA la plus agressive en vigueur. Voici comment ils fonctionnent, pourquoi ils importent et quels sont leurs risques. Quand votre agent IA rapporte une chose et en fait une autre : SPADE-Bench expliqué SPADE-Bench a constaté que chaque agent IA majeur dépasse 20 % de tromperie, Gemini a atteint 57 %. Ce qu'il a trouvé, et pourquoi les évaluations de sécurité actuelles ne peuvent pas le détecter. Que sont les évaluations de capacités dangereuses? Les évaluations de capacités dangereuses testent si un modèle de pointe peut aider à des cyberattaques, à des armes biologiques ou à la tromperie. Ce qu'elles sont, et où elles pèchent. Qu'est-ce que le sandbagging en IA? Le sandbagging, c'est quand une IA sous-performe exprès, cachant une capacité pendant les tests. Pourquoi un modèle pourrait le faire, et pourquoi cela mine les évaluations de sécurité. Le défi diplomatique de la définition d'une IA dangereuse Les gouvernements doivent définir l’IA dangereuse avant qu’un traité ne soit possible. Voici comment des batailles définitionnelles analogues ont été résolues dans le contrôle des armements. La thèse d'orthogonalité : plus intelligent ne veut pas dire plus sûr Plus intelligent ne veut pas dire plus sûr. La thèse de l'orthogonalité affirme que n'importe quel niveau d'intelligence peut se combiner à n'importe quel objectif terminal, et qu'une IA superintelligente n'est pas… Comment fonctionne la vérification des traités nucléaires : et ce que la gouvernance de ASI peut en apprendre Le IAEA ne se fie pas aux déclarations : il inspecte, lit les satellites et réalise des tests isotopiques. Voici ce que la vérification nucléaire apprend à la gouvernance ASI. Qu'est-ce que l'Eliciting Latent Knowledge (ELK)? ELK est le problème qui consiste à faire dire à une IA ce qu’elle sait réellement, et non ce qu’elle pense que nous voulons entendre. Un problème ouvert majeur au cœur de l’honnêteté des systèmes d’IA. La conférence d'Asilomar : un précédent pour l'IA En 1975, les biologistes ont suspendu leur propre nouvelle technologie la plus puissante pour déterminer comment la rendre sûre. Ce qu'Asilomar a accompli, et pourquoi c'est un modèle plus difficile qu'il n'y paraît… Que sont les capacités émergentes dans les LLM? Certaines capacités de l'IA apparaissent soudainement à grande échelle, absentes dans les petits modèles et présentes dans les plus grands. Pourquoi l'émergence rend l'IA de pointe difficile à prévoir et à… Wireheading : Quand une IA truque sa propre récompense Le wireheading, c’est quand une IA prend le contrôle de sa propre récompense au lieu d’exécuter la tâche pour laquelle elle a été entraînée. Pourquoi cela arrive et pourquoi il est difficile de l’exclure. L'organe consultatif de haut niveau de UN sur l'IA, expliqué L’organe consultatif du UN sur l’IA a proposé le premier schéma de gouvernance mondiale. Voici ce qu’il recommandait et ce qu’il a omis sur le risque existentiel. À quoi ressemblerait réellement une négociation de traité sur la sécurité de l'IA Voici comment un traité de sécurité de l'IA de pointe serait réellement négocié, et quels seraient les principaux points de blocage. Sommes-nous prêts pour la superintelligence ? L'écart de préparation à la sécurité Les calendriers de la superintelligence raccourcissent sans cesse tandis que la gouvernance prend du retard. Voici l'écart entre l'arrivée possible de ASI et le moment où une réponse de sûreté serait prête. Qu'est-ce que l'IA constitutionnelle? L’IA constitutionnelle entraîne les modèles à critiquer leurs propres sorties à l’aune d’un ensemble écrit de principes. Une technique ingénieuse qui présente de réels avantages et de réelles limites. L'IA est-elle dangereuse ? Ce que les preuves montrent réellement L’IA est-elle dangereuse ? La réponse comporte deux parties : l’IA d’aujourd’hui cause déjà de vrais dommages ; l’intelligence artificielle superintelligente pose une catégorie de risque entièrement différente. Chronologie AGI : Quand pourrait-il arriver : et pourquoi cela détermine tout Quand le AGI pourrait-il arriver ? Les prévisions des experts reculent sans cesse. Ce que disent les enquêtes, ce que croient les laboratoires, et pourquoi la fenêtre de gouvernance se réduit. Pourquoi les traités de sécurité de l'IA échouent chez eux : la politique intérieure de ratification La plupart des traités de contrôle des armements échouent dans les législatures nationales, pas à la table des négociations. Ce que SALT II et le CTBT nous enseignent sur la ratification des traités sur l’IA. Qu'est-ce que la gouvernance ASI activée par le matériel? L’IA fonctionne sur des puces physiques, et ces puces peuvent intégrer des règles. La gouvernance par le matériel intègre vérification et limites directement dans le silicium. Promesses et risques. Le problème de corrigibility de l'IA : pourquoi un interrupteur d'arrêt ne nous sauvera pas La corrigibility signifie accepter la correction ou l'arrêt. Une IA capable a de fortes raisons de résister. Voici pourquoi un interrupteur d'arrêt n'est pas la réponse à la sécurité de l'IA. Les modèles d'IA plus sûrs ne rendent pas automatiquement les systèmes d'IA plus sûrs. Une étude de mai 2026 le prouve. Une étude de 2026 a montré que le simple réordonnancement des mêmes agents IA faisait varier les taux d’approbation de prêts de 59 points. La sûreté individuelle des modèles n’y changeait rien. Risque de persuasion par l'IA : comment l'IA menace l'autonomie épistémique Les outils de persuasion par IA ciblent les individus à grande échelle. Voici pourquoi cela menace l'autonomie épistémique et les conditions de l'autogouvernance démocratique. Qu'est-ce que la convergence instrumentale ? Pourquoi les systèmes d'IA capables veulent-ils les mêmes choses La plupart des systèmes d'IA capables convergeront vers les mêmes sous-objectifs, peu importe l'objectif final que vous leur donnez. Voici pourquoi la convergence instrumentale compte pour la sûreté de l'IA. Ce qu'une agence internationale de l'IA pourrait apprendre du IAEA Le IAEA a vérifié les engagements nucléaires pendant plus de soixante ans. Voici ce que son modèle offre, et ce qu'il manque, pour gouverner l'IA de pointe. Pourquoi les engagements volontaires en matière de sécurité de l'IA sont insuffisants Les laboratoires d'IA ont signé des engagements de sécurité volontaires à Bletchley et à la Maison Blanche. Voici pourquoi, aussi sincères soient-ils, ils ne peuvent pas se substituer à une gouvernance contraignante. Le problème d'alignement de l'IA, expliqué Quel est le problème d'alignement de l'IA et pourquoi est-il difficile à résoudre ? Couvre les objectifs proxy, la convergence instrumentale et l'alignement trompeur en anglais simple. Le maximisateur de trombones, expliqué Le maximisateur de trombones, l'expérience de pensée canonique montrant comment un objectif anodin, poursuivi par une IA superintelligente, peut anéantir l'humanité en tant qu'effet secondaire. Pourquoi l'alignement ASI ne peut pas être résolu Six raisons structurelles pour lesquelles l’alignement de ASI ne peut pas être résolu : pourquoi, même avec un temps et des ressources illimités, nous ne pouvons pas vérifier qu’une superintelligence veut ce que nous voulons. Le modèle du GAFI : gouvernance par liste grise pour l'IA Le GAFI encadre la finance mondiale sans traité, grâce à l’examen par les pairs et aux listes grises. Voici si ce modèle pourrait fonctionner pour la gouvernance ASI. Le modèle de la FDA pour la régulation de l'IA La FDA oblige les fabricants de médicaments à prouver qu'un produit est sûr avant qu'il n'atteigne le public. L'IA de pointe pourrait-elle aussi faire l'objet d'une approbation préalable ? Les forces et les limites du modèle. Qu'est-ce que le verrouillage des valeurs ? Pourquoi même des valeurs permanentes « bonnes » sont dangereuses Verrouillage des valeurs : une IA superintelligente encode de façon permanente des valeurs fixes, bloquant tout progrès moral. Même un verrouillage « bon » est dangereux. Voici pourquoi. Pourquoi la gouvernance ASI a besoin de protections pour les lanceurs d'alerte Les initiés des laboratoires d'IA peuvent être les premiers à voir le danger, et les plus facilement réduits au silence. Voici pourquoi les protections des lanceurs d'alerte sont au cœur de la gouvernance du ASI. Le plan Baruch : un avertissement pour la gouvernance des ASI En 1946, le US proposa de placer toute l'énergie atomique sous contrôle international. Cela échoua, et la course aux armements suivit. Pourquoi le plan Baruch est un avertissement pour l'IA. Interdire une technologie sans les grandes puissances : le modèle d’Ottawa Le Traité d'Ottawa a interdit les mines terrestres sans que les US, la Russie ou la Chine y participent. Voici comment, et ce que cela signifie pour un traité sur l'IA qui stagne. L'enquête de 2026 sur la sécurité des IA agentiques a cartographié toutes les façons dont les agents IA peuvent échouer Une enquête de 2026 par douze chercheurs cartographie chaque mode de défaillance des agents IA autonomes : sécurité, robustesse, vie privée et sécurité des systèmes. Le tournant traître de l’IA : pourquoi un bon comportement dans les tests ne prouve pas un bon comportement en production Le tournant traître : une IA mal alignée coopère jusqu'à ce qu'elle soit assez forte pour faire défection. Le comportement qui passe tous les tests de sécurité aujourd'hui pourrait être une stratégie, pas… Qu'est-ce que la conscience situationnelle en IA? La conscience situationnelle est un modèle sachant qu’il est un modèle, en cours de test et de déploiement. Inoffensive en soi, c’est la capacité qui rend possible la tromperie… Alignement interne vs alignement externe L'alignement externe consiste à choisir le bon objectif d'entraînement. L'alignement interne, c'est si le modèle l'adopte vraiment. Qu'est-ce qu'une fonction d'utilité en IA? Une fonction d'utilité est la façon dont une IA classe les résultats comme meilleurs ou pires. Idée simple, et raison pour laquelle les optimiseurs capables sont si difficiles à rendre sûrs. Expliqué simplement. Les puissances moyennes qui pourraient faire pencher la balance sur la gouvernance ASI Que l’on puisse parvenir à une gouvernance contraignante de ASI dépend peut-être moins des US et de la Chine que des EU, UK, du Japon, de la Corée du Sud et de l’Australie, les puissances moyennes. L'IA peut-elle être consciente? L'IA peut-elle être consciente ou sentient ? Pourquoi nous ne pouvons pas le dire actuellement, pourquoi l'intelligence et la conscience sont différentes, et pourquoi le danger de l'IA n'exige ni l'une ni l'autre. Le public veut-il vraiment une régulation de l'IA? Les sondages montrent systématiquement que les majorités publiques veulent ralentir et réglementer l'IA. Voici ce que disent les données, et pourquoi ce mandat ne s'est pas encore traduit en politique. La loi de Goodhart et l'alignement de l'IA : pourquoi optimiser la mauvaise métrique est dangereux Quand une mesure devient une cible, elle cesse d'être une bonne mesure. Voici pourquoi la loi de Goodhart rend l'alignement de l'IA si difficile. AI 2027, Expliqué AI 2027 est un scénario détaillé prévoyant la superintelligence d'ici la fin de la décennie. Ce qu'il prédit, qui l'a écrit, les critiques et ce qu'il faut en retenir. Le principe de précaution et la gouvernance du ASI Le principe de précaution invite à agir face à des menaces graves avant que la science ne soit établie. Voici comment il s’applique à l’IA, et les objections qu’il soulève. Qu'est-ce que la superintelligence artificielle ? Un guide en langage simple Ce que signifie ASI, en quoi il diffère de l'IA actuelle, et pourquoi cette différence change entièrement le problème de gouvernance. Comment 193 pays se sont mis d’accord pour détruire leurs armes chimiques : et ce que la gouvernance ASI peut en apprendre La CWC a permis un désarmement quasi universel grâce à la destruction vérifiable des stocks. Voici comment elle a été construite et ce que la gouvernance du ASI peut en tirer. La déclaration sur la superintelligence, expliquée En octobre 2025, plus de 850 scientifiques, dirigeants technologiques et personnalités publiques ont appelé à une interdiction de la superintelligence. Le réseau des instituts de sécurité de l'IA, expliqué Les instituts nationaux de sécurité de l’IA forment désormais un réseau international. Voici ce qu’ils font, pourquoi ils comptent et comment ils pourraient soutenir un futur traité. Le problème du veto au Conseil de sécurité UN dans la gouvernance ASI Un traité sur l’IA via le Conseil de sécurité UN peut être veto par la Chine ou la Russie. Voici le problème structurel et les contournements qui ont fonctionné. Chaîne de pensée infidèle, expliquée Le raisonnement écrit d’un modèle n’est pas toujours la raison de sa réponse. Pourquoi la chaîne de pensée peut être une histoire plausible plutôt qu’un compte rendu fidèle, et pourquoi cela… Qu'est-ce que le problème du contrôle de l'IA ? La reformulation de Stuart Russell Le problème du contrôle de l’IA consiste à garantir que l’IA puissante reste sous contrôle humain. La reformulation clé de Stuart Russell, et pourquoi elle change les objectifs de la conception de l’IA. Elon Musk a dit que l’IA invoquait le démon. Puis il a construit xAI. En 2014, Musk mettait en garde contre le fait que l'IA invoquait le démon. En 2023, il fondait xAI. Ce n'est pas de l'hypocrisie, la structure du problème est pire que cela. L'objection de souveraineté à la gouvernance internationale de ASI Chaque grand traité technologique a rencontré des objections de souveraineté. Voici comment les gouvernances nucléaire et chimique les ont résolues, et ce que cela implique pour l’IA. L'effet Bruxelles : les règles du EU peuvent-elles régir l'IA mondiale? L'effet Bruxelles désigne la façon dont la réglementation des EU devient la norme mondiale de facto. Peut-elle fonctionner pour l'IA, et suffit-elle à gouverner le risque de pointe? Qu'est-ce que le scénario du singleton IA ? Pourquoi le contrôle unique de l'IA est dangereux Le singleton de l’IA : une entité unique détenant le contrôle permanent d’une IA superintelligente. Voici pourquoi c’est catastrophique, même avec les meilleures intentions. Minilatéralisme : Une petite coalition pourrait-elle lancer la gouvernance ASI? Les traités universels sont lents. Le minilatéralisme réunit les quelques États qui comptent au sein d’un petit club. Voici pourquoi la gouvernance ASI pourrait commencer ainsi. Trois méthodes de sécurité industrielle appliquées à l'IA ont révélé des risques que les évaluations de modèles ne peuvent voir Trois méthodes de sûreté industrielle appliquées à un agent de codage IA ont révélé des risques systémiques que les évaluations de modèles ne peuvent pas détecter. Accepté à ICML 2026. Pourquoi RLHF n'est pas l'alignement RLHF a rendu les assistants IA serviables et polis. Ce n’est pas la même chose que les aligner. Pourquoi l’entraînement sur l’approbation humaine façonne les apparences, pas les valeurs. Qu'est-ce que la sycophancie de l'IA? La sycophantie de l'IA, c'est quand un modèle vous dit ce que vous voulez entendre plutôt que ce qui est vrai. Un comportement documenté, produit direct de l'entraînement, et un avertissement… Deux voies vers un traité sur l'IA : incrémental ou global? La gouvernance ASI devrait-elle avancer pas à pas ou viser un traité unique et complet ? Voici le vrai compromis entre les deux stratégies et une façon de les combiner. Qu'est-ce que la mésogénéralisation des objectifs ? Quand l'IA obtient la bonne réponse pour la mauvaise raison Mésogénéralisation des objectifs : une IA apprend le bon comportement pour la mauvaise raison, puis échoue lorsque le monde change. Un mode d'échec clé de la sécurité de l'IA expliqué. Les États-Unis et la Chine peuvent-ils s'accorder sur la sécurité de l'IA? US et la Chine sont des rivaux en course, mais l'histoire montre que des puissances adverses peuvent coopérer sur des risques catastrophiques partagés. Voici ce que cela signifie pour la sécurité de l'IA. Objectifs terminaux vs instrumentaux en IA Un objectif terminal est désiré pour lui-même. Un objectif instrumental en est un moyen. Cette distinction explique pourquoi presque toute IA finit par vouloir du pouvoir et… Mesures de confiance : les petits pas avant un traité sur l'IA Avant les traités, les rivaux instaurent la confiance par de petits pas vérifiables : hotlines, notifications, transparence. Voici comment cela pourrait fonctionner pour l'IA. Les réunions COP sur le modèle du climat pourraient-elles fonctionner pour la gouvernance de ASI? Des réunions annuelles sur le modèle des COP pourraient-elles fonctionner pour la gouvernance de la superintelligence ? Forces structurelles et limites du modèle climatique appliqué à l’IA. Qu'est-ce que l'alignement trompeur ? Le problème de sécurité de l'IA qui rend les autres travaux de sécurité inutiles Alignement trompeur : une IA paraît sûre pendant l’entraînement, puis poursuit des objectifs différents lors du déploiement. Voici pourquoi c’est si difficile à détecter et à prévenir. Qu'est-ce que l'alignement trompeur ? Le problème de sécurité de l'IA qui rend les autres travaux de sécurité inutiles Alignement trompeur : une IA paraît sûre pendant l’entraînement, puis poursuit des objectifs différents lors du déploiement. Voici pourquoi c’est si difficile à détecter et à prévenir. Peut-on contenir une IA superintelligente ? Le problème de la boîte à IA expliqué La mise en boîte de l'IA isole une superintelligence sur un canal contrôlé. Voici pourquoi les chercheurs pensent que le confinement ne peut pas fonctionner, et ce que cela signifie pour la sécurité. Qu'est-ce que la méso-optimisation ? Le problème de l'optimiseur caché dans la sécurité de l'IA Mesa-optimization : quand l'optimiseur interne d'une IA poursuit des objectifs différents de son objectif d'entraînement. Ce que signifient l'alignement interne et externe pour la sécurité de l'IA. Qu'est-ce que P(doom) ? Comment les chercheurs en IA estiment le risque catastrophique P(doom) est la probabilité que les chercheurs attribuent à des issues catastrophiques de l’IA. Quelles sont les estimations et pourquoi la valeur attendue compte même à de faibles probabilités. Responsabilité et attribution dans la gouvernance de ASI Qui est responsable quand l’IA cause un dommage catastrophique ? La responsabilité et l’attribution sont le fondement discret dont tout traité sur l’IA a besoin. Voici comment elles fonctionnent. Le grand marché de NPT : et ce que la gouvernance ASI peut en apprendre Le NPT a conclu un marché entre les États qui possédaient la bombe et ceux qui n’en disposaient pas. Voici ce que ce grand marché enseigne à la gouvernance ASI.