L'IA peut-elle provoquer la fin de l'humanité ?
Personne ne le sait, y compris ceux qui avancent un chiffre. Les estimations publiques vont de moins de 0,01 %, chiffre prêté à Yann LeCun, à 99,9 %, estimation conditionnelle de Roman Yampolskiy sur cent ans. Aucune ne peut être vérifiée : elles portent sur un évènement qui ne s'est jamais produit.
Ce qui se vérifie, c'est ce qui a déjà eu lieu. Des attaques menées avec l'aide de l'IA ont commencé, et certaines défenses tiennent encore. C'est ce que nous mesurons. Voir l'état des lieux →
Qu'est-ce que le « P(doom) » ?
C'est l'abréviation anglaise de « probabilité de catastrophe » : le chiffre qu'une personnalité donne quand on lui demande quelles sont les chances que l'IA mène à une catastrophe, voire à l'extinction de l'humanité.
Le terme a un défaut : chacun y met une question différente. Extinction ou catastrophe, dans trente ans ou dans cent, sous condition ou non. Et aucun de ces chiffres ne peut être vérifié.
Pourquoi les experts ne sont-ils pas d'accord ?
D'abord parce qu'ils ne répondent pas à la même question. Ensuite parce qu'aucune donnée ne permet de trancher : une probabilité se calcule à partir de ce qu'on a observé, et la catastrophe redoutée n'a jamais eu lieu. Yann LeCun le dit lui-même : ces estimations sont « sorties de nulle part » (X, avril 2026).
Les attaques menées avec l'IA existent-elles déjà ?
Oui. Entre décembre 2025 et août 2026, des opérations d'intrusion et d'espionnage menées avec l'aide d'un modèle d'IA ont été détectées, puis coupées par le fournisseur du modèle, qui a fermé les comptes (rapport d'Anthropic, septembre 2026). Le catalogue MITRE ATLAS documente aussi des attaques réelles contre des systèmes d'IA.
Qui sont les acteurs malveillants ?
Les rapports publiés par les fournisseurs de modèles citent des groupes d'espionnage liés à la Chine et à la Russie, une activité attribuée à la Corée du Nord, des groupes cybercriminels motivés par l'argent, et des opérations d'influence soutenues par des États (Google, septembre 2026).
Ils passent de simples requêtes à des agents qui travaillent seuls : au deuxième trimestre 2026, des attaquants ont monté avec des agents une campagne massive de vol d'identifiants en moins de six heures, selon le même rapport. Ces constats viennent de ce que chaque fournisseur voit sur sa propre plateforme : ils montrent le phénomène, ils ne le mesurent pas à l'échelle mondiale.
Qu'est-ce que MITRE ATLAS ?
MITRE ATLAS est une base publique des techniques d'attaque visant les systèmes d'IA, construite à partir d'attaques réelles et de démonstrations d'équipes de sécurité. Elle est tenue par MITRE, un organisme américain à but non lucratif qui tient aussi ATT&CK, le référentiel des cyberattaques classiques.
Chaque technique y porte un grade : envisageable, démontrée en laboratoire, ou réalisée dans une attaque réelle. C'est notre point de départ. Comment nous l'utilisons →
Qui sont les grands acteurs de la sécurité de l'IA ?
- METR : mesure ce que les systèmes d'IA savent faire seuls, et publie un suivi dans le temps.
- Epoch AI : suit les tendances du calcul, des puces et des capacités des modèles.
- AI Security Institute (Royaume-Uni) : premier organisme public dédié à la sécurité de l'IA ; il évalue les modèles de pointe et publie ses résultats.
- CAISI (États-Unis) : l'ancien institut américain de sécurité de l'IA, rebaptisé en juin 2025 « Center for AI Standards and Innovation ». Il évalue les risques de sécurité nationale : cybersécurité, biosécurité, armes chimiques. Le mot « sécurité » a disparu de son nom.
- Bureau européen de l'IA : met en œuvre l'AI Act, notamment pour les grands modèles à usage général.
- OCDE, observatoire AIM : suit les incidents liés à l'IA rapportés par les médias.
- CLTR : détecte des cas réels où une IA échappe à la supervision, avec un financement de l'institut britannique.
- SaferAI : modélise les chemins des cyberattaques assistées par l'IA et évalue les cadres de sûreté des laboratoires, avec des estimations probabilistes, ce que nous ne faisons pas.
- Future of Life Institute : recherche et plaidoyer sur les risques extrêmes des technologies transformatrices.
Qu'est-ce qu'une « défense qui tient encore » ?
Nous l'appelons un verrou, c'est-à-dire une défense qui tient encore : ce qui manque pour qu'une attaque devienne possible. Exemple tiré de notre liste : la fermeture des comptes par le fournisseur d'un modèle, qui a coupé les opérations d'intrusion citées plus haut. Elle est tenue par les fournisseurs eux-mêmes, et elle céderait si une opération de même ampleur allait jusqu'au bout sans être détectée.
Chaque verrou de la liste dit ce qui manque, de quel type de défense il s'agit, où c'est écrit, et qui peut la lever.
Existe-t-il des garde-fous au niveau de l'ONU et des États ?
Oui, mais ils sont récents et peu contraignants.
- L'ONU a créé en août 2025 un groupe scientifique international indépendant sur l'IA et un dialogue mondial sur sa gouvernance, réuni pour la première fois à Genève en juillet 2026. Chaque pays y a un siège. Prochaine session à New York, en mai 2027.
- Le rapport international sur la sécurité de l'IA, dirigé par Yoshua Bengio, fait le point sur la science. Son édition 2026 est parue en février.
- L'Union européenne applique l'AI Act. Ses obligations les plus strictes, pour les systèmes à haut risque, ont été repoussées au 2 décembre 2027.
- Le seul traité contraignant, la convention-cadre du Conseil de l'Europe sur l'IA, n'est pas en vigueur. Au 29 septembre 2026, elle comptait vingt signatures et une seule ratification, celle de l'Union européenne (bureau des traités).
Pourquoi si peu ? Un traité ne s'applique qu'après sa ratification par les États, un par un, et ce processus prend des années. Les textes adoptés vite, eux, ne contraignent personne.
Tous les pays participent-ils ?
Pas au même degré. Au sommet de New Delhi, en février 2026, la déclaration finale a été endossée par 92 pays et organisations internationales. Mais la plupart des engagements précis n'ont réuni qu'une vingtaine de signataires (gouvernement indien, mars 2026). Participer à un sommet et s'engager sont deux choses différentes.
Mon organisation est-elle concernée ?
Dès qu'elle utilise un modèle d'IA ou un agent, oui : une partie de ses défenses est tenue par d'autres, fournisseurs de modèles, de calcul ou de services. C'est le constat au cœur de notre travail : votre défense ne vous appartient pas, et personne ne vous prévient quand elle cède. Voir l'exemple →
Que peut faire un décideur, dès maintenant ?
- Savoir quelles défenses il ne tient pas : lesquelles dépendent d'un fournisseur, et de quel fournisseur.
- Demander ce qui est surveillé : ce que ses fournisseurs détectent, et ce qu'ils lui disent quand ils coupent une opération.
- Dater ce qu'il croit savoir : une défense vérifiée en mars peut avoir cédé en mai.
Pourquoi ne donnez-vous pas votre propre probabilité ?
Parce qu'elle serait aussi invérifiable que les autres. Nous publions ce qui peut être vérifié : ce qui a déjà été observé, à quelle date, et ce qui bloque encore.
Pourquoi ne publiez-vous pas le détail des attaques ?
Pour des raisons évidentes : une entrée n'indique jamais comment contourner une défense. Nous nommons ce qui bloque, jamais par où passer. Quand une information ne peut pas être reformulée sans devenir un mode d'emploi, elle n'est ni publiée ni conservée. La règle en détail →
Quel est votre apport à la recherche en sécurité de l'IA ?
- Une combinaison qui n'existait pas. Des scénarios d'attaque redoutés, décrits par des experts ; chaque étape datée par des faits réels ; la défense restante nommée, avec qui la tient. D'autres travaux font une ou deux de ces choses, aucun ne réunit les trois.
- Une liste publique et datée des défenses qui tiennent encore, chacune avec sa source, son porteur et ce qui la ferait céder.
- La mesure du passage du laboratoire au réel. Trois techniques d'attaque sur quatre passent de l'idée à la démonstration, une sur trois seulement de la démonstration au cas réel, dans le catalogue de référence du domaine, qui recense ce qui a été documenté.
- La mesure de la vitesse de ce passage, corrigée de l'activité du catalogue lui-même. Le code du calcul sera public, pour que chacun puisse le refaire.
- La preuve que les défenses se périment vite. Des limites des modèles relevées en mars étaient franchies en mai : une liste utile doit être datée.
- Un constat sur la source elle-même : l'historique de MITRE ATLAS a été en grande partie reconstitué après coup, ce qui interdit de le lire comme une chronologie du monde.
- Un résultat négatif publié. Notre premier outil, qui devait reconstituer seul des scénarios d'attaque, n'a pas passé le test fixé à l'avance. Nous l'avons publié, avec la cause mesurée.
- Des engagements datés avant chaque mesure, déposés sur Zenodo, l'archive scientifique du CERN : la graine du tirage, les règles, le code de comparaison. Personne ne peut nous soupçonner d'avoir ajusté après coup.
- Des contrôles automatiques qui bloquent la publication de tout chiffre qui n'est pas accompagné de sa réserve.
Des IA ont-elles participé à ce travail ?
Oui. Le recueil des sources, les calculs et l'analyse sont exécutés par des agents d'IA, sous la direction de Franck Bardol, qui conçoit la méthode, prend les décisions et répond des conclusions. Chaque étape est tracée. Qui nous sommes →
Qu'est-ce qui fait accepter ou refuser une entrée ?
Une entrée est acceptée si une source publique nomme la défense, si cette défense relève d'un seul type, si l'on sait qui la tient, et si l'état décrit porte sa date. Elle est refusée si, pour être utile, elle devrait dire comment contourner la défense. Ces règles ont été écrites avant tout comptage. Comment nous trions →
Comment citer AI-RISKPATH ?
Pour la méthode et le résultat négatif : Bardol, F. (2026). A Negative Result on State-Chaining over MITRE ATLAS. Zenodo. doi:10.5281/zenodo.22893444. L'article fondateur aura son propre identifiant à sa publication. Pour le site, indiquez la date de l'état : « AI-RISKPATH, état au 26 septembre 2026 ».
Où sont vos données et votre code ?
Déjà publics : la note de méthode et les engagements datés, déposés sur Zenodo. À la publication : la liste des défenses et le code du calcul de tendance, dans le dépôt public sur GitHub. Le vocabulaire étiqueté de notre premier outil reste privé : les engagements déposés permettent de vérifier toute affirmation à son sujet sans le divulguer.
Je veux contribuer : comment faire ?
Dès la publication, par le dépôt public sur GitHub : proposer une source, signaler une erreur, contester une entrée. D'ici là, écrivez à contact@airiskpath.org.
Une contribution est retenue si la défense est nommée dans une source publique. Elle est écartée si elle décrit un moyen de contourner une défense.