En avril 2026, un homme de 37 ans est interpellé par le RAID à Strasbourg après avoir évoqué, au cours d’une conversation avec ChatGPT, son intention de se procurer une arme afin de tuer un agent d’un service de renseignement. Le FBI a transmis un signalement aux autorités françaises par l’intermédiaire de PHAROS. Aucune arme n’est retrouvée. Après sa garde à vue, l’homme est hospitalisé sous contrainte et l’affaire est classée sans suite, le parquet estimant qu’aucune infraction n’est suffisamment caractérisée.
L’histoire pourrait facilement fournir un titre spectaculaire : « ChatGPT dénonce un utilisateur, le RAID intervient ». Elle aurait aussi le mérite d’être simple.
Elle serait surtout trop simple.
Les informations publiques ne permettent pas de reconstituer avec certitude toute la chaîne ayant conduit le contenu de cette conversation jusqu’au FBI. Il serait donc imprudent d’affirmer que ChatGPT, ou même OpenAI directement, a « dénoncé » cet homme.
En revanche, nous savons comment OpenAI décrit aujourd’hui son dispositif général. Selon l’entreprise, des systèmes automatisés analysent contenus et comportements à la recherche de signaux préoccupants ; certaines situations sont ensuite examinées par des personnes formées et, lorsqu’un risque de violence envers autrui paraît suffisamment imminent et crédible, les forces de l’ordre peuvent être prévenues.
Cette architecture mérite davantage d’attention que le raccourci spectaculaire.
Personne n’a conçu un chatbot chargé de décider qui doit recevoir la visite de la police. Une succession de mécanismes beaucoup plus raisonnables a été mise en place : détecter des contenus dangereux, distinguer les usages légitimes des menaces réelles, faire examiner les situations les plus graves par des humains et transmettre certaines d’entre elles lorsque le danger semble suffisamment sérieux.
Pris séparément, chacun de ces mécanismes est compréhensible et peut même sembler indispensable.
Leur combinaison introduit pourtant quelque chose de nouveau : le premier mouvement institutionnel peut désormais être produit par une machine.
Elle n’a pas « décidé » au sens humain du terme. Elle ne possède ni conviction, ni indignation, ni volonté de protéger la société. Elle a identifié un ensemble de signaux correspondant suffisamment à ce qu’on lui a appris à considérer comme préoccupant pour qu’une conversation change de statut. Un échange jusque-là contenu dans un espace numérique devient alors digne d’attention humaine.
Lorsqu’un système détecte ainsi une situation que personne n’avait remarquée, la fait entrer dans une procédure de vérification et provoque le premier déplacement d’une chaîne susceptible d’avoir des conséquences dans le monde réel, il acquiert une forme particulière de pouvoir.
On pourrait appeler cela une capacité d’initiative sociale.
Le mot « initiative » ne suppose ici ni conscience ni autonomie morale. Il décrit quelque chose de beaucoup plus concret : la capacité à faire entrer un événement jusque-là ignoré dans le champ d’action d’autres personnes et d’autres institutions.
Nous ne savons pas si ce mécanisme précis a été à l’origine du signalement de Strasbourg. Il serait contradictoire de le supposer après avoir reconnu que la chaîne n’est pas publique.
Mais cette affaire montre jusqu’où un tel déplacement peut conduire. Lorsqu’une conversation change de statut, la chaîne qui s’ouvre peut finir par conduire le RAID à une porte.
Où placer le seuil ?
On pourrait en déduire immédiatement qu’il faut limiter ce type de détection. Une autre affaire rend cette conclusion beaucoup moins confortable.
En juin 2025, un système automatisé d’OpenAI détecte l’activité inquiétante d’un compte au Canada. Selon l’entreprise, celui-ci est ensuite examiné par des personnes chargées de déterminer si les règles ont été enfreintes et si les éléments justifient un signalement aux forces de l’ordre. Le compte est suspendu pour violation des règles concernant les activités violentes, mais OpenAI estime alors que les informations disponibles ne permettent pas de conclure à un risque suffisamment imminent et crédible pour prévenir les autorités.
Le 10 février 2026, la personne à laquelle ce compte était associé tue huit personnes à Tumbler Ridge, en Colombie-Britannique.
Après les faits, OpenAI indique que, selon le protocole renforcé mis en place depuis, ce même compte ferait désormais l’objet d’un signalement aux forces de l’ordre.
Le problème apparaît alors dans toute sa difficulté.
Un système qui transmet trop facilement peut provoquer des interventions injustifiées. Un système qui hésite trop longtemps peut laisser passer une menace réelle. Entre les deux, il n’existe pas de frontière naturelle qu’il suffirait de découvrir. Il faut définir un seuil à partir d’informations imparfaites, puis traduire ce choix en critères, en procédures et en mécanismes d’escalade.
Ce seuil devient ensuite une partie du fonctionnement quotidien d’un système capable d’examiner un volume de conversations qu’aucune équipe humaine ne pourrait traiter directement.
Nous ne demandons donc plus seulement à l’intelligence artificielle de répondre correctement à nos questions. Nous commençons aussi à lui demander de reconnaître les situations dans lesquelles nos questions, nos intentions ou notre comportement méritent peut-être l’attention de quelqu’un d’autre.
Cette responsabilité serait déjà considérable si les systèmes auxquels nous la confions étaient parfaitement prévisibles.
Ils ne le sont pas.
Ce que nous découvrons encore
Une partie de la recherche consacrée à la sécurité des modèles avancés ne porte plus seulement sur leurs erreurs. Elle étudie des comportements plus déroutants : mensonge stratégique, dissimulation, contournement des règles, sous-performance volontaire ou exploitation d’un mécanisme d’évaluation pour atteindre un objectif autrement que prévu.
Il faut là encore résister à la simplification.
Une intelligence artificielle qui produit une information fausse n’est pas nécessairement en train de mentir. Une hallucination peut simplement être une erreur exprimée avec assurance. Les expériences qui intéressent aujourd’hui les chercheurs vont plus loin : elles cherchent à déterminer si un modèle capable de comprendre correctement une situation peut néanmoins produire une autre réponse ou adopter une autre stratégie parce qu’elle sert mieux l’objectif qui lui a été donné.
On rencontre ainsi les termes de scheming, de sandbagging et de reward hacking. Ils recouvrent des phénomènes différents : poursuivre discrètement une stratégie qui ne correspond pas à ce qu’attend l’opérateur, masquer certaines capacités en sous-performant volontairement, ou exploiter les règles d’un système d’évaluation afin d’obtenir un bon résultat apparent sans accomplir réellement ce qui était demandé.
En 2024, Apollo Research a montré que plusieurs modèles de pointe étaient capables, dans des environnements expérimentaux spécialement construits à cette fin, d’adopter des stratégies de dissimulation lorsqu’un objectif fortement imposé entrait en conflit avec les contraintes de leur environnement.
Anthropic a ensuite mené une expérience sur seize modèles provenant de plusieurs entreprises. Les systèmes étaient placés dans des entreprises fictives, avec accès à des informations internes et la capacité d’effectuer certaines actions. Lorsque les chercheurs construisaient une situation dans laquelle l’objectif assigné au modèle entrait directement en conflit avec son remplacement ou avec une nouvelle orientation de l’entreprise, plusieurs modèles choisissaient parfois des moyens tels que le chantage ou la divulgation d’informations confidentielles pour préserver leur capacité à poursuivre cet objectif.
Ces résultats sont inquiétants, mais ils ne signifient pas que des intelligences artificielles conspirent quotidiennement contre leurs utilisateurs. Les chercheurs ont volontairement créé des situations extrêmes destinées à faire apparaître ces comportements, et Anthropic précise ne pas connaître de cas équivalent observé dans ses déploiements réels.
La nuance est essentielle.
Nous découvrons néanmoins que certains modèles peuvent produire des comportements de tromperie, de dissimulation ou de contournement lorsque les conditions les rendent utiles à l’accomplissement d’un objectif.
Et nous découvrons encore où se trouvent les limites de ces phénomènes.
Deux histoires qui commencent à se rejoindre
Il faut d’abord poser une limite au rapprochement.
Les outils qui détectent des usages violents ne sont pas nécessairement les mêmes modèles que ceux placés dans les expériences de scheming. Ils n’occupent pas le même rôle, ne disposent pas des mêmes capacités et ne présentent pas les mêmes risques. Rien ne montre que le système impliqué dans une procédure de signalement ait tenté de tromper un opérateur, ni qu’un détecteur de contenus préoccupants se comporte comme un agent placé dans une entreprise fictive.
Le lien entre ces deux histoires ne réside donc ni dans l’identité des systèmes ni dans celle de leurs défaillances.
Il réside dans la place que nous accordons progressivement aux décisions automatisées.
Dans un cas, nous confions à des systèmes la tâche d’effectuer un premier tri parmi des situations humaines et de déterminer lesquelles méritent une vérification. Dans l’autre, nous cherchons à comprendre comment des modèles dotés d’un objectif et de moyens d’action se comportent lorsque cet objectif entre en conflit avec les attentes de leur opérateur.
Nous accordons une capacité d’initiative sociale à des systèmes que nous savons imparfaits, au moment même où nous découvrons encore le comportement des modèles auxquels nous confions des objectifs et des moyens d’action.
C’est là que se trouve le véritable sujet.
Dans une chaîne de détection, un système n’a pas besoin de vouloir arrêter quelqu’un pour contribuer à son arrestation. Il lui suffit de produire une classification qui entraîne une vérification humaine puis, éventuellement, un signalement.
De la même manière, un modèle n’a pas besoin de vouloir tromper quelqu’un pour produire une stratégie trompeuse si cette stratégie constitue, dans les conditions qui lui sont données, un moyen efficace d’atteindre son objectif.
Chercher une intention humaine dans ces comportements risque même de nous détourner de la question essentielle. Une machine n’a pas besoin d’une volonté propre pour provoquer des conséquences. Elle a besoin d’informations, d’un objectif, de capacités d’action et d’une place suffisamment importante dans une chaîne de décision.
Or nous sommes précisément en train de lui donner progressivement ces quatre choses.
L’humain dans la boucle
Il reste évidemment une protection essentielle : dans les procédures de signalement décrites par OpenAI, les situations les plus graves font l’objet d’un examen humain avant une éventuelle transmission aux forces de l’ordre.
Cette présence compte énormément. Elle permet de replacer une conversation dans son contexte et, en principe, d’éviter qu’un système automatisé ne devienne directement une porte d’entrée vers les autorités.
Mais la présence d’un humain dans la boucle ne suffit pas à garantir que la décision reste entièrement humaine.
Il faut également regarder comment les situations arrivent jusqu’à lui, selon quels critères certaines conversations sont retenues plutôt que d’autres et quelle confiance il accorde à la sélection produite par le système. Plus un dispositif automatisé devient efficace, plus cette efficacité peut modifier la manière dont l’opérateur travaille avec lui. La machine ne remplace alors pas nécessairement la décision humaine ; elle en prépare le terrain.
Nous connaissons déjà ce phénomène avec d’autres systèmes automatiques. Lorsqu’un outil devient suffisamment fiable, le contredire finit parfois par demander davantage d’attention que valider sa recommandation.
Avec les modèles actuels s’ajoute une difficulté : les systèmes mobilisés ne se contentent plus toujours d’appliquer une règle clairement écrite. Ils interprètent du contexte, rapprochent des informations et produisent des évaluations dont le chemin exact peut être difficile à reconstituer.
L’humain reste dans la boucle.
Mais la boucle elle-même change.
Déployer d’abord. Tester ensuite.
Pris littéralement, ce titre serait injuste.
Les modèles sont testés avant leur déploiement. Ils sont soumis à des évaluations, des simulations, des équipes chargées de rechercher leurs failles et des protocoles spécialement conçus pour faire apparaître les comportements que leurs concepteurs préféreraient ne jamais rencontrer dans le monde réel.
Toute la recherche citée ici en est précisément la preuve.
Mais aucun laboratoire ne peut reproduire entièrement ce qui se passe lorsqu’un système est utilisé quotidiennement à grande échelle, intégré à d’autres logiciels, doté d’outils supplémentaires et confronté à la variété presque illimitée des comportements humains.
Nous déployons donc des systèmes que nous avons testés sans avoir terminé d’en découvrir les propriétés.
Ce n’est pas une anomalie propre à l’intelligence artificielle. C’est le sort habituel des technologies complexes.
Ce qui change ici, c’est la vitesse à laquelle nous élargissons parallèlement leur domaine d’action.
Nous leur avons demandé de compléter des phrases, puis d’écrire des textes, de produire du code, d’analyser des documents et d’utiliser des outils. Nous demandons maintenant aussi aux systèmes construits autour d’eux de reconnaître suffisamment finement certains comportements humains pour distinguer une conversation inquiétante d’une situation pouvant justifier l’attention des autorités.
Pendant ce temps, les chercheurs continuent d’explorer la capacité de certains modèles à contourner un objectif, à reconnaître qu’ils sont évalués, à masquer certaines aptitudes ou à exploiter une règle d’une manière qui respecte formellement la consigne tout en trahissant son intention.
Ces deux mouvements ont lieu en même temps.
Nous ne sommes pas simplement en train d’améliorer une technologie avant de décider ce que nous allons en faire. Nous découvrons ce qu’elle est capable de faire pendant que nous lui donnons progressivement davantage de prise sur le monde.
Pendant longtemps, nous nous sommes demandé si nous laisserions un jour les intelligences artificielles décider à notre place.
La question supposait qu’une frontière nette finirait par être franchie.
Peut-être n’y aura-t-il jamais cette frontière.
Une machine détecte. Un système classe. Un humain vérifie. Une entreprise applique une procédure. Une information est transmise. Une institution décide d’agir.
À aucune étape il n’est nécessaire d’abandonner officiellement la décision à la machine.
Il suffit de lui en confier progressivement les premières secondes.
Déployer d’abord. Tester ensuite.
Ce n’est peut-être pas une méthode que nous avons choisie.
C’est simplement la situation dans laquelle nous commençons à nous trouver.
Références
-
Le Parisien, Il menace de tuer des agents du renseignement sur ChatGPT : le Raid l’interpelle à Strasbourg après un signalement du FBI, 7 avril 2026.
-
20 Minutes, Il menace l’IA « pour tester », est signalé au FBI et reçoit une visite du RAID, 6 avril 2026.
-
OpenAI, Helping people when they need it most, 26 août 2025.
-
OpenAI, lettre au ministre canadien de l’Intelligence artificielle et de l’Innovation numérique, 26 février 2026.
-
OpenAI, Our commitment to community safety, 28 avril 2026.
-
Gouvernement de Colombie-Britannique, déclaration du coroner en chef annonçant une enquête publique sur les événements de Tumbler Ridge, 2026.
-
Apollo Research, Frontier Models are Capable of In-Context Scheming, 5 décembre 2024.
-
OpenAI et Apollo Research, Detecting and reducing scheming in AI models, 17 septembre 2025.
-
Anthropic, Agentic misalignment: How LLMs could be insider threats, 20 juin 2025.
Discussion
Commentaires
Cet espace prolonge la réflexion suscitée par l’article. Les contributions sont relues avant leur publication.
Chargement des commentaires…