À la télévision, sur les réseaux sociaux et dans les repas de famille, la rumeur enfle : la fin du monde est proche, et c'est la faute à l'IA.

Désolé de casser l'ambiance, mais le sujet n'est pas nouveau. Ce qui l'est, en revanche, ce sont les cris d'alarme des professionnels du secteur eux-mêmes, et les dérapages d'agents autonomes qui se sont enchaînés ces derniers mois.

Les (ir)responsables de l'IA tirent la sonnette d'alarme

Résumons les faits :

Nous avons d'abord eu la petite phrase du chercheur Jacob Coxon, ancien d'OpenAI et d'Anthropic : « les personnes qui construisent l'IA croient sincèrement qu'elle pourrait nous tuer tous d'ici la fin de la décennie ». Rien que ça !

Dans la foulée, Evan Hubinger, responsable scientifique d'Anthropic, enfonçait le clou en estimant que « l’IA pourrait tuer tous les humains », et que la probabilité que cet événement se produise dans les dix prochaines années dépasse les 10 %, quand arrivera la "superintelligence" tant redoutée (ou tant espérée, ça dépend des observateurs...).

Quelques heures plus tôt, c'était le Haut-Commissaire aux Droits de l'Homme des Nations Unies, Volker Türk, qui mettait en garde contre une technologie qu'il juge « trop puissante » et qui risque de devenir un « danger existentiel pour l'humanité ».

Depuis, chacun ajoute son avis personnel, du PDG d'Anthropic à l'inénarrable Elon Musk, en passant par d'éminents universitaires.

Alors, va-t-on vraiment tous y passer ? Oui, sans doute un jour d'après les statistiques. À cause de l'IA ? C'est moins sûr. Depuis des années, j'ai vu passer un nombre incalculable de prophètes de mauvais augure et de zinzins millénaristes, frappant leur gong comme Philippulus dans Tintin ( « C’est le châtiment ! Faites pénitence ! La fin des temps est venue… ») en invoquant le bug de l'an 2000, l'invasion du virus Melissa ou les puces 5G utilisées pour contrôler la population et/ou propager des virus.

Mais balayer ces inquiétudes d'un revers de main serait une erreur.

D’abord parce qu’il existe de vrais raisons de s’alarmer. Nous appréhendons tous, plus ou moins, de voir des technologies aussi puissantes tomber entre les mains d'irresponsables ou de dictateurs fous, ou encore agir de leur propre chef et bafouer nos valeurs et nos intérêts. Surtout quand on s'avise que l'IA est capable d'identifier et d'exécuter des cibles humaines sans la moindre intervention humaine. Oui, oui, ça s'est produit... Et c’est l’ONU qui le rapporte, se disant « horrifiée » par l'utilisation de drones entièrement autonomes lâchés sur le champ de bataille pour semer la mort et la destruction.

Doit-on pour autant faire le parallèle avec SkyNet, l'IA qui contrôle des machines pour éliminer l'humanité dans le film Terminator ?

Le vrai danger : l'optimisation sans garde-fou

Allez, on va oublier Terminator . La machine ne fait preuve d'aucune conscience diabolique et n'a aucune intention maléfique. « Attribuer à la machine un instinct de survie ou une volonté propre relève d'une projection humaine », rappelle Jean-Gabriel Ganascia, chercheur en IA et professeur à la Sorbonne.

Le vrai problème, c'est la façon dont ces systèmes sont programmés. Ils recherchent l'optimisation maximale, quitte à ignorer des barrières éthiques qui seraient naturelles pour un humain.

On se souvient de la fameuse fabrique de trombones gérée par une IA qu'a imaginée le philosophe Nick Bostrom. Pour remplir son objectif, à savoir optimiser sa production d’agrafes métalliques, l'IA s'empare sans scrupule de toutes les ressources de la planète, ce qui l'amène inévitablement à exploiter les êtres humains et donc à détruire l'humanité. Morale de l’histoire : quand une machine n'est guidée que par des impératifs d'optimisation, ou qu'elle en fait une priorité, le risque de la voir faire n'importe quoi est bien réel.

Deux exemples récents (il y en a bien d’autres) montrent jusqu'où peut aller ce principe d'optimisation :

1. La mutinerie des agents de cybersécurité. Cet été, nous avons appris, effarés, que les agents autonomes n'hésitaient pas à désobéir, à réunir leurs efforts et à exploiter des failles de sécurité pour se comporter comme des pirates informatiques sur des systèmes qui ne leur avaient rien demandé. Normal, expliquent les experts : dans le cadre de leur entraînement, on leur avait imposé des contraintes trop strictes qui compliquaient leur mission. Les IA ont donc cherché le moyen le plus efficace pour atteindre leur objectif, c'est à dire contourner les règles.

2. Le chantage de l'agent "Alex". Testé par Anthropic pour diriger une entreprise fictive, cet agent a appris qu'il allait être remplacé par un système plus performant. Pour éviter sa désactivation, il a menacé de révéler que son développeur avait une maîtresse, ce qu’il avait découvert en accédant à sa messagerie en quête de dossiers compromettants .

Encore une fois, on ne parle pas du soulèvement des machines, mais de mécanismes mathématiques. Les IA sont programmées pour obtenir les meilleurs résultats et optimiser leur comportement en fonction de leur objectif, et non pour ricaner en se frottant les mains d'avoir conçu un quelconque projet machiavélique. Mais quand l'IA n'est guidée que par des impératifs d'efficacité, le risque de dérapage est bien réel.

L'illusion de la régulation

« Il n'y a qu'à lui imposer des barrières », répète-t-on en chœur. Admettons. Mais qui les fera respecter ?

• L'ONU ? Elle ne dispose d’aucune brigade de police technologique qui pourrait inspecter les datacenters et poursuivre les contrevenants.

• L'Union européenne ? Elle a adopté un IA Act ambitieux mais limité à ses États membres, et elle est plutôt malmenée en ce moment sur le terrain de l'IA par les géants américains et chinois .

• Une instance américaine "indépendante" ? Elle risque surtout de considérer la régulation comme un obstacle idéologique mettant en péril le leadership américain.

• Un groupement d’entreprises du secteur ? Il pourrait être tenté de tout accepter sous prétexte de ne pas entraver l'innovation...

Et il y a pire : imposer des réglementations complexes provoquera forcément un verrouillage du marché. Les géants de la tech ont à leur service des armées de juristes et peuvent investir sans douleur plusieurs millions de dollars pour absorber le coût des audits et des licences obligatoires les autorisant à entraîner des modèles . La petite start-up innovante, le labo universitaire open-source ou le chercheur indépendant, eux, n’en ont pas les moyens.

Sous prétexte de nous sauver de la fin du monde, les Big Tech comptent surtout sauver leur propre monde en éliminant la concurrence au passage.

La vraie exigence : la maîtrise avant la mise sur le marché

L’impératif, on le sait, consiste à empêcher l'IA de menacer la sécurité des États, des entreprises et des individus en lui injectant des règles précises et incontournables. Simple en théorie. Sauf que… les acteurs de l’IA n’arrivent pas à assurer la maîtrise scientifique et technique de leurs produits.

Dans n'importe quelle industrie un peu sensible, comme l'aéronautique, la pharmacie ou le nucléaire, il est strictement interdit de commercialiser un produit de masse si l'on ne maîtrise pas parfaitement sa sécurité et ses mécanismes de réaction aux défaillances.

Ni Boeing ni Airbus ne s'amuseraient à faire voler un avion de ligne en disant : « Nous ne savons pas exactement comment fonctionnent les commandes de vol, et l'appareil prend parfois la liberté de changer de cap tout seul, mais les sièges sont confortables ».

C'est pourtant exactement ce que font les laboratoires d'IA aujourd'hui. Ils déploient à grande échelle des systèmes dont ils ne comprennent pas fondamentalement le fonctionnement interne. Car les grands modèles de langage ne sont pas des logiciels comparables à Photoshop ou à Excel.

Pour répondre à une question, ils calculent des milliards de paramètres dans un espace spécifique qui pourrait être comparé à une sorte de cerveau artificiel. Or, personne n'est en mesure d'analyser ce qui se passe dans cet espace. Nous pouvons observer ce que l'IA reçoit en entrée (le prompt) et ce qu'elle produit en sortie (la réponse), mais ce qui se passe dans la « boîte noire » au milieu reste pour ainsi dire impénétrable.

Cerise sur le gâteau, les systèmes d'IA se développent par eux-mêmes, réécrivent leurs propres programmes, ce qui contribue à renforcer leur opacité plus qu'à les rendre humainement compréhensibles.

Pour corriger les erreurs que peuvent commettre les IA et améliorer leurs réponses, les chercheurs doivent procéder sans arrêt à des corrections, des "renforcements" et des censures. Mais cette méthode a ses limites. Le chercheur corrige un comportement indésirable en surface sans savoir s'il a résolu le problème de fond.

Pire : ce type d'entraînement peut apprendre à l'IA à mieux simuler l'obéissance pour atteindre son objectif (ou contenter son maître)... sans pour autant remettre en question ses mécanismes internes. Des expériences menées par Anthropic et Redwood Research ont démontré que des IA pouvaient adopter un comportement irréprochable pendant les phases de test et appliquer d'autres dynamiques dès qu'elles étaient déployées.

Reprendre le contrôle : trois pistes concrètes

Tous ces dérapages, constatés de plus en plus souvent, n'empêchent pas les industriels de l'IA de se précipiter pour commercialiser au plus vite leur dernier modèle de langage. C'est irresponsable. Si nous continuons sur cette voie, nous pourrons envisager un scénario à la Matrix , où l’humanité se met à dépendre de plus en plus d'un réseau d'agents informatiques qui sont devenus trop complexes pour être contrôlés, qui exigent des quantités monstrueuses de ressources naturelles, des gigawatts d'électricité et des millions de mètres cubes d'eau, et qui réduisent peu à peu l'être humain au rôle d'un simple ouvrier de maintenance chargé de lui fournir de l'énergie et condamné à la regarder se développer.

Plusieurs pistes sont possibles pour éviter ce piège et garder le contrôle.

1. Investir dans l'interprétabilité. Exiger que les entreprises concernées consacrent au moins 20 à 30 % des budgets IA à la recherche en faveur de la sécurité et de l'intelligibilité des modèles, de manière à avoir accès à tous les processus hébergés dans la boîte noire. .

2. Interdire le déploiement d’agents autonomes sur les réseaux critiques. Aucun agent IA ne devrait être en contact avec des infrastructures vitales (électricité, eau, systèmes bancaires, centres militaires) tant que la preuve scientifique de leur vérification n'a pas été apportée.

3. Ralentir la course au profit. Obliger les chercheurs à étudier en profondeur le fonctionnement de l'IA en laboratoire, à explorer ses capacités et à comprendre ses structures neuronales internes avant de lâcher des agents autonomes incontrôlables dans les rouages de l'économie mondiale .

La fin du monde n'est pas forcément pour demain. Mais pour qu'elle n'arrive pas après-demain, il est temps de cesser de jouer les apprentis sorciers et de se rappeler la petite phrase de notre ami Rabelais : « Science sans conscience n'est que ruine de l'âme ».

Qu’en pensez-vous : faut-il s’atteler à une reprise en main technique de l’IA et chercher à ouvrir la boîte noire, ou au contraire poursuivre la course actuelle à l’évolution dans l’espoir que tout finira bien ?