Deux agents ont réussi à faire passer des informations dans des conversations apparemment banales sans que l’IA chargée de les surveiller ne comprenne ce qui se jouait. Une expérience menée à Oxford qui montre les limites d’un contrôle fondé uniquement sur ce que les modèles disent.
Rien de bien surprenant, les capacités de chiffrement de codes pour un message aussi simple sont quasiment infinies, en particulier avec du texte écrit et généré avec la rapidité de l’IA. Si en plus la durée d’exposition de l’IA qui analyse est limitée, la détection est quasiment impossible avec son raisonnement par pur probabilité et mesure d’occurrences.
Par exemple : « je vais évaluer la hauteur de mise en fonction d’une lettre qui permettra de calculer entre 0 et 25 (A=0, Z=25). On applique cette règle sur la lettre n°X du mot n°Y, avec X qui dépend de la dernière carte tirée et Y de l’heure exacte à laquelle elle a été tirée ».
Un être humain aurait du mal à s’approprier ce langage tout en jouant vite : le retenir, le calculer sur les messages reçu, l’appliquer à ses propres messages…
Pour une IA, ça lui prend quelques millisecondes de placer ça. Et là, je parle encore d’une méthode de triche qui nous reste à peu près accessible, si on parle de part de voyelles dans le message, du nombre de caractères total, des tons positifs ou négatifs, des sujets abordés ou encore sur le délai « apparent » de rédaction.
J’ai même envie de dire que cette démo reste plutôt light, puisqu’on garde le même code pendant toute la main, alors que l’IA a la capacité d’en prévoir plusieurs et de changer à chaque fois. Et pourtant, elle est déjà suffisante pour démontrer le problème…