Les programmes d’intelligence artificielle générative, tels que ChatGPT, sont capables de créer des textes en quelques secondes. Cela a incité certains chercheurs à développer des logiciels capables de détecter les écrits produits par l’IA. Mais ces nouveaux outils ne sont pas sans défauts, comme le révèle une nouvelle étude.
Des scientifiques de l’Université de Stanford aux États-Unis ont étudié des outils de détection de textes générés par l’IA, en en testant sept. À cette fin, ils ont soumis 91 essais rédigés par des non-anglophones dans le cadre du test de compétence en anglais TOEFL (Test of English as a Foreign Language).
L’équipe de recherche a constaté que ces programmes identifiaient incorrectement ces textes comme étant produits par l’IA, plutôt que par des humains. L’un d’entre eux prétendait même que 98% de ces écrits étaient le produit de l’intelligence artificielle.
Étonnamment, ces outils de détection de textes générés par l’IA ont eu beaucoup plus de facilité à reconnaître les essais des élèves de huitième année aux États-Unis. Ils ont réussi à les identifier correctement dans 90% des cas, expliquent les chercheurs dans leur étude publiée dans la revue Patterns.
Ces résultats démontrent que les générateurs de textes IA ont un style très particulier. ChatGPT et d’autres outils d’IA générative ont tendance à produire des textes qui frôlent la perfection : ils ne contiennent aucune faute d’orthographe ou de grammaire. Mais ils sont assez basiques et ne contiennent pas de constructions grammaticales compliquées ou de mots plus inhabituels (termes formels, argot, etc.).
Les textes produits par l’IA donnent « l’illusion de la correction », selon Melissa Heikkilä, journaliste spécialisée dans les questions d’intelligence artificielle. « Les phrases [de ces grands modèles de langage] semblent correctes – elles utilisent les bons types de mots dans le bon ordre. Mais l’IA ne sait pas ce que cela signifie. Ces modèles fonctionnent en prédisant le mot suivant le plus probable dans une phrase. Ils n’ont aucune idée de ce qui est correct ou faux, et ils présentent avec confiance des informations comme étant vraies même si ce n’est pas le cas », écrit-elle dans le MIT Technology Review.
Les outils de détection de textes générés par l’IA ont été conçus pour reconnaître ces caractéristiques stylistiques. Ils s’appuient sur des algorithmes qui évaluent la complexité d’un texte en examinant, par exemple, les mots et les tournures de phrases utilisés. S’ils sont rudimentaires, le logiciel aura tendance à supposer que le texte est l’œuvre de l’IA, et non d’une personne avec un vocabulaire limité.
« Si vous utilisez des mots courants en anglais, les détecteurs donneront un score de perplexité faible, ce qui signifie que mon essai est susceptible d’être signalé comme étant généré par l’IA. Si vous utilisez des mots complexes et plus sophistiqués, il est alors plus probable qu’il soit classé comme étant écrit par un humain par les algorithmes », déclare James Zou, auteur principal de l’étude, de l’Université de Stanford, dans une déclaration.
En conséquence, le chercheur et ses collègues recommandent la prudence dans l’utilisation des logiciels de détection de textes générés par l’IA, en particulier dans les contextes éducatifs ou professionnels. Ces outils ne sont pas fiables à 100% et, surtout, peuvent être facilement trompés en modifiant quelques mots ou tournures de phrases.




