Intelligence artificielle · Actualité

Un détecteur d'IA a déclenché un scandale littéraire en France et a conduit à une enquête qui a révélé des plagiats dans des textes antérieurs.

Le monde littéraire français a été secoué par un scandale lié à l'intelligence artificielle. L'auteur haïtiano-canadien Thélyson Orélien a vu son roman retiré de la liste des finalistes du Prix Goncourt, le prix littéraire le plus prestigieux de France, le vendredi dernier, peu après qu'un compte anonyme sur X ait affirmé qu'il avait été écrit « presque entièrement par intelligence artificielle ».

C’était ça ou mourir (qui pourrait se traduire par C'était ça ou mourir) raconte le voyage dangereux d'un Haïtien vers le Canada en passant par le Brésil, le Mexique et les États-Unis. Le roman a figuré en tête des listes de best-sellers en France début septembre après sa publication en août et a vendu environ 35 000 exemplaires. Lundi dernier, il a remporté un autre prix français, le Prix Fnac du Roman, et a reçu des critiques très favorables.

Orélien, 38 ans, a immigré au Canada en 2010 après le séisme dévastateur qui a ravagé Haïti. Il nie avoir utilisé l'IA pour écrire son œuvre.

Pangram, utilisé pour formuler les accusations, a été qualifié de « référence standard » des détecteurs d'IA. L'Académie Goncourt, qui supervise le prix éponyme, a retiré le livre de sa liste de finalistes en raison des « résultats systématiques des analyses menées par des chercheurs et des journalistes de renom » suggérant que l'œuvre était, « très probablement, en grande partie le produit de l'intelligence artificielle ».

L'éditeur français d'Orélien a affirmé que ce dernier a commencé à écrire le roman en 2017 et a terminé un brouillon en 2019, bien avant que l'IA générative ne soit disponible sur le marché. Dans un communiqué la semaine dernière, Orélien, qui est noir, a affirmé avoir été victime de « nombreuses attaques racistes » et que « [il] est actuellement en train de constituer un dossier avec [ses] éditeurs en France et au Québec pour prouver [ses] affirmations ».

Samuel Fitoussi, chroniqueur du journal conservateur Le Figaro qui s'est autodefini comme « assez de droite », a admis faire partie du « projet collectif » derrière le compte X. Cependant, l'auteur de Woke Fiction nie toute motivation politique et affirme défendre « le pacte moral qui unit un auteur à ses lecteurs » et « sensibiliser à l'écriture générée par l'IA ».

À la suite des accusations concernant l'IA, le journal québécois La Presse a publié des allégations de plagiat dans des articles et des chroniques d'opinion écrits par Orélien entre 2012 et 2013. Cela a été suivi d'une enquête de Radio-Canada, qui a révélé que « au moins cinq » des chroniques et articles d'opinion de Orélien avaient été partiellement copiés de textes d'autres auteurs.

La Presse a également découvert, via Pangram, que la nouvelle d'Orélien, Où va le monde, primée en 2012, contenait « au moins quatre phrases identiques » à celles du livre de Louis Pauwels de 1960, Le matin des magiciens (1960). La Presse a contacté Orélien, mais celui-ci n'a pas répondu.

Le scandale met non seulement en lumière la fiabilité de ce type de détecteurs, mais remet également en question nos attentes envers les écrivains. Certains auteurs français soutiennent que l'IA fait déjà partie de nos vies et que l'attribution de l'œuvre est en évolution.

Textes dans des langues autres que l'anglais et détection par IA

Orélien a déclaré : « Les images, les répétitions, les rythmes sont un langage vivant, ils sont à moi. Mes traditions sont haïtiennes et caribéennes ».

Un français non standard et très oral pourrait-il amener Pangram à commettre une erreur ?

Pour vérifier cette possibilité, l'expert français en IA Benoît Raphaël a soumis deux chapitres de deux, puis de quatre, romans haïtiens à Pangram. Ils ont tous été correctement identifiés comme créés par des humains.

Ensuite, Raphaël a introduit un échantillon de la poésie, de la prose courte et des écrits critiques d'Orélien publiés avant 2023, époque où l'IA générative n'était pas encore suffisamment développée pour produire ce type de texte. Ceux-ci ont également été identifiés comme créés par des humains.

Raphaël a affirmé qu'avant l'explosion de ce scandale, il avait écrit à un autre expert en IA pour lui exprimer ses soupçons que le roman d'Orélien avait été écrit avec l'aide de l'intelligence artificielle. Il avait détecté les signes révélateurs de la prose générée par IA, notamment la dépendance excessive à certaines constructions rhétoriques.

Jusqu'à quel point les détecteurs d'IA sont-ils fiables ?

Les études ont démontré que Pangram est très précis dans la détection de l'usage de l'IA, avec un taux de détection réussi supérieur à 95 % et pratiquement aucun faux positif. Pourtant, cela se produit.

Il a été utilisé pour formuler des accusations contre d'autres œuvres littéraires récentes, y compris celles de Jamir Nazir, qui a été officiellement acquitté. Nazir, un écrivain trinidien d'origine indienne, a expliqué au jury que son processus d'écriture consistait à utiliser des outils de conversion de la voix en texte, suivis d'une édition exhaustive, en raison de ses problèmes de santé chroniques.

Est-il acceptable que les auteurs utilisent l'IA ?

En la télévision française, l'auteure Virginie Despentes, dont les romans incluent Vernon Subutex 1, a rejeté la semaine dernière l'idée que les auteurs doivent rendre des comptes pour l'utilisation de l'IA. « Thélyson Orélien n'a pas à se justifier […] Cela n'a rien à voir avec nous. Il écrit comme il l'entend. Que le Pangram aille se faire voir ».

Despentes a apprécié les phrases courtes de l'œuvre, ses métaphores puissantes et son caractère épisodique, qu'elle considère comme des traits typiques de l'écriture contemporaine. Raphaël Doan, cocréateur d'une histoire alternative de 2023 écrite ouvertement avec ChatGPT, a partagé l'écran avec Despentes. Malgré le déni de Orélien, Doan a affirmé qu'il croyait que l'auteur avait utilisé l'intelligence artificielle, citant le style formuliste propre à l'IA de son roman, les images triviales et une intrigue dépourvue de continuité, passant d'une scène à l'autre (l'IA a du mal à maintenir un récit convaincant en prose sur des centaines de pages).

Alexandre Gefen, éditeur de la Histoire culturelle de l'IA, a comparé Orélien à un artiste de la Renaissance remplissant son atelier avec d'autres artistes travaillant sous ses ordres. L'auteur, a-t-il dit, a toujours évolué avec les technologies d'écriture.

Le succès commercial du roman de Orélien démontre qu'il a réussi à créer une voix authentique qui captive les lecteurs. S'il a utilisé l'IA pour cela, il est impossible de penser que cela se soit produit sans une intense série d'indications et de réajustements.

Peut-être, dans cette ère de l'IA, la manière dont les écrivains l'utilisent deviendra-t-elle une compétence qui peut être employée bien ou mal. La littérature de haute qualité inclura l'utilisation ingénieuse de cette nouvelle technologie d'écriture, tandis que la mauvaise littérature se caractérisera par un usage paresseux ou peu original.

Cependant, beaucoup de lecteurs chérissent un pacte implicite avec l'auteur, en quête d'une rencontre intime avec une subjectivité humaine différente. La critique littéraire remet depuis longtemps cela en question, surtout depuis la révélation classique concernant les nombreuses mains ayant contribué à l'écriture des œuvres de certains de nos auteurs romantiques les plus vénérés, comme l'épouse de William Wordsworth, Dorothy Wordsworth.

De même qu'on pourrait penser que ces auteurs devraient également reconnaître l'apport d'autres personnes à leur œuvre, il est raisonnable de demander aux auteurs qui utilisent l'IA de le révéler. Ainsi, les lecteurs auront la possibilité de participer à ce nouveau jeu ou de choisir de ne pas le faire.

Cet article a été publié à l'origine sur The Conversation.