Pangram promet de dire si un texte a été écrit par une intelligence artificielle avec une précision quasi parfaite. En réalité, il suffit de faire reformuler un texte humain par une IA, en changeant deux tiers des mots, pour que l’outil continue de l’attribuer à un humain. Le Journal du Net a fait reformuler cinq de ses articles par Claude Opus 5, jusqu’à changer deux tiers des mots : Pangram les attribue toujours à un humain. À l’inverse, un contenu généré from scratch par l’IA à partir des mêmes informations est repéré aussitôt.

Tout est parti d’un compte X aux abonnés peu nombreux. Ce compte a affirmé que Pangram avait conclu que l’histoire d’un migrant haïtien voyageant vers le Canada avait été largement écrite par un générateur de texte comme Claude ou ChatGPT. La cible : Thélyson Orélien, auteur québécois d’origine haïtienne, accusé d’avoir généré son roman “C’était ça ou mourir” avec de l’IA.

À retenir
  • Pangram classe un texte humain reformulé par une IA comme entièrement humain si deux tiers des mots sont changés.
  • Un même extrait du roman de Thélyson Orélien obtient des verdicts opposés selon l’outil de détection utilisé.
  • Les outils commerciaux comme Pangram atteignent des taux de fiabilité quasi nuls sur les longs textes mais échouent sur les passages courts.
  • Le cofondateur de Pangram lui-même reconnaît que son outil ne devrait jamais être l’arbitre final d’une accusation.

Un roman primé, une accusation qui ne retombe pas

Thélyson Orélien, auteur québécois d’origine haïtienne en lice pour plusieurs prix avec son premier roman, est ouvertement accusé depuis le 21 septembre d’avoir écrit son livre grâce à une intelligence artificielle. L’écrivain se défend avec des mots simples. Il nie les allégations et affirme qu’il prouvera avoir écrit le livre, vendu à des éditeurs dans plus de 20 pays, disant : “Je n’ai pas écrit ce roman avec ma tête, mais avec mes tripes et mon cœur.”

L’AFP a voulu vérifier par elle-même. Elle a fait passer des extraits du livre par différents outils de détection d’IA et a obtenu des résultats très variés, allant de “très probablement” écrit par un humain à “100% généré par IA”. Un même texte, deux verdicts opposés selon l’outil interrogé. C’est peu dire que la fiabilité de ces logiciels mérite d’être interrogée.

Comment on trompe Pangram en quelques minutes

Le Journal du Net a soumis l’outil à l’épreuve du feu. Plus d’une centaine de textes lui ont été soumis, et Pangram reconnaît presque toujours humains et machines, mais se laisse facilement berner. La faille est simple à exploiter : il suffit de faire repasser un texte par une IA chargée de le reformuler, sans le générer de zéro.

Le mécanisme inverse fonctionne tout aussi bien. Un texte humain retouché par une IA reste classé humain. un roman entièrement rédigé par une personne, puis simplement “poli” ou reformulé par un assistant conversationnel, passera l’examen sans encombre. Le problème ne vient pas d’un bug isolé, mais d’une confusion de fond sur ce que l’outil est réellement capable de mesurer.

Pangram donne une idée très générale et assez générique pour savoir si un texte est généré avec de l’IA, en identifiant des marqueurs statistiquement plausibles. Le hic, c’est l’usage qu’on en fait aujourd’hui. Il sert désormais à trancher sur un texte précis, un article ou un roman, avec une certitude qu’il ne peut pas offrir.

Ce que dit la recherche académique

Une étude de l’université de Chicago, publiée en octobre 2025, nuance pourtant ce tableau. Les outils commerciaux de détection d’IA surpassent nettement les alternatives open source, Pangram atteignant des taux d’erreur quasi nuls, alors que les options open source classent à tort jusqu’à 78% de textes humains comme générés par IA. Sur le papier, l’outil serait donc l’un des plus fiables du marché.

Mais tout dépend du contexte et de la longueur du texte analysé. Parmi les options commerciales, Pangram atteint des taux de faux positifs et de faux négatifs quasiment nuls sur des passages de longueur moyenne à longue, mais ces taux augmentent légèrement sur les textes courts, même s’ils restent bien en dessous des seuils raisonnables. Un roman de 300 pages n’a donc rien à voir, en matière de fiabilité de détection, avec un court essai de candidature.

D’autres affaires récentes illustrent les limites de l’outil. En mars 2026, la polémique autour du roman “Shy Girl” de Mia Ballard a suivi le même schéma. Pangram a contribué à cette controverse : Spero, le patron de l’entreprise, a indiqué que le détecteur classait 78% du livre comme généré par IA. Les conséquences ont été concrètes. L’auteure a nié avoir personnellement utilisé l’IA, attribuant tout usage éventuel à son éditeur, mais Hachette a arrêté l’édition britannique et annulé la publication américaine prévue.

Même l’entreprise reconnaît les limites de son outil

Fait révélateur : le cofondateur de Pangram lui-même appelle à la prudence. Max Spero avait souligné auprès du média américain The Atlantic que son outil ne devrait “jamais être l’arbitre final”, mais plutôt un point de départ pour enquêter. Une nuance de taille, souvent oubliée par ceux qui brandissent un score Pangram comme une preuve irréfutable.

Le chercheur du CNRS Thierry Poibeau apporte un éclairage technique bienvenu. Il explique que les programmes recherchent des “tics linguistiques”, citant l’exemple classique de la formulation triadique (l’usage de trois propositions) ou des tirets cadratins. Ces signes révélateurs étaient autrefois fréquents dans les textes générés car les outils avaient été entraînés sur de l’écriture scientifique américaine ou des romans américains. Un style d’écriture qui imite mal ces schémas, ou qui s’en éloigne volontairement, passe alors sous le radar.

Le Wall Street Journal n’a pas mâché ses mots face à la multiplication de ces affaires, qualifiant l’outil de “machine à diffamation” dans un article publié en avril 2026. La formule est sévère, mais elle pointe un vrai risque : un score de probabilité, présenté sans nuance, peut détruire la réputation d’un auteur en quelques heures. Reste une question simple, que la littérature devra trancher elle-même : combien de manuscrits humains, un jour retouchés par une IA pour la forme, seront encore jugés suspects sur la seule foi d’un pourcentage ?

Notez ce post