Une accusation virale qui a explosé en quelques heures
Le 21 septembre 2026, le jour même où Thélyson Orélien recevait le prix du roman Fnac pour C'était ça ou mourir, un compte X baptisé « Balance ton Claude » publie une capture d'écran présentée comme accablante. Le compte affirme avoir soumis plusieurs extraits du roman, publié chez Grasset, au logiciel Pangram, et obtenu presque systématiquement un score de 100 % IA. Le message est vu près de trois millions de fois selon l'Opinion, et le nombre d'abonnés du compte passe en 24 heures de moins de 100 à plusieurs milliers, d'après franceinfo.
Le roman, en lice pour le Goncourt, le Renaudot, le Femina, le Médicis et le prix Décembre, et déjà en cours de traduction dans plus de vingt langues, devient en quelques heures le centre d'une polémique nationale. Grasset dénonce « une campagne de haine » et suggère qu'elle pourrait viser un auteur venant de recevoir une reconnaissance majeure. Interrogé par Libération, Thélyson Orélien répond : « J'ai toujours aimé la création et l'écriture, je ne vois pas pourquoi je ferais appel à une machine. » Il indique constituer un dossier avec ses éditeurs pour prouver qu'il est l'auteur de son texte.
Pangram, un détecteur devenu référence en quelques années
Pangram, d'abord nommé Checkfor.ai, a été rendu public en 2023 par Max Spero et Bradley Emi, deux ingénieurs diplômés de Stanford passés par Tesla et Google. L'entreprise revendique un taux de précision de 99,7 % sur ses échantillons générés par IA et se présente comme le détecteur reconnu le plus fiable par des chercheurs indépendants, citant les universités du Maryland et de Chicago.
Selon les informations recueillies par Reuters et rapportées par l'Opinion, Pangram s'appuie sur une méthode dite de « synthetic mirroring » : le système part de textes humains, demande à des modèles de langage d'en produire des versions proches, puis entraîne un classificateur à distinguer les deux catégories. Une technique complémentaire, le « hard negative mining », consiste à réintroduire dans l'entraînement des textes humains précédemment mal classés, afin de réduire les faux positifs. Selon ses fondateurs, la quatrième version du logiciel affiche un taux de faux positifs de 0,0041 % en anglais, soit environ un texte humain mal classé sur 24 000, et de 0,0026 % en français.
Une fiabilité relative, même selon ses propres créateurs
Deux études indépendantes récentes confirment la position de Pangram en tête du marché : l'une publiée en septembre 2025 par l'université de Chicago, l'autre en juin 2026 par la Vrije Universiteit de Bruxelles. Toutes deux le classent devant GPTZero, OriginalityAI et RoBERTa, avec un taux de faux positifs proche de zéro. Mais Max Spero lui-même a nuancé cette fiabilité dans un entretien accordé à The Atlantic en mai 2026, en affirmant que son outil ne devait « jamais être l'arbitre final », mais plutôt un point de départ pour une enquête plus approfondie. Selon Numerama, qui cite une interview donnée à Wired, le cofondateur reconnaît également que l'outil est moins performant sur les textes de moins de 100 mots, et qu'un même passage peut recevoir des résultats différents selon qu'il est analysé isolément ou dans un contexte plus large.
Ce que révèle la contre-enquête de franceinfo
L'émission Le vrai du faux de franceinfo a reproduit le test sur des extraits variés du roman, dialogues, descriptions, passages mêlant français, anglais et espagnol. Dans tous les cas, la version gratuite de Pangram a renvoyé un score de 100 % IA. Un extrait soumis à GPT-Zero, jugé moins fiable que Pangram par les chercheurs, a obtenu un score plus prudent de 87 % de probabilité IA.
Pour évaluer la cohérence de l'outil, franceinfo a ensuite soumis à Pangram deux textes antérieurs de Thélyson Orélien, écrits avant l'apparition des IA génératives : un livre publié en 2015 chez Broché et un article publié en 2014 dans le Huffington Post. Les deux ont été classés à 100 % comme écrits par un humain. Franceinfo a enfin testé des extraits de quatre autres romans de la rentrée littéraire, aux styles variés.
| Auteur | Éditeur | Résultat Pangram |
|---|---|---|
| Ananda Devi | Grasset | 100 % humain |
| Philippe Jaenada | Flammarion | 99 % humain |
| Amélie Nothomb | Albin Michel | 100 % humain |
| Lucie Rico | POL | 100 % humain |
Franceinfo souligne toutefois que ces quatre tests, réalisés sur un échantillon restreint, ne constituent pas une preuve irréfutable concernant le roman de Thélyson Orélien. Comme le résume le média, « le seul à détenir la vérité, c'est lui ».
Le piège du calcul de probabilité
Sur X, plusieurs internautes ont tenté de transformer le score de Pangram en preuve mathématique, en multipliant le taux de faux positifs annoncé (0,0041 %) par le nombre de passages testés, une vingtaine selon Numerama. Le résultat obtenu, présenté comme quasi certain, est en réalité un calcul erroné. Les extraits analysés appartiennent au même livre, écrits par le même auteur, et partagent donc potentiellement les mêmes caractéristiques stylistiques. Si Pangram est sensible à une tournure récurrente chez Thélyson Orélien, il produira logiquement des résultats similaires sur plusieurs passages, sans que cela multiplie la certitude statistique. Numerama précise cependant que ces observations corrélées ne sont pas dénuées de sens : elles indiquent au minimum que le texte présente des caractéristiques que Pangram associe fortement à une rédaction par IA, sans pour autant trancher la question.
Pourquoi la détection reste un pari statistique
Thierry Poibeau, directeur de recherche au CNRS et spécialiste du traitement automatique des langues, explique que ces outils « recherchent des régularités » : tournures ternaires, tirets cadratins, vocabulaire prévisible, des « tics de langage » hérités de corpus d'entraînement composés en grande partie de textes scientifiques ou romanesques américains. Il pointe deux limites structurelles. D'abord, un « problème de cible mouvante » : les modèles d'IA évoluent en permanence et se rapprochent toujours davantage du langage naturel, ce qui oblige les détecteurs à courir derrière une cible qui change. Ensuite, une ambiguïté de fond pour la littérature : « L'outil peut relever dans l'écriture quelque chose de particulier, quelque chose de répétitif, mais c'est peut-être ça qui fait le style d'un écrivain. »
BFMTV rapporte les mêmes mécaniques techniques : mesure de la perplexité, c'est-à-dire le degré d'imprévisibilité du mot suivant, et mesure de la variation de longueur et de complexité des phrases, les IA ayant tendance à une régularité que l'écriture humaine dément plus souvent. Une étude citée par BFMTV, menée par Proton, souligne un biais supplémentaire : « le fait que les humains écrivent souvent naturellement comme une IA », en particulier lorsque la langue utilisée n'est pas leur langue maternelle. Une étude de Stanford, citée par Numerama, a également montré que plusieurs détecteurs identifient plus souvent comme générés par IA des textes écrits par des auteurs non anglophones, ce qui interroge directement sur l'écriture créolisée revendiquée par Thélyson Orélien.
| Étude | Date | Constat principal |
|---|---|---|
| Université de Chicago | Septembre 2025 | Pangram classé détecteur le plus fiable, devant GPTZero, OriginalityAI et RoBERTa |
| Vrije Universiteit Bruxelles | Juin 2026 | Confirme le classement de Pangram, taux de faux positifs proche de zéro |
| Université Stanford | Non précisée | Biais des détecteurs envers les auteurs non anglophones |
Ce que cette affaire change pour les professionnels francophones
Pour un éditeur, un service de communication ou un service conformité en France, l'enseignement principal de cette affaire n'est pas que Pangram serait inutile, mais qu'un score de détection ne constitue jamais une preuve juridique ou factuelle opposable. Un score « 100 % IA » peut coexister avec une réalité inverse, comme le montre le test de franceinfo sur des textes de 2014 et 2015 écrits avant l'apparition des IA génératives et pourtant susceptibles, en théorie, d'obtenir un score erroné sur un autre échantillon. À l'inverse, un texte réellement généré ou assisté par IA, une fois retravaillé manuellement, échappe souvent à la détection, comme le rappelle l'étude Proton citée par BFMTV.
Les professionnels qui manipulent des modèles de langage au quotidien, rédaction, service juridique, ressources humaines, ont donc intérêt à documenter leurs propres usages plutôt que de s'appuyer sur des outils tiers probabilistes pour se défendre ou accuser. Des plateformes françaises comme Moon AI, qui donne accès à plus de 70 modèles sous un abonnement unique et héberge son infrastructure chez OVHcloud à Strasbourg et Roubaix, permettent à un professionnel de comparer plusieurs modèles pour un même usage, mais ce type d'accès ne remplace pas une trace d'usage documentée en interne : historique de prompts, versions de brouillons, horodatage des étapes de rédaction. C'est cette traçabilité technique, et non un score externe, qui constitue une preuve opposable en cas de contestation.
Questions fréquentes
Un score Pangram de 100 % IA constitue-t-il une preuve ?
Non. Même l'entreprise qui édite l'outil reconnaît, par la voix de son cofondateur Max Spero, que Pangram ne doit « jamais être l'arbitre final » mais servir de point de départ à une enquête plus poussée. Un score élevé signale une ressemblance statistique avec des textes générés par IA, pas une certitude.
Pourquoi Pangram est-il considéré comme plus fiable que d'autres détecteurs ?
Deux études indépendantes, l'une de l'université de Chicago en septembre 2025, l'autre de la Vrije Universiteit de Bruxelles en juin 2026, le classent devant GPTZero, OriginalityAI et RoBERTa, avec un taux de faux positifs proche de zéro. Ce classement ne signifie pas pour autant une fiabilité absolue, notamment sur les textes courts ou les styles atypiques.
Pourquoi le style d'un auteur peut-il être confondu avec une écriture générée par IA ?
Selon Thierry Poibeau, chercheur au CNRS, les détecteurs repèrent des régularités stylistiques, tournures répétées, structures particulières, qui peuvent aussi être la marque du style propre d'un écrivain. Une étude de Stanford montre par ailleurs que les auteurs non anglophones sont plus souvent mal classés par ces outils.
Comment un professionnel peut-il se protéger d'une accusation de ce type ?
En documentant son propre processus de travail plutôt qu'en s'appuyant sur un score externe : conservation des versions successives d'un texte, horodatage, historique des échanges avec les outils utilisés. Ces éléments constituent une preuve traçable, contrairement à un pourcentage produit par un détecteur probabiliste.