Claude Opus 5.5, lancé par Anthropic le 22 septembre, ne produit presque plus de tiret cadratin. L’agence Graphite en relève 0,015 pour 1 000 mots, contre 2,92 chez Opus 5, soit environ un tiret tous les 67 000 mots, la longueur d’un roman court. Ce taux est désormais très inférieur à celui des articles humains d’avant ChatGPT.
Arize en a trouvé deux dans 57 000 mots de sortie.
Il y a un an encore, une rafale de tirets cadratins suffisait à soupçonner un texte d’avoir été écrit par ChatGPT ou Claude. La Revue Politique et Parlementaire en faisait la signature la plus reconnaissable de la famille. Graphite a étendu son étude à Opus 5.5 le 1er octobre, après une première version publiée le 16 septembre.
- Claude Opus 5.5 produit 99% moins de tirets cadratins qu’Opus 5, réduisant le marqueur le plus reconnaissable de l’IA.
- Les phrases se raccourcissent de 12,14 à 10,03 mots en moyenne, mais les réponses s’allongent à 481 mots.
- D’autres tics subsistent : les cadragescorrectifs, les négations rhétoriques et les verdicts annoncés restent surreprésentés.
Trois mesures, un même verdict
Les chiffres varient d’une étude à l’autre, parce que les corpus ne sont pas les mêmes. Arena, qui compare Opus 5 et Opus 5.5, passe de 15,2 à 0,8 tiret pour 1 000 mots, soit 95 % de moins. Arize descend de 12,9 à 0,05, une chute de 99,6 %. Le point-virgule suit la même pente chez Arena, de 6,10 à 1,64 pour 1 000 mots.
Les phrases raccourcissent aussi, de 12,14 à 10,03 mots en moyenne. Anthropic décrit des réponses plus naturelles, plus claires, avec un meilleur respect des consignes d’écriture.
Des phrases plus courtes ne font pas un texte plus court. Selon Arena, la réponse moyenne passe de 453 à 481 mots, ce qui fait d’Opus 5.5 le plus bavard des Opus mesurés. Les témoignages clients publiés par Anthropic évoquent, eux, des réponses 40 % moins verbeuses sur leurs propres évaluations.
Les autres tics, eux, résistent
Graphite a recensé 2 548 tournures surreprésentées chez Opus 5.5, contre 2 666 chez Opus 5 et 3 746 chez Opus 4. Entre les deux dernières versions, la baisse n’est que de 4 %.
Le score d’Opus 5.5 est de 10,57, contre 16,75 pour Opus 5.
Chaque texte reçoit une note de 0 à 100 sur sa prose maniérée, et la baisse atteint 37 %. Les articles humains obtiennent 6,65 en moyenne, si bien qu’Opus 5.5 reste 1,6 fois au-dessus, contre 1,2 fois pour Astra, un autre modèle testé. La divergence de Jensen-Shannon, premier indicateur de l’étude, passe de 0,064 à 0,052. Plus sa valeur est basse, plus la répartition des mots du modèle ressemble à celle des auteurs humains.
La ponctuation n’est qu’une partie du problème. Graphite met en avant le cadrage correctif, du type « pas simplement X », plus de 100 fois plus fréquent chez Astra que dans l’écriture humaine du corpus. La Revue Politique pointait déjà chez Claude la phrase qui s’ouvre par une négation pour atterrir sur une affirmation.
Arize, qui compte ce qu’elle appelle les « Claudisms », passe de 4,79 à 2,38 pour 1 000 mots. Les verdicts annoncés du genre « la réponse honnête est » reculent de 65 %, les contrastes du genre « ce n’est pas X, c’est Y » de 56 %.
Relire autrement
Un détecteur amateur fondé sur deux ou trois mots est déjà obsolète.
À la rentrée, les soupçons d’écriture par IA autour du roman de Thélyson Orélien ont été nourris par l’outil Pangram. De leur côté, certains auteurs remplacent leurs tirets par des virgules, des parenthèses ou des deux-points, de peur d’être soupçonnés. Pour relire un texte, mieux vaut repérer les négations rhétoriques et les verdicts annoncés que compter les tirets.
Arena le rappelle : la ponctuation seule ne prouve ni l’auteur ni la qualité d’un texte. Anthropic assure en outre qu’Opus 5.5 suit de plus près les consignes d’écriture, ce qui laisse à un utilisateur la possibilité d’orienter le style du modèle.
Sources : clubic.com | fr.headtopics.com

