Une étude révèle des habitudes distinctives dans la prose générée par l’IA
Une étude récente menée par la société de marketing Graphite met en évidence les habitudes distinctives de l’écriture générée par l’IA, révélant comment les modèles s’appuient sur des phrases et des structures spécifiques dans leur prose. Les chercheurs ont examiné les schémas d’écriture à travers divers modèles d’IA, identifiant plus de 13 000 phrases qui apparaissaient significativement plus fréquemment dans le contenu généré par l’IA par rapport à l’écriture humaine.
Selon l’analyse de Graphite, bien que certains anciens signes révélateurs, comme l’utilisation des tirets em, aient été atténués, les modèles d’IA présentent toujours des caractéristiques uniques. Par exemple, Claude Opus 5.5 utilise de manière prédominante le mot “fiable”, apparaissant 23 fois plus souvent dans son écriture que dans des échantillons humains. Notamment, ce modèle tend à formuler les déclarations sous la forme “plus qu’un X, c’est un Y.” La phrase “cela compte” a été notée pour apparaître 116 fois plus fréquemment que dans l’écriture humaine.
Un autre modèle, Astra d’OpenAI, démontre ses propres constructions distinctives. Ce modèle décrit souvent “une autre dimension” d’un sujet et a tendance à nuancer ses affirmations, utilisant des constructions telles que “peut fournir” ou “peut permettre.” L’étude révèle que l’utilisation par Astra de ce que Graphite appelle “le cadrage correctif” se produit plus de 100 fois plus fréquemment par rapport au texte généré par des humains.
La recherche de Graphite a employé un design soigneusement élaboré, utilisant un groupe de contrôle de 10 000 articles générés par des humains publiés avant la sortie de ChatGPT. En faisant réécrire ces articles par des modèles d’IA, les chercheurs cherchaient à minimiser le biais de source et à comparer la fréquence de mots et de phrases spécifiques entre l’écriture humaine et celle de l’IA.
Malgré l’évolution des styles d’écriture, la présence de signes identifiables persiste. Greg Druck, responsable de l’IA chez Graphite, a souligné que bien que les modèles soient devenus plus habiles à éviter les signes bien connus de l’écriture par IA, de nouveaux continuent d’émerger. Par exemple, il a noté que tandis que Claude Opus 5.5 utilise des tirets em 99 % moins que son prédécesseur, il conserve néanmoins d’autres habitudes identifiables.
Cette persistance des traits d’écriture distinctifs survient dans un contexte où les développeurs d’IA revendiquent des améliorations en matière de communication naturelle. Par exemple, Anthropic a affirmé qu’Opus 5.5 est plus naturel que les modèles précédents, tandis qu’OpenAI a souligné une clarté améliorée et moins de tournures de phrases étranges dans leurs versions GPT-6. Néanmoins, Druck reste sceptique quant à la mesure dans laquelle les laboratoires peuvent éliminer complètement ces constructions révélatrices, suggérant que la complexité de ces grands modèles peut intrinsèquement conduire à des erreurs de jugement.
Les résultats de cette étude soulignent le défi continu de différencier le contenu généré par l’IA de l’écriture humaine. À mesure que l’IA continue d’évoluer, les chercheurs et les développeurs doivent équilibrer les avancées en fluidité d’écriture avec la nécessité d’aborder les marqueurs persistants qui identifient la prose générée par machine.