Anthropic explique le marquage des textes générés par IA en conformité avec la loi européenne sur l’IA
Anthropic a publié un article de blog présentant son approche du marquage des textes générés par son chatbot IA, Claude, suite à son annonce plus tôt cette semaine concernant l’implémentation de cette fonctionnalité pour se conformer au Code de Transparence de la loi européenne sur l’intelligence artificielle. Ce règlement impose aux entreprises d’IA de disposer de systèmes permettant d’identifier le contenu généré par IA.
L’entreprise s’attend à une réaction variée de la part des utilisateurs, certains exprimant des préoccupations concernant la vie privée et l’intégrité des textes générés. Sur des plateformes comme Reddit, des utilisateurs ont caractérisé l’initiative de marquage comme une conspiration contre les utilisateurs, tandis que d’autres ont affirmé que la motivation derrière l’opposition au marquage pourrait s’apparenter à une tromperie. Des rapports indiquent que “dizaines” d’utilisateurs ont même annulé leurs abonnements à Claude en réaction à ces changements.
Dans son blog, Anthropic explique que le marquage repose sur un concept où Claude crée un motif dans ses réponses qui reste indétectable pour les lecteurs humains mais peut être identifié à l’aide d’une clé spécifique. L’entreprise affirme que ce marquage n compromet pas la qualité du texte produit, soutenant qu’une réponse marquée est indiscernable d’une réponse sans marquage.
Pour mettre en œuvre le marquage, Anthropic prévoit d’utiliser la méthode SynthID-Text développée par Google DeepMind et introduira également une API de détection de marquage. L’entreprise souligne que ce système diffère des techniques de détection de l’IA qui recherchent des motifs d’écriture spécifiques pour identifier le contenu généré par l’IA, affirmant que reconnaître ces motifs est fondamentalement différent de la vérification d’un marquage.
Une préoccupation majeure parmi les utilisateurs concerne la possibilité de réécrire ou d’éditer un texte pour enlever le marquage. Anthropic reconnaît que des modifications légères pourraient ne pas éliminer complètement le marquage, tandis qu’une réécriture complète nécessitant une altération significative du texte le ferait. Cependant, l’entreprise prévient que si un texte est entièrement réécrit, sa classification comme contenu généré par IA pourrait être contestée.
L’efficacité du marquage sur les textes légèrement modifiés dépend également de l’étendue des modifications apportées. Anthropic indique que si Claude n’a effectué que des modifications légères, la majeure partie de l’écriture sera attribuée à l’auteur humain, laissant peu de place au marquage pour subsister.
En matière de génération de code, le marquage devrait être moins prononcé que dans d’autres types de textes car le modèle IA exige des résultats précis plutôt que plusieurs options interchangeables. Cependant, dans les cas où des choix arbitraires sont présents — comme les commentaires dans le code —, le marquage peut encore être appliqué, bien qu’il n’impacte que minimalement la fonctionnalité du code produit.
Anthropic note que Claude ne sera pas le seul chatbot IA à mettre en œuvre le marquage, d’autres développeurs de modèles leaders ayant également promis de respecter le même Code de Pratique et étant attendus pour introduire des systèmes similaires.