Aujourd’hui: Sep 10, 2026
Anthropic souligne les attaques de distillation menées par des entreprises d'IA chinoises ciblant des modèles américains

Anthropic souligne les attaques de distillation menées par des entreprises d’IA chinoises ciblant des modèles américains

Détails sur les attaques de distillation par des entreprises d’IA chinoises

Un nouveau rapport publié par Anthropic dénonce des attaques de distillation persistantes menées par des entreprises d’intelligence artificielle basées en Chine, qui ont augmenté ces derniers mois à mesure que la concurrence dans ce domaine s’intensifie. Le rapport souligne que des laboratoires non autorisés ont mis au point des méthodes de plus en plus sophistiquées pour contourner les défenses et extraire des capacités précieuses des modèles de pointe américains.

Le rapport met en lumière que les campagnes observées par Anthropic visaient des fonctionnalités clés de leur modèle d’IA, Claude, notamment ses capacités de raisonnement et ses compétences en matière de programmation. « Au cours des derniers mois, des laboratoires non autorisés ont développé des méthodes de plus en plus sophistiquées pour contourner nos défenses et récolter les capacités des modèles de pointe américains », indique le rapport. L’entreprise a enregistré près de 200 millions d’échanges liés à ces attaques de distillation à travers cinq campagnes distinctes.

Les attaques de distillation visent à extraire les processus de raisonnement sous-jacents derrière les réponses d’un modèle à divers prompts. Cette méthode peut former des modèles plus petits à reproduire un raisonnement général grâce à un affinement supervisé. Anthropic limite généralement l’accès au raisonnement interne de ses modèles, fournissant aux utilisateurs des blocs de pensée résumés à la place. Cependant, les attaques ont réussi à identifier des techniques capables de susciter des traces de raisonnement plus détaillées.

Dans un cas notable, un attaquant a trompé le modèle en formulant sa requête comme une demande de traduction, demandant à Claude de traduire sa mémoire en japonais précis. Le volume le plus important de ces attaques provenait d’une campagne attribuée à Alibaba, caractérisée comme l’effort de distillation en gros le plus important observé par Anthropic. Entre mai et juillet 2026, cette campagne a représenté 151 millions d’échanges, atteignant un pic quotidien de près de trois millions de requêtes, toutes connectées par un prompt partagé visant à recueillir des données d’entraînement pour les modèles Qwen d’Alibaba.

De plus, une autre campagne liée à Moonshot AI, le développeur de Kimi, aurait redirigé des requêtes avec des connexions à l’armée chinoise. Une demande spécifique concernait l’évaluation de vidéos de surveillance par circuit fermé pour évaluer des comportements inhabituels. Anthropic a noté que, durant une période de 10 jours, environ 300 000 requêtes ont été dirigées vers Claude depuis un réseau de 5 000 comptes, ciblant principalement le modèle Opus de l’entreprise.

Ce rapport sert non seulement de compte rendu des menaces à la sécurité en cours, mais souligne également les complexités et les défis auxquels sont confrontés les développeurs d’IA alors qu’ils naviguent dans la concurrence et protègent leurs innovations contre les menaces extérieures.

Laisser un commentaire

Your email address will not be published.