Aujourd’hui: Août 29, 2026
Un chercheur d'Anthropic présente le potentiel des systèmes d'IA auto-améliorants dans une nouvelle étude

Un chercheur d’Anthropic présente le potentiel des systèmes d’IA auto-améliorants dans une nouvelle étude

Des modèles d’IA formés par d’autres systèmes d’IA : une nouvelle approche

Anthropic a publié un nouvel article intitulé « Les chercheurs automatisés peuvent atténuer de manière fiable les échecs d’alignement », décrivant comment les systèmes d’IA peuvent améliorer leur performance sur des benchmarks d’alignement grâce à des méthodes d’entraînement automatisées. L’étude démontre le potentiel des systèmes automatisés à corriger dix comportements mal alignés spécifiques, réalisant des performances supérieures sans impact négatif sur l’efficacité globale.

Dirigée par le chercheur d’Anthropic Chen Yueh-Han, la recherche imite les méthodologies de recherche traditionnelles. Les systèmes automatisés effectuent des recherches bibliographiques, proposent des stratégies et forment le modèle pendant une durée de 30 minutes tout en augmentant progressivement les normes des benchmarks au cours de plusieurs itérations. Les stratégies efficaces sont conservées, tandis que celles moins performantes sont écartées, permettant une capacité opérationnelle rapide à grande échelle.

L’article déclare : « Dans l’ensemble, ces résultats fournissent des preuves préliminaires que l’alignement automatisé post-formation pourrait devenir pratique à court terme. » Cette recherche est considérée comme une étape vers l’atteinte de l’auto-amélioration récursive en IA, ce qui pourrait considérablement améliorer les pratiques d’entraînement. Si les modèles d’IA peuvent affiner leurs propres processus d’alignement, le rôle des chercheurs humains en IA pourrait faire face à des défis significatifs.

Dans une analyse comparative, l’étude met en évidence l’efficacité du Chercheur d’Alignement Automatisé (AAR) par rapport à la recherche humaine. Elle affirme : « La meilleure méthode AAR dépasse ce que les humains expérimentés proposent, en moyenne en six heures, » indiquant que la recherche dirigée par des humains ne parvient pas à obtenir de meilleures performances. De plus, l’analyse des coûts montre que l’AAR opère à environ 4 $ de l’heure, contre un tarif de 150 $ de l’heure pour les chercheurs humains.

Malgré ces avancées, la recherche identifie des limites dans l’approche automatisée. La performance de ces systèmes dépend fortement de la précision des benchmarks reflétant les véritables objectifs d’alignement. De plus, un travail considérable reste à réaliser pour établir et maintenir ces benchmarks, ainsi que pour développer davantage la littérature dont les chercheurs automatisés tirent leurs insights.

Laisser un commentaire

Your email address will not be published.

Don't Miss