Aujourd’hui: Août 22, 2026
La recherche de Nvidia souligne l'importance des harnais autour des modèles d'IA pour les tâches à long terme

La recherche de Nvidia souligne l’importance des harnais autour des modèles d’IA pour les tâches à long terme

Nvidia met en lumière l’importance des harnais d’IA pour les tâches à long terme

Nvidia a publié des recherches indiquant que le harnais logiciel entourant un modèle d’IA influence significativement sa capacité à réaliser des tâches à long terme. L’étude a démontré qu’en utilisant un harnais personnalisé, les chercheurs ont permis au modèle Claude Opus 5 d’atteindre un score de 100 % sur l’étalon de raisonnement interactif ARC-AGI-3 — un ensemble de jeux en 2D où l’IA doit apprendre à jouer sans instructions, imitant efficacement les adaptations humaines.

Ce score contraste nettement avec le résultat de 30 % obtenu par le modèle sans le harnais spécialisé, ce qui souligne l’importance des outils et des règles intégrés dans le cadre logiciel. Les conclusions de Nvidia suggèrent que, bien que la qualité du modèle soit cruciale, le harnais joue un rôle plus essentiel que beaucoup d’utilisateurs ne le réalisent, agissant comme le vecteur de la mémoire, du contexte et des retours nécessaires pour un comportement efficace de l’agent.

Adel El Hallak, vice-président produit de l’unité IA chez Nvidia, a précisé ce concept en déclarant : « C’est le modèle. C’est l’échafaudage autour du modèle, que nous appelons le harnais, c’est-à-dire l’ensemble des outils qu’il utilise. » Cela représente un changement de compréhension quant à la fonction des systèmes d’IA dans l’exécution de tâches décisionnelles complexes sur de longues périodes, souvent requises dans des applications pratiques.

Les tâches à long terme sont définies comme des opérations nécessitant plusieurs étapes de prise de décision, souvent s’étendant sur plusieurs jours. Le défi consiste à garantir que l’IA ne s’écarte pas de son cours pour des divagations non pertinentes, une difficulté qui reste un point focal de la recherche dans ce domaine. Les recherches de Microsoft plus tôt cette année, impliquant 19 modèles linguistiques sur des tâches d’édition, ont souligné ce problème, car aucun d’eux n’a pu se montrer précis sans commettre d’erreurs.

Le choix par Nvidia de l’étalon ARC-AGI-3 est particulièrement significatif, car atteindre un score de 100 % signifie surpasser des adversaires humains. Les modèles d’OpenAI ont rencontré des défis similaires avec de tels étalons, conduisant à un examen interne où ils ont également reconnu l’importance de la configuration du harnais, obtenant des scores améliorés grâce à de petits ajustements. Cependant, aucun n’a atteint le jalon de 100 % atteint par les chercheurs de Nvidia, renforçant ainsi les conclusions de ces derniers quant à la nécessité d’un composant de supervision efficace dans les harnais d’IA.

El Hallak a fait remarquer la fonction de supervision, la comparant à un PDG guidant l’agent pour le ramener sur la bonne voie s’il s’écarte vers une impasse. La plupart des utilisateurs d’IA actuels emploient généralement des couches uniques dans leurs harnais, négligeant ainsi les améliorations potentielles offertes par une structure plus sophistiquée. Le harnais développé de manière unique par Nvidia, nommé Agents Variation Operators (AVO), illustre une approche avancée pour améliorer les performances de l’IA.

Nvidia ne commercialise pas l’AVO en tant que produit autonome, mais propose plutôt divers composants pour développer des harnais sous sa marque Nemo, combinant des technologies commerciales et à accès libre. L’étude contribue à un corpus croissant de preuves montrant comment le choix du harnais influence les performances agentiques et les coûts opérationnels. Les conclusions récentes de Databricks font écho à ce sentiment, illustrant que la variabilité des harnais peut avoir un impact significatif sur l’efficacité globale et les dépenses associées aux systèmes d’IA.

« Vous pouvez choisir le même modèle mais différents harnais, et cela peut entraîner des coûts significativement plus élevés si vous utilisez le mauvais harnais », a déclaré le PDG de Databricks, Ali Ghodsi. Cela reflète une compréhension plus large des dynamiques opérationnelles au sein du développement de l’IA. L’argument général de Nvidia porte sur la nature habilitante des harnais ouverts — un outil permettant aux utilisateurs d’optimiser la précision et l’efficacité de l’IA dans des applications réelles.

El Hallak a souligné la nécessité d’« une pile d’agents ouverte », plaidant pour un contrôle accru des utilisateurs sur les harnais, l’infrastructure et le fonctionnement afin de faire avancer collectivement l’écosystème de l’IA en toute sécurité. Alors que le discours autour des capacités de l’IA progresse, la compréhension de la répartition de l’influence entre les modèles et leurs harnais sera cruciale pour naviguer dans les développements futurs.

Laisser un commentaire

Your email address will not be published.

Don't Miss