
L’intelligence artificielle accompagne depuis longtemps la commande des robots. L’apprentissage profond et les modèles vision-langage-action ouvrent aujourd’hui de nouvelles possibilités, mais posent un défi central : adapter les comportements sans compromettre les garanties de stabilité, de robustesse et de performance.
L’IA aux commandes, une histoire déjà ancienne
L’application de l’IA aux boucles de commande des systèmes robotiques n’est pas récente. L’IA symbolique intervient notamment dans la planification et la supervision. L’apprentissage de paramètres, de modèles, de formes ou de cartes facilite, quant à lui, l’élaboration des lois de commande.
Ces méthodes sont particulièrement utiles lorsque la construction d’un modèle du système est difficile, faute de données, en raison de sa variabilité ou de la complexité de sa dynamique. Elles permettent notamment des commandes « orientées tâche », qui adaptent le comportement du robot à partir des informations extraites de ses capteurs.
L’IA contribue ainsi à l’analyse, à l’estimation, à l’identification, à la commande et au diagnostic de systèmes complexes, non linéaires, incertains ou évolutifs dans le temps. Elle peut simplifier l’élaboration de la commande et la rendre plus robuste et autonome.
Des flux de travail fondés sur l’IA agentique sont également étudiés pour rationaliser l’identification des paramètres de systèmes d’équations différentielles ordinaires complexes, en mobilisant la différenciation automatique et des méthodes d’optimisation avancées.
Une image en entrée, un comportement en sortie
L’apprentissage par renforcement profond a montré qu’il était possible d’apprendre des comportements à partir d’images de la scène, sans définir manuellement les espaces d’état.
Mais ces contrôleurs restent généralement difficiles à réutiliser pour d’autres tâches. Ils associent étroitement la perception des informations pertinentes et la prédiction de la performance des actions.
Leur généralisation constitue donc un axe de développement, notamment grâce aux modèles de fondation et à des environnements simulés qui diversifient les données d’apprentissage. Une piste consiste à pré-entraîner, dans un simulateur à faible fidélité, un espace d’actions latent relativement indépendant de la tâche, afin de faciliter ensuite l’apprentissage par renforcement en conditions réelles pour des applications complexes.
Voir, comprendre la consigne et agir
Les premiers usages des modèles de fondation en robotique ont exploité des modèles de vision et de langage existants, en tirant parti de l’apprentissage en contexte. Ils permettent de combiner des indications visuelles, tactiles, textuelles ou verbales pour préciser une tâche de manipulation ou de navigation.
Des bases de données spécialement consacrées à la robotique ont ensuite été constituées à partir de robots en fonctionnement et de démonstrations humaines. Elles permettent d’entraîner de bout en bout des modèles « vision-langage-action », ou VLA, qui associent perception et action. Ces modèles peuvent contribuer à définir les objectifs de planification, les récompenses, les coûts et les possibilités de contrôle. Ils visent une généralisation entre les tâches, les objets, les environnements et les instructions, avec moins de réentraînement spécifique.
Leur transposition entre robots de morphologies différentes reste toutefois difficile. L’enjeu ne consiste pas à imposer un format d’action unique, mais à transformer une représentation associant perception et langage en une commande adaptée au système physique concerné.
À quel étage placer l’intelligence ?
Une question centrale porte sur le niveau de perception et de contrôle auquel les VLA doivent intervenir. Ils peuvent s’appuyer sur des fonctions de contrôle de plus haut niveau, qui intègrent déjà les lois de coordination et les contraintes physiques du robot, ou sur des représentations conjointes de la perception et de l’action, telles que celles désignées par TEC.
L’ajout de contraintes pendant l’apprentissage permet également de concevoir des contrôleurs assortis de garanties de stabilité, de performance et de robustesse, tout en réduisant la quantité de données à collecter.
D’autres défis demeurent : représenter le temps, raisonner sur les événements, gérer leur caractère asynchrone et effectuer les calculs dans un délai imparti. L’explicabilité, la vérification, la validation des algorithmes et leur intégration à des calculateurs en temps réel restent, elles aussi, essentielles pour passer de l’apprentissage à la commande opérationnelle.
Lien vers la suite de notre dossier (article 3)