VLA — Vision-Language-Action : les modèles d'action robotique
Quand un modèle voit, comprend une instruction et commande directement les moteurs d'un robot
Les modèles Vision-Language-Action (VLA) sont la transposition des grands modèles de fondation au monde physique : à partir d'un flux caméra et d'une instruction en langage naturel, ils produisent directement des commandes motrices pour un robot. Apparu en 2023 avec RT-2 de Google DeepMind, le paradigme a explosé. En juin 2026, presque chaque grand laboratoire d'IA possède son modèle de fondation robotique, et des startups très financées — Physical Intelligence (π0 / π0.5), Figure (Helix) — courent pour devenir « l'OpenAI du physique ». Cette page situe les fondations historiques, l'état de l'art 2026 (Gemini Robotics, NVIDIA GR00T, MolmoAct, SmolVLA), les défis techniques (latence temps-réel, action chunking, exécution embarquée) et les limites encore profondes.

Trois générations : des fondations 2022-2024 à l'état de l'art 2026
Plongée technique : architecture, action chunking et latence temps-réel
Pourquoi piloter un corps en temps réel est radicalement plus dur que générer du texte
Un VLA n'est pas qu'un « LLM avec des bras ». Le passage du langage à l'action impose des contraintes physiques dures : le robot vit dans un monde continu, en temps réel, où une décision arrivant 200 ms trop tard fait échouer la tâche — ou casse quelque chose. Trois grands choix d'ingénierie structurent les modèles de 2026.
1. De la perception à l'action : tokens discrets vs flow matching
Les premiers VLA (RT-2, OpenVLA) discrétisaient les actions en tokens, exactement comme un LLM prédit des mots : l'espace continu des commandes (positions, vitesses) était découpé en intervalles, et le modèle prédisait le « token » correspondant. Simple à brancher sur un transformeur, mais cela produit des mouvements saccadés et gère mal les tâches de contact fin (saisir un objet fragile, plier du tissu).
Vidéo : comprendre les modèles VLA
Une présentation pédagogique (en anglais) des modèles Vision-Language-Action : ce qu'ils sont, leur architecture, et les travaux de référence du domaine.
Introduction aux modèles Vision-Language-Action : « des LLMs pour les robots » expliqué simplement, l'architecture des VLA et un survol des papiers clés du domaine.
Source : YouTube, janvier 2026 (en anglais)
Cas d'usage : où les VLA commencent à agir
Sources et ressources
- Wikipedia — Vision–language–action model (RT-1, RT-2, PaLM-E)
- Google DeepMind — RT-2 : translating vision and language into action
- OpenVLA — modèle open-source 7B (dépôt)
- Physical Intelligence — π0.5 : a VLA with Open-World Generalization
- Physical Intelligence — π0 : A VLA Flow Model (arXiv 2410.24164)
- Physical Intelligence — Real-Time Action Chunking (RTC)
- Figure AI — Helix : a VLA for Generalist Humanoid Control
- Google DeepMind — Gemini Robotics On-Device
- Google AI for Developers — Gemini Robotics-ER (Gemini API)
- NVIDIA — Isaac GR00T N1, premier modèle de fondation ouvert pour humanoïdes
- NVIDIA Isaac-GR00T (dépôt GitHub)
- Ai2 — MolmoAct : an Action Reasoning Model that reasons in 3D
- Hugging Face — SmolVLA : efficient VLA on LeRobot community data
- Open X-Embodiment — dataset cross-embodiment
- VLA Models: Concepts, Progress, Applications and Challenges (arXiv 2505.04769)
- VLA Models for Robotics: A Review Towards Real-World Applications (arXiv 2510.07077)