Enjeux techniques et humains de l'IA

Accueil/Outils Actuels/World Models : simuler des mondes interactifs

World Models : simuler des mondes interactifs

Genie 3, Waymo, Cosmos, World Labs — les modèles de monde de 2026

Un world model (modèle de monde) ne génère pas une vidéo : il génère un environnement explorable, image par image, qui répond en temps réel aux actions de l'utilisateur ou d'un agent. En 2026, la bascule est actée. Genie 3 de Google DeepMind, ouvert au public le 29 janvier 2026 via Project Genie, produit des mondes navigables en 720p à 24 fps avec une mémoire visuelle d'environ une minute. Waymo a bâti son simulateur de conduite autonome dessus, NVIDIA a publié Cosmos 3 pour la robotique, et World Labs (Fei-Fei Li) commercialise Marble. Cette page définit rigoureusement ce qu'est un modèle de monde, recense les acteurs réels de juin 2026 et examine leurs usages — entraînement d'agents, simulation, jeux génératifs — ainsi que leurs limites encore bien réelles.

Environnements interactifs
Temps réel
Genie 3 / Project Genie
Conduite autonome (Waymo)
Robotique (Cosmos 3)
Spatial intelligence
Entraînement d'agents
World models — environnements interactifs générés en temps réel
Qu'est-ce qu'un world model ? (vs un modèle vidéo)
Génération d'environnements interactifs : contrairement à un modèle vidéo qui produit un clip figé à partir d'un prompt, un world model génère un monde explorable où chaque image suivante dépend des actions de l'utilisateur (déplacement, regard, commandes).
Architecture auto-régressive : Genie 3 prédit l'image suivante à partir des images précédentes et de l'action reçue, ce qui lui permet de modéliser la causalité — un changement dans la scène se répercute de façon cohérente sur les images futures.
Temps réel et contrôlabilité : le monde se génère au fur et à mesure du déplacement (real-time generation), là où un modèle vidéo rend la totalité du clip en une passe non interactive.
Mémoire et cohérence spatiale : un world model doit maintenir la cohérence de l'environnement dans le temps. Genie 3 se souvient des objets laissés derrière soi pendant environ une minute, permettant de revenir sur ses pas.
Promptable world events : on peut modifier l'environnement en cours d'exploration par une commande textuelle (ajouter de la pluie, un objet, un personnage), ce qui n'a pas d'équivalent dans la génération vidéo classique.
Connaissance physique du monde : ces modèles intègrent une compréhension implicite de la physique et de l'espace 3D, ce qui les rend utilisables comme simulateurs pour entraîner des agents (robots, véhicules) plutôt que comme simples générateurs de contenu.

Modèle vidéo génératif ou modèle de monde : la distinction clé

Modèle vidéo (Veo, Sora, Kling…)
Génère un clip vidéo complet à partir d'un prompt texte ou d'une image. La sortie est un rendu fixe, non navigable, produit en une passe.
Avantages
Haute fidélité visuelle, 4K et audio synchronisé, durées multi-plans, idéal pour la production de contenu créatif
Limitations
Non interactif : impossible de naviguer, d'agir ou de modifier la scène en cours de lecture ; pas de notion d'action ni de causalité contrôlée par l'utilisateur
Perspective
Outil de création de contenu — le spectateur regarde, il n'agit pas
World model (Genie 3, Cosmos 3, Marble…)
Génère un environnement explorable image par image, en réponse aux actions reçues. La sortie est un monde dans lequel on se déplace et que l'on modifie en temps réel.
Avantages
Interactivité temps réel, modélisation de la causalité, promptable world events, mémoire spatiale, utilisable comme simulateur d'entraînement pour des agents
Limitations
Résolution et durée plus modestes (720p / 24 fps / quelques minutes pour Genie 3), espace d'actions encore restreint, coût de calcul élevé
Perspective
Simulateur et terrain d'entraînement — l'utilisateur ou l'agent agit et le monde réagit

Genie 3 et Project Genie : l'ouverture au public

Specs réelles, fonctionnalités et limites annoncées par Google DeepMind

Genie 3 est présenté par Google DeepMind comme un foundation world model généraliste. Annoncé en août 2025 en research preview (accès limité à une petite cohorte d'universitaires et de créateurs), il a franchi un cap le 29 janvier 2026 avec le lancement de Project Genie, un prototype expérimental ouvert aux abonnés Google AI Ultra aux États-Unis (18 ans et plus), avec une extension à d'autres territoires annoncée « en temps voulu ».

Spécifications techniques réelles

Genie 3 génère des mondes navigables en 720p à 24 images par seconde. Il supporte plusieurs minutes d'interaction continue (contre 10 à 20 secondes pour les prototypes antérieurs comme Genie 2), avec une mémoire visuelle d'environ une minute : le modèle se souvient des objets laissés dans l'environnement et permet d'y revenir, garantissant une cohérence spatiale sur cet horizon. Son architecture est auto-régressive : chaque image est prédite à partir des images précédentes et de l'action reçue, ce qui lui permet de modéliser la causalité. Faire tourner Genie 3 reste très coûteux en calcul.

Les acteurs réels des world models en 2026
Modèles vérifiés à juin 2026 : généralistes, robotique/conduite, intelligence spatiale et jeux génératifs
Modèles généralistes et plateformes
Google DeepMind Genie 3 / Project Genie
Foundation world model généraliste
Mondes navigables 720p / 24 fps, mémoire visuelle ~1 min, promptable world events. Ouvert au public le 29 janvier 2026 via Project Genie (World Sketching / Exploration / Remixing).
Project Genie : abonnement Google AI Ultra (US)
Voir Google DeepMind Genie 3 / Project Genie
World Labs — Marble (Fei-Fei Li)
Intelligence spatiale, mondes 3D éditables
Lancé en novembre 2025, Marble transforme texte, photos, vidéos ou panoramas en environnements 3D éditables et téléchargeables, compatibles VR (Vision Pro, Quest 3). Orienté création, staging de scènes et contrôle caméra.
Produit commercial (offres en ligne)
Voir World Labs — Marble (Fei-Fei Li)
Robotique et conduite autonome (physical AI)
NVIDIA Cosmos 3
World foundation model ouvert pour physical AI
Annoncé au COMPUTEX (1er juin 2026). Architecture mixture-of-transformers combinant raisonnement visuel, génération de monde et prédiction d'action. Entraîné sur 20 000 milliards de tokens multimodaux. Variantes Super / Nano / Edge pour la génération de données synthétiques et l'entraînement de robots et véhicules.
Modèle ouvert (open weights)
Voir NVIDIA Cosmos 3
Waymo World Model
Simulateur de conduite autonome (sur Genie 3)
Dévoilé le 6 février 2026, bâti sur Genie 3. Génère caméra + lidar cohérents dans le temps pour simuler des scénarios rares (tornade, inondation, obstacles inhabituels) et entraîner le Waymo Driver, qui a parcouru près de 200 millions de miles autonomes réels et des milliards en simulation.
Interne Waymo (non commercialisé)
Voir Waymo World Model
Jeux génératifs et mondes temps réel
Decart — Oasis 2.0
Monde interactif temps réel (jeu génératif)
Modèle video-to-video temps réel (MirageLSD) transformant un monde de jeu à la volée : biomes, météo, époques modifiables par commande texte ou vocale. Illustration grand public de l'interactivité temps réel d'un world model.
Mod Minecraft / démo en ligne
Voir Decart — Oasis 2.0
NVIDIA Cosmos Coalition
Coalition d'acteurs open world models
Collaboration mondiale autour des modèles de monde ouverts, avec des membres fondateurs comme LTX, Runway, Black Forest Labs, Skild AI, Agile Robots et Generalist, visant l'interopérabilité entre constructeurs de world models.
Collaboration ouverte
Voir NVIDIA Cosmos Coalition

Cas d'usage des modèles de monde

Entraînement d'agents robotiques
NVIDIA Cosmos 3 génère des données synthétiques et des environnements simulés pour entraîner les politiques de contrôle de robots, réduisant les cycles d'entraînement et d'évaluation de plusieurs mois à quelques jours.
Accélération du développement en robotique
Simulation pour la conduite autonome
Le Waymo World Model simule des scénarios rares (long-tail) — tornades, inondations, obstacles improbables — quasi impossibles à capturer à grande échelle dans la réalité, en produisant caméra et lidar cohérents.
Sécurité accrue avant déploiement routier
Jeux et mondes génératifs
Oasis 2.0 de Decart génère un monde de jeu jouable image par image, où chaque action modifie l'environnement, sans moteur de jeu traditionnel. Project Genie permet de créer et explorer ses propres mondes.
Nouvelle forme de contenu interactif
Création 3D et intelligence spatiale
Marble (World Labs) transforme prompts, photos ou panoramas en environnements 3D éditables et téléchargeables, utilisables pour le staging de scènes, le contrôle caméra et la VR.
Production d'assets 3D accélérée
Formation et simulation immersive
Des environnements interactifs générés à la demande permettent de créer des scénarios de formation variés (situations dangereuses, environnements coûteux à reproduire) explorables en temps réel.
Apprentissage par la mise en situation
Boucle d'entraînement pour agents généralistes
DeepMind teste Genie 3 comme terrain d'entraînement pour des agents (ex. SIMA), l'idée à terme étant une « boucle d'entraînement » où des agents apprennent dans des mondes générés à l'infini.
Voie vers des agents plus généralistes
Ce que les world models apportent
Interactivité temps réel
Génération du monde au fil des actions de l'utilisateur ou de l'agent, avec modélisation de la causalité — une rupture par rapport à la vidéo générative non interactive.
Simulation de scénarios rares
Capacité à générer des situations long-tail (catastrophes, événements improbables) difficiles ou dangereuses à reproduire dans le monde réel, précieuses pour la robotique et l'AV.
Données synthétiques à grande échelle
Production massive de données d'entraînement (images, vidéo, lidar, actions) pour les systèmes de physical AI, réduisant la dépendance aux collectes réelles coûteuses.
Édition par le langage
Promptable world events et remixing : on façonne et modifie l'environnement par de simples commandes textuelles, en cours d'exploration.
Limites et défis (juin 2026)
Espace d'actions restreint
La gamme d'actions directement réalisables par les agents reste limitée, et les interactions multi-agents complexes sont un défi de recherche non résolu.
Cohérence long terme
La mémoire et la cohérence sont bornées (≈1 minute pour Genie 3) ; les sessions sont courtes (60 s pour Project Genie) et la tenue sur plusieurs heures n'est pas supportée.
Précision géographique et réalisme
Impossible de reproduire des lieux réels avec une exactitude géographique parfaite ; le rendu n'est pas toujours réaliste et le texte lisible reste difficile à générer.
Coût de calcul élevé
La génération temps réel de mondes interactifs est très gourmande en ressources, ce qui limite la résolution (720p), le frame rate (24 fps) et l'accès grand public.