Évolutions des LLMs : architectures, contexte et multimodalité
Comment les modèles de langage gagnent en taille de contexte, en efficacité (MoE) et en capacités multimodales
Les Large Language Models (LLMs) ont connu une évolution spectaculaire ces dernières années, passant de simples modèles de texte à des systèmes multimodaux sophistiqués capables de traiter images et vidéos (VLM). L'augmentation des tailles de contexte, l'essor du Mixture-of-Experts (MoE) et des modèles de raisonnement, et la montée en puissance de l'open-weight marquent une transformation profonde de ces technologies. Leur extension vers la perception et l'action — World Models et VLA — fait l'objet de pages dédiées dans la section « IA émergentes ».

MoE, Raisonnement et Modèles Open-Weight
Les évolutions majeures de 2025-2026 : le Mixture-of-Experts comme architecture dominante, l'essor des modèles de raisonnement, et la montée en puissance de l'open-weight.
L'Augmentation des Tailles de Contexte
De la Vision au Langage : les VLM
Au-delà du langage : les IA émergentes
L'évolution des LLMs vers la perception et l'action ouvre deux frontières qui dépassent le cadre des modèles de langage. Elles font l'objet de pages dédiées dans la section « IA émergentes ».
Sources et Ressources
- Wikipedia - Large Language Model
- OpenAI - Introducing GPT-5.5 (2026)
- BentoML - The Complete Guide to DeepSeek Models: from V3 to R1 and Beyond
- Hugging Face - The State of Open-Source LLMs (MoE : Llama 4, Qwen3, Kimi K2.6)
- GPT-4 Technical Report (OpenAI, 2023)
- Maxim - Gemini 3 Pro vs Claude Opus 4.5 vs GPT-5 : Frontier Model Comparison (2026)
- Google - Gemini 1.5: Unlocking multimodal understanding across millions of tokens (2024)
- Flash Attention: Fast and Memory-Efficient Exact Attention (2022)