Aller au contenu principal
Retour aux Insights
Open Source LLM DeepSeek Llama Mistral Kimi Transformer Souveraineté IA

Open Source a Gagné : Comment l'IA Libre a Conquis le Monde (2017-2026)

Par Yoram Halberstam Mis à jour le 21 juillet 2026 38 min de lecture
Disponible en 26 autres langues

Le Transformer : Une Invention qui a Tout Changé

En juin 2017, huit chercheurs de Google publient un article de douze pages. Ils ne le savent pas encore, mais ils viennent d’allumer la mèche d’une révolution qui transformera l’humanité.

Le Transformer — c’est son nom — remplace les réseaux de neurones récurrents par un mécanisme d’attention permettant une parallélisation massive du traitement des données. Contrairement aux architectures précédentes qui traitaient les mots un par un, le Transformer voit la phrase entière en une fois. Cette subtile différence change tout.

Neuf ans plus tard, à l’été 2026, l’écosystème open source domine l’usage mondial de l’intelligence artificielle. Ce qui n’était autrefois qu’un complément académique aux géants propriétaires est devenu le moteur de l’innovation industrielle — même si le porteur du flambeau a changé de main en cours de route, comme nous le verrons. Comment en est-on arrivé là ?

2017
L'année du Transformer
2023
L'effet Llama
2026
Parité technique atteinte

Les Premiers Pionniers (2018-2021)

GPT-2 : L’étincelle qui a Réveillé la Communauté

Février 2019. OpenAI dévoile GPT-2. Le modèle est effrayant — si effrayant qu’OpenAI refuse d’abord de le rendre public (la version complète de 1,5 milliard de paramètres ne sortira qu’en novembre 2019). Leur argument ? La capacité à générer du texte cohérent pourrait alimenter la désinformation.

Mauvais calcul. La communauté ne tolère pas qu’on lui cache des jouets. Quand GPT-2 est finalement publié sous licence MIT, des chercheurs du monde entier s’en emparent. Un collectif se forme : EleutherAI. Leur mission ? Prouver qu’on peut entraîner des modèles à milliards de paramètres sans les ressources d’une multinationale.

"Nous voulions démontrer que la science ouverte n'avait pas besoin de milliards de dollars pour avancer."

— Connor Leahy, fondateur d'EleutherAI

Google Riposte avec BERT et T5

Pendant ce temps, Google ne reste pas inactif. BERT (octobre 2018) révolutionne la compréhension bidirectionnelle du langage. T5 (février 2020) propose un cadre unifié où chaque tâche devient une transformation texte-à-texte.

Ces modèles, publiés sous licence Apache 2.0, deviennent la base de milliers de projets de recherche académique. Ils prouvent une chose essentielle : le pré-entraînement massif suivi d’un affinement est la voie royale.

Premiers Succès Communautaires

En mars 2021, EleutherAI publie GPT-Neo avec 2,7 milliards de paramètres. C’est un succès technique : le modèle rivalise avec le GPT-3 de l’époque, entièrement entraîné sur du calcul donné et du travail bénévole.

Le message est clair : l’open source peut tenir tête aux géants.

2022 : La Science Ouverte sous Pression

BigScience et BLOOM : Une Approche Sans Précédent

L’année 2022 marque un tournant. OpenAI ferme ses modèles derrière des API payantes. La communauté réagit différemment.

BigScience, coordonné par Hugging Face, rassemble 1000 chercheurs de 60 pays. Leur objectif ? Créer le plus grand modèle open source multilingue jamais construit. Le résultat : BLOOM, 176 milliards de paramètres, 46 langues, 13 langages de programmation.

Ce qui rend BLOOM historique, ce n’est pas sa taille. C’est la transparence totale : données d’entraînement publiques, code open source, journal d’entraînement complet. Pour la première fois, on peut vraiment comprendre comment un LLM est né.

Meta Frappe Fort avec OPT

Presque simultanément, Meta AI lance OPT (Open Pre-trained Transformer). Même taille que GPT-3, mais avec une différence cruciale : documentation complète du processus d’entraînement.

Les chercheurs peuvent enfin étudier un modèle de cette échelle sans ingénierie inverse.

Galactica : Un Présage

Novembre 2022. Meta tente de spécialiser l’IA avec Galactica, dédiée à la littérature scientifique. Le modèle est retiré en 48 heures suite à des critiques sur ses hallucinations.

Échec ? Pas tout à fait. Galactica pose les bases de l’entraînement sur corpus spécialisés. Une tendance qui explosera trois ans plus tard.

2023 : L’année où Tout a Changé

24 Février 2023 : L’effet Llama

Ce jour-là, Meta publie Llama. Le modèle n’est pas destiné au grand public — recherche uniquement. Mais ses poids fuient en ligne en quelques jours.

Le déclencheur d’une révolution.

Llama prouve qu’un modèle plus modeste (7 à 65 milliards de paramètres) entraîné sur plus de tokens peut surpasser les géants. La communauté s’en empare immédiatement.

Modèle Date Innovation Clé Licence
Alpaca Mars 2023 Affinement à faible coût via self-instruct Non-commercial
Vicuna Avril 2023 90% qualité ChatGPT pour 500$ de coût d'entraînement Non-commercial
Falcon 40B Juin 2023 Premier modèle open source dominant les benchmarks Apache 2.0
Mistral 7B Octobre 2023 Efficacité extrême via Sliding Window Attention Apache 2.0
Mixtral 8x7B Décembre 2023 Mixture of Experts (MoE) démocratisée Apache 2.0

QLoRA : La Démocratisation Locale

Avril 2023. Une technique change tout : QLoRA (Quantized Low-Rank Adaptation).

Résultat ? Affiner un modèle de 65 milliards de paramètres sur une seule GPU grand public. Les petites entreprises peuvent désormais créer leur propre IA sans infrastructure massive.

Les barrières tombent une à une.

2024-2025 : La Parité Technique

DeepSeek : La Chine entre en Scène

L’été 2024 marque l’arrivée d’un nouvel acteur majeur : DeepSeek, un laboratoire chinois affilié à High-Flyer Quant.

Leur coup de maître ? Une architecture MoE ultra-efficace et le mécanisme MLA (Multi-head Latent Attention) qui réduit les besoins en mémoire cache KV de 93%.

Résultat en janvier 2025 : DeepSeek-V3 égale GPT-4 pour une fraction du coût. La communauté internationale découvre que l’open source n’est plus un suiveur — c’est le leader.

OpenAI Cède sous la Pression

Août 2025. OpenAI, après des années de fermeture, publie GPT-OSS. Premier modèle à poids ouverts depuis GPT-2. Optimisé pour les workflows agentiques et le long contexte.

Pourquoi ce revirement ? La pression compétitive de l’open source était devenue trop forte. Quand les modèles gratuits égaleront les vôtres, la fermeture ne suffit plus.

Meta Répond avec Llama 4

La réponse immédiate de Meta : Llama 4 (avril 2025). Nativement multimodal, avec une fenêtre de contexte théorique de 10 millions de tokens pour la variante Scout.

Imaginez : analyser une base de code entière en une seule requête. C’est désormais possible — et gratuit.

Personne ne le savait encore, mais Llama 4 restera comme le dernier acte open source de Meta : en avril 2026, l’entreprise a lancé son premier modèle fermé (Muse Spark) et gelé le développement de la lignée Llama. Nous y reviendrons.

Janvier 2026 : L’Open Source Domine

Classement des Meilleurs Modèles

Voici où nous en sommes aujourd’hui :

Rang Modèle Développeur Score Qualité Spécialité
1 Kimi K2.5 (Reasoning) Moonshot AI 46,77 Mathématiques, raisonnement complexe
2 GLM-4.7 (Thinking) Zhipu AI 41,70 Code, Vision-Langage
3 DeepSeek V3.2 DeepSeek 41,20 Efficacité, faible coût d'inférence
4 GPT-OSS-120B OpenAI 40,50 Utilisation d'outils, agentique
5 Llama 4 Maverick (MoE) Meta 39,80 Multimodalité, écosystème
6 Qwen3-235B Alibaba 39,20 Multilinguisme, RAG

Le verdict est brutal : 5 des 6 meilleurs modèles sont open source. Seul GPT-OSS, ironiquement, porte le nom d’un ancien leader propriétaire.

(Ce classement est un instantané de janvier 2026 — la suite de l’année l’a rendu obsolète en six mois, comme le raconte la section « Printemps-été 2026 » plus bas.)

Innovations qui ont Changé la Donne

MLA et DeepSeek Sparse Attention : Gérer des millions de tokens de contexte nécessitait une mémoire cache KV prohibitive. La MLA compresse agressivement ce cache. La DSA réduit la complexité de calcul en ne traitant que les parties pertinentes de la séquence.

BitNet 1.58b : L’innovation la plus radicale de 2025. Au lieu d’encoder les poids sur 16 bits, BitNet utilise des valeurs ternaires {-1, 0, 1} — environ 1,58 bit par paramètre.

Conséquence :

  • Réduction de 70-80% de la consommation énergétique
  • Accélération 2,3x à 6,1x sur CPU standards
  • Un modèle de 100 milliards de paramètres fonctionnant sur un ordinateur de bureau standard

La souveraineté IA n’est plus un rêve. C’est une réalité technique.

L’Inférence Locale Devient Standard

Le RTX 5090 : Cœur des Stations de Travail IA

Début 2025, NVIDIA lance le RTX 5090. 32 Go de mémoire GDDR7, bande passante de 1,79 To/s (+77% vs génération précédente).

Résultats sur une carte grand public :

  • Llama 3.1 8B (4-bit) : 180 tokens/seconde
  • DeepSeek-R1 14B distillé (4-bit) : 89 tokens/seconde
  • Qwen 2.5 32B (4-bit) : 45 tokens/seconde

Les modèles 70B+ fonctionnent désormais sur des configurations multi-GPU locales avec des performances industrielles.

vLLM vs Ollama

Deux écosystèmes dominent :

  • vLLM : Standard de production. Moteur PagedAttention, gestion optimisée du cache KV, multiples utilisateurs simultanés.
  • Ollama : Favori des développeurs. Extrême simplicité, zéro configuration, support natif macOS/Linux/Windows.

L’Ère Agentique : Du Chat à l’Action

Devstral 2 : L’IA au Service du Code

Décembre 2025. Mistral AI lance Devstral 2, 123 milliards de paramètres optimisés pour le développement logiciel.

Score SWE-bench Verified : 72,2%. Égal à Claude Sonnet 4, pourtant sept fois plus cher.

Prix : 0,40 $ par million de tokens. Le développement assisté par IA devient économiquement viable pour les PME et indépendants.

Vibe CLI : L’IA qui Code Toute Seule

Le même mois, Mistral lance Vibe CLI. Cet outil orchestre de manière autonome des changements complexes à travers des bases de code entières.

Les modèles agentiques de 2026 peuvent :

  • Naviguer dans des systèmes de fichiers complexes
  • Identifier les dépendances entre frameworks
  • Détecter les échecs de test et s’auto-corriger
  • Produire de manière fiable des sorties JSON structurées pour l’intégration logicielle

On passe de l‘“IA de chat” à l‘“IA d’action”.

Printemps-Été 2026 : La Chine Prend le Flambeau

Le premier semestre 2026 a réécrit le récit de ce mouvement en deux actes : la défection de son fondateur involontaire, et le sacre de ses héritiers.

Meta Ferme le Jardin

Le 8 avril 2026, Meta a lancé Muse Spark — son premier grand modèle aux poids non publiés — et gelé dans la foulée le développement de Llama : pas de Llama 5, pas de Llama 4.5, le mastodonte « Behemoth » ne sortira jamais. L’entreprise qui avait déclenché l’« effet Llama » de 2023 (1,2 milliard de téléchargements cumulés) a quitté la table. La promesse d’Alexandr Wang d’« open-sourcer de futures versions » n’a convaincu personne.

Le paradoxe est complet : l’écosystème que Meta a engendré (llama.cpp, Ollama, vLLM, QLoRA) lui a survécu sans effort, réoutillé en quelques semaines pour les modèles de ses successeurs.

La Vague Chinoise : de l’Imitation à la Domination

Car les successeurs n’ont pas attendu. En six mois, les laboratoires chinois ont enchaîné les sorties à un rythme inédit :

  • Zhipu / Z.ai : entré en Bourse à Hong Kong le 8 janvier 2026 — première société « modèles de fondation » cotée au monde (sursouscription de 1 159×) — puis GLM-5 (février, 745 milliards de paramètres MoE), GLM-5.1 (avril, licence MIT, tête de SWE-Bench Pro à sa sortie) et GLM-5.2 (juin, MIT, 744B dont 40B actifs, 1M de contexte, 51 à l’Artificial Analysis Intelligence Index — devant Gemini 3.1 Pro selon la presse spécialisée).
  • Moonshot AI : Kimi K2.6 (avril, 1 000 milliards de paramètres, licence MIT modifiée), devenu en juin le modèle ouvert le mieux noté au monde (54 AAII), puis Kimi K3 le 16 juillet — 2,8 billions de paramètres, le plus grand modèle open source jamais publié, n°1 du Frontend Code Arena devant Claude Fable 5 dès sa sortie (Moonshot reconnaissant toutefois un retard d’expérience utilisateur sur les meilleurs modèles fermés).
  • DeepSeek : la génération V4 (preview MIT en avril — V4-Pro à 1,6 billion de paramètres, V4-Flash —, version officielle mi-juillet) a introduit une première mondiale : la tarification API heures pleines/heures creuses. Le fameux « R2 », lui, n’est jamais sorti — les spécifications qui circulent restent des fuites non confirmées.
  • MiniMax : M3 (juin), premier modèle open-weight combinant codage de frontière (SWE-Bench Pro 59,0), 1M de contexte à coût divisé par 20 et multimodalité native — avec un M3 Pro de 2,7 billions promis en open source pour le troisième trimestre.
  • Xiaomi : entré en scène en mars avec MiMo-V2-Flash, n°1 mondial des modèles ouverts sur SWE-bench Verified — et premier fournisseur d’OpenRouter au deuxième trimestre avec 21,1 % des tokens servis (OpenAI : 7,5 %).
  • Alibaba : la famille Qwen a dépassé le milliard de téléchargements (plus de 50 % des téléchargements open source mondiaux à elle seule), mais la stratégie est devenue hybride : Qwen3.5 et 3.6 restent ouverts, les flagships 3.7-Max/Plus sont désormais propriétaires.

Au printemps 2026, les modèles ouverts chinois représentaient 41 % des téléchargements Hugging Face, et les six modèles les plus utilisés d’OpenRouter étaient tous chinois.

La Contre-Attaque Américaine et Européenne

Face à ce raz-de-marée, la réplique occidentale s’est organisée autour de NVIDIA et de l’Europe :

  • NVIDIA a industrialisé sa famille Nemotron 3 (Nano en décembre 2025, puis l’Ultra de 550 milliards de paramètres au Computex de juin : 48 AAII, meilleur modèle ouvert américain de l’histoire — mais toujours six points derrière Kimi K2.6), publiant poids, données et recettes d’entraînement. En mars, la Nemotron Coalition a fédéré Mistral AI, Perplexity, Cursor, Black Forest Labs et d’autres autour de modèles frontière ouverts.
  • Google a livré Gemma 4 en avril (Apache 2.0, du modèle mobile E2B au 31B dense, 256K de contexte, plus de 400 millions de téléchargements cumulés pour la famille).
  • Mistral AI — dont l’article n’avait pas encore enregistré le Mistral Large 3 de décembre 2025 (675 milliards de paramètres MoE sous Apache 2.0, plus grand modèle ouvert européen jamais publié) — a vu ASML entrer à son capital (1,3 milliard d’euros, ~11 %), a emprunté 830 millions pour un datacenter souverain en Essonne, et négocierait selon Bloomberg une levée de ~3 milliards d’euros à ~20 milliards de valorisation (pourparlers non bouclés à ce jour).
  • L’Union européenne a sélectionné en juillet le consortium EUROPA (mené par l’italien Domyn) pour construire un modèle frontière open source de plus de 400 milliards de paramètres couvrant les 24 langues officielles, avec jusqu’à 2,5 % du calcul EuroHPC — pendant qu’OpenEuroLLM publiait ses premiers modèles de référence.

L’Open Source Devient un Enjeu Géopolitique

Signe des temps : à l’été 2026, Washington étudie des restrictions sur l’usage des modèles chinois sur le sol américain (mesure à l’étude, non actée — et difficile à appliquer : des poids téléchargés sont incontrôlables), pendant que Pékin étudie symétriquement des contrôles à l’export sur les modèles d’IA, y compris la libre diffusion des poids ouverts. Le logiciel libre, né pour ignorer les frontières, est devenu un instrument de puissance étatique.

Régulation : Que Reste-t-il de l’Ouvert ?

OSAID 1.0 : La Définition Officielle

Octobre 2024. L’Open Source Initiative publie enfin une définition officielle de l’Open Source AI.

Pour se qualifier d’open source, un système doit garantir quatre libertés : utiliser, étudier, modifier et partager. Trois composantes essentielles :

  1. Code : Code complet de pré-entraînement, filtrage et inférence
  2. Paramètres : Poids, paramètres de l’optimiseur, configurations d’architecture
  3. Données : Documentation détaillée sur la provenance, la sélection et le traitement

Résultat ? La plupart des modèles “open source” actuels ne sont pas conformes. Llama 4, Mistral, même GPT-OSS manquent de transparence totale des données.

Seuls Pythia (EleutherAI) et OLMo (AI2) méritent l’étiquette “vraiment open source”.

L’AI Act Européen Structure le Marché — puis se Fait Alléger

Le Règlement Européen sur l’IA s’applique par étages : interdictions depuis février 2025, obligations pour les modèles à usage général (GPAI) depuis le 2 août 2025, pouvoirs d’exécution de la Commission à partir du 2 août 2026. Les modèles open source bénéficient d’exemptions significatives — à condition qu’ils ne soient pas classés “risque systémique”. Pour les modèles dépassant 10^25 FLOPs, des obligations de documentation et de cybersécurité s’appliquent, indépendamment de la licence.

Rebondissement en 2026 : sous la pression de l’industrie, le paquet « Digital Omnibus » (accord provisoire en mai, feu vert final du Conseil le 29 juin 2026) a reporté les obligations « haut risque » à décembre 2027 / août 2028 et fixé le marquage des contenus générés au 2 décembre 2026. Les exemptions open source, elles, ont été maintenues — une victoire discrète mais réelle pour l’écosystème.

2026-2030 : Quel Avenir ?

Tendances qui se Profilent

Post-Transformer : De nouvelles architectures émergent pour réduire la complexité quadratique de l’attention. BitNet n’est qu’un début.

Edge AI : Des modèles comme Ministral 3B fonctionnent sur smartphones avec un contexte massif. L’automatisation domestique et la robotique personnelle vont exploser.

Souveraineté de l’Intelligence : Les entreprises ne veulent plus “louer” l’intelligence via des API. Elles veulent posséder leurs propres cerveaux digitaux, entraînés sur leurs secrets industriels.

Coopération Multi-Agents : L’avenir réside dans la communication entre modèles de fournisseurs différents. Résoudre des problèmes par collaboration plutôt que par force brute monolithique.

Le Nouveau Paradigme SEO

L’intégration massive des LLM dans les moteurs de recherche a transformé la visibilité en ligne. On parle désormais de GEO (Generative Engine Optimization).

En 2026, une part substantielle du trafic organique traditionnel est captée par des réponses directes générées par l’IA. Les utilisateurs ne cliquent plus — ils lisent la synthèse.

Pour une marque, le succès ne se mesure plus au classement Google. Il se mesure à la fréquence et à la stabilité des citations dans les réponses génératives de Gemini, de GPT-5.6 ou de Claude.

Et Maintenant ?

L’écosystème open source de 2026 a prouvé une chose essentielle : la transparence et la collaboration ne sont pas des idéaux éthiques, ce sont des avantages compétitifs supérieurs.

En brisant les monopoles de l’intelligence, l’open source a transformé l’IA d’un service exclusif en infrastructure publique mondiale — aussi fondamentale que l’électricité ou Internet.

Le bilan de la mi-2026 impose toutefois une double lecture. Sur l’usage, la victoire est totale : 41 % des téléchargements Hugging Face pour les seuls modèles chinois, un tiers des requêtes IA de plateformes comme Vercel sur des modèles ouverts, plus de 2,2 millions de modèles sur le Hub, la moitié des Fortune 500 utilisatrices. Sur la frontière absolue, les modèles fermés (Claude Opus 4.8 et Fable 5, GPT-5.5/5.6, Gemini 3.x) conservent trois à huit points d’avance sur les benchmarks de raisonnement les plus durs — un écart que Moonshot lui-même reconnaît pour Kimi K3.

Et l’ironie de l’histoire restera celle-ci : Meta, qui a allumé l’incendie, a quitté le mouvement en 2026 — sans parvenir à l’éteindre. Les modèles généralistes massifs sont complétés, parfois remplacés, par des constellations de modèles spécialisés, plus économiques, plus précis, plus souverains.

L’open source a gagné la guerre de l’adoption. La bataille de la frontière, elle, continue.

Sommaire