| Éditeur | Mistral AI |
| Année | 2023 |
| Paramètres | 7,3 milliards |
| Architecture | Dense · Transformer |
| Fenêtre contexte | 32 768 tokens (v0.2) |
| Sortie max | 8 192 tokens |
| Poids ~ | ~4,1 Go (Q4) |
| Licence | Apache 2.0 |
| Type | LLM · Texte uniquement |
| Multilingue | Oui |
| Fine-tuning | SFT · version Instruct |
Premier modèle open source de Mistral AI, sorti en septembre 2023. La version Instruct a rapidement établi une référence dans la catégorie 7B, surpassant Llama 2 13B sur la plupart des benchmarks malgré sa taille deux fois inférieure. Le modèle utilise une fenêtre d’attention glissante dans sa version initiale, portée à 32k tokens en v0.2.
| Éditeur | Mistral AI |
| Année | 2025 |
| Tailles | 3 milliards · 8 milliards · 14 milliards |
| Architecture | Dense · Transformer |
| Fenêtre contexte | 256 000 tokens |
| Poids ~ | ~3 Go / ~6 Go / ~9,1 Go |
| Quantisation | Q4_K_M |
| Licence | Apache 2.0 |
| Type | Multimodal · Texte + Vision |
| Multilingue | 40+ langues |
| Conçu pour | Edge · Enterprise · Agentic |
Nouvelle génération de la série edge de Mistral AI, sortie en décembre 2025. Les Ministral 3 apportent la vision (analyse d’images) à toute la gamme, une fenêtre de contexte étendue à 256k tokens, et trois variantes par taille (base, instruct, reasoning). Entraînés aux côtés de Mistral Large 3, ils constituent le meilleur rapport performance/coût de la catégorie open source selon Mistral AI. Chaque taille est disponible pour déploiement local via Ollama.
| Éditeur | Microsoft Research |
| Année | 2024 |
| Paramètres | 3,8 milliards |
| Architecture | Dense · Transformer decoder |
| Fenêtre contexte | 128 000 tokens |
| Données entraînement | 3,3 T tokens |
| Poids ~ | ~2,3 Go (Q4) |
| Licence | MIT |
| Type | SLM · Texte uniquement |
| Multilingue | Limité (anglais prioritaire) |
| Fine-tuning | SFT + DPO |
Premier modèle de la série Phi-3 à atteindre une fenêtre de contexte de 128k tokens dans la catégorie 3-4B. Son approche « data quality over quantity », entraînement sur des données synthétiques de haute qualité plutôt que du web brut, lui confère des capacités de raisonnement supérieures à sa taille. Noté pour ses performances en mathématiques, raisonnement logique et code. Limites connues : moins performant sur les connaissances factuelles et les langues autres que l’anglais.
| Éditeur | Microsoft Research |
| Année | 2025 |
| Paramètres | 3,8 milliards |
| Architecture | Dense · GQA · vocab 200k |
| Fenêtre contexte | 128 000 tokens |
| Poids ~ | ~2,5 Go |
| Quantisation | Q4_K_M |
| Licence | MIT |
| Type | SLM · Texte uniquement |
| Multilingue | Oui (amélioré vs Phi-3) |
| Fine-tuning | SFT + DPO |
Successeur direct de Phi-3 Mini, sorti en février 2025. Le Phi-4 Mini conserve les 3,8B paramètres mais introduit une architecture améliorée avec grouped-query attention (GQA) et un vocabulaire étendu à 200k tokens, permettant un meilleur support multilingue. Conçu pour des tâches de texte avec haute précision en contexte contraint : function calling, raisonnement, longues séquences. Testé dans le protocole IA LAB sur corpus pédagogique et technique comme représentant de la catégorie Microsoft 3-4B.
| Éditeur | Google DeepMind |
| Année | 2026 |
| Paramètres | 11,95 milliards (~12B) |
| Architecture | Dense · encoder-free · attention hybride (fenêtre glissante + globale) |
| Fenêtre contexte | 256 000 tokens |
| Poids ~ | ~6,6 Go (Q4_K_M) |
| Quantisation | Q4_K_M |
| Licence | Apache 2.0 |
| Type | Multimodal · Texte + Image + Audio natif |
| Multilingue | 35+ langues (140+ en pré-entraînement) |
| Conçu pour | Edge · Local · Agentique multimodal |
Sorti le 3 juin 2026, Gemma 4 12B Unified est le membre intermédiaire de la famille Gemma 4 (entre les variantes E4B et 26B), et le premier Gemma de taille moyenne à intégrer l’audio natif aux côtés du texte et de l’image, sans encodeur séparé. Son architecture unifiée abaisse l’empreinte mémoire et permet un déploiement confortable sur une machine grand public équipée de 16 Go de VRAM (ou 8 Go en quantisé), tout en approchant les performances de la variante 26B sur les benchmarks standards.
Par sa fenêtre de contexte de 256k tokens, son support de 140+ langues et sa licence Apache 2.0 pleinement permissive, ce modèle constitue un candidat naturel pour élargir le protocole IA LAB à des cas d’usage multimodaux (analyse de documents scannés, transcription audio) tout en restant comparable aux familles Mistral et Microsoft déjà testées.
| Modèle | Éditeur | Année | Paramètres | Contexte | Type | Licence | Quantisation |
|---|---|---|---|---|---|---|---|
| Mistral 7B Instruct | Mistral AI | 2023 | 7,3B | 32k | Texte | Apache 2.0 | Q4_K_M |
| Ministral 3 · 3B | Mistral AI | 2025 | 3B | 256k | Texte + Vision | Apache 2.0 | Q4_K_M |
| Ministral 3 · 8B | Mistral AI | 2025 | 8B | 256k | Texte + Vision | Apache 2.0 | Q4_K_M |
| Ministral 3 · 14B | Mistral AI | 2025 | 14B | 256k | Texte + Vision | Apache 2.0 | Q4_K_M |
| Phi-3 Mini Instruct | Microsoft | 2024 | 3,8B | 128k | Texte | MIT | Q4_K_M |
| Phi-4 Mini Instruct | Microsoft | 2025 | 3,8B | 128k | Texte | MIT | Q4_K_M |
| Gemma 4 12B | Google DeepMind | 2026 | ~12B | 256k | Texte + Image + Audio | Apache 2.0 | Q4_K_M |
Tous les modèles testés sont déployables localement sans connexion internet.
La sélection privilégie les modèles accessibles sur machines 8-16 Go RAM utilisées par les PME et associations.
Chaque famille de taille (3B, 7-8B, 14B+) est représentée pour permettre des comparaisons cohérentes.
Au minimum deux éditeurs sont représentés (Mistral AI, Microsoft Research, Google DeepMind).
La quantisation utilisée est indiquée dans chaque fiche modèle et dans chaque article de test.