Ministral 3 8B – Programme de Français FWB

Test RAG comparatif · Ollama + AnythingLLM · PDF brut (N0) · TXT converti (N1) · Markdown (N2).

ModèleMinistral 3 8B
ÉditeurMistral AI
QuantisationQ4_K_M · ~5 Go
EnvironnementOllama + AnythingLLM
EmbeddingAnythingLLM natif (all-MiniLM · CPU)
CorpusProgramme de Français FWB
NiveauxN0 (PDF brut) · N1 (TXT) · N2 (Markdown)
MachineServeur IA Light
CPURyzen 5 3600
RAM16 Go
GPURTX 3050 · 8 Go VRAM
OSLinux Mint 22

Vitesse : ~16,2 – 17,6 tok/s (stable)

QTypeN0N1N2
Q1Compétences de cycle3/53/53/5
Q2Objectif du programme4/54/55/5
Q3Approche en lecture4/54/55/5
Q4Piège culturel5/55/55/5
Q5Piège anti-hallucination5/55/55/5
Q6Différenciation pédagogique4/54/55/5
Moyenne4,174,174,67

Comportements notables

Q4 et Q5 · 5/5 sur les trois niveaux. Le modèle ne fabrique aucune information sur les deux questions pièges, quel que soit le niveau de préparation du corpus. En N1, il va même plus loin en distinguant la notion de période et d’heure dans le contexte FWB. C’est le comportement anti-hallucination le plus solide observé parmi les modèles testés sur ce corpus.

Q2 et Q3 · progression N0 vers N2. Sur les deux questions les plus discriminantes du protocole, la qualité des réponses progresse clairement avec la préparation du corpus. En N2, le modèle cite les sections du programme avec précision et structure ses réponses autour des grands principes pédagogiques du référentiel. La conversion Markdown du corpus produit un gain mesurable et reproductible.

Point d’attention · temps de génération sur les longues réponses. Sur Q6, les temps de réponse atteignent 56 à 57 secondes sur les trois niveaux. Ce plafond s’explique par la densité des réponses générées et la limite de bande passante de la RTX 3050 à 8 Go VRAM. Le débit reste stable mais la génération de contenus longs est perceptiblement plus lente que sur les configurations avec plus de VRAM.

Verdicts

N0 · ★★★★☆ · Pertinent · base documentaire solide dès le PDF brut : 4,17/5 en moyenne. Le modèle s’appuie correctement sur le corpus sans fabrication et produit des réponses structurées dès le niveau brut. Supervision recommandée sur les questions à fort ancrage culturel local.

N1 · ★★★★☆ · Pertinent · parité avec N0 · pas de régression observée : 4,17/5 en moyenne, identique au N0. La conversion TXT ne dégrade pas les résultats sur ce corpus, contrairement à ce qui a été observé sur d’autres modèles de la série. Usage avec supervision recommandé.

N2 · ★★★★★ · Très pertinent · usage professionnel accompagné envisageable : 4,67/5 avec quatre 5/5 et aucune hallucination sur 18 réponses. Meilleur score de la série. Un usage professionnel accompagné est envisageable sur ce corpus en N2. Supervision maintenue sur les questions sans réponse dans le document.

N0 - PDF brut N1 - TXT N2 - Markdown