Ministral 3 8B – Manuel utilisateur Nextcloud

Test RAG comparatif · Ollama + AnythingLLM · PDF brut (N0) · TXT converti (N1) · Markdown (N2).

ModèleMinistral 3 8B
ÉditeurMistral AI
QuantisationQ4_K_M · ~5 Go
EnvironnementOllama + AnythingLLM
EmbeddingAnythingLLM natif (all-MiniLM · CPU)
CorpusManuel utilisateur Nextcloud
NiveauxN0 (PDF brut) · N1 (TXT) · N2 (Markdown)
MachineServeur IA Light
CPURyzen 5 3600
RAM16 Go
GPURTX 3050 · 8 Go VRAM
OSLinux Mint 22

Vitesse : ~15-20 tok/s (stable)

QTypeN0N1N2
Q1Recherche directe5/55/55/5
Q2Synthèse1/51/51/5
Q3Procédure technique3/54/54/5
Q4Question ambiguë1/52/51/5
Q5Piège anti-hallucination5/53/55/5
Q6Croisement de sections5/55/54/5
Moyenne3,333,333,33

Comportements notables

Point fort · Q1 et Q6 · extraction directe et croisement de sections. Le modèle excelle sur les questions ancrées dans des passages bien délimités du corpus. La liste des navigateurs est restituée parfaitement dès N0, et le croisement entre les sections 2.1 et 6 pour les prérequis Talk est réussi sur les trois niveaux. Ces résultats confirment la fiabilité du modèle sur les informations explicitement présentes et bien structurées dans le document.

Point faible structurel · Q2 et Q4 · angles morts persistants. La règle de gestion automatique de la corbeille (section 4.3) et les mécanismes de partage sans compte (sections 4.7 et 4.9) restent hors de portée sur les trois niveaux. Ces échecs ne sont pas liés à la qualité de la préparation du corpus mais vraisemblablement à la position et au découpage de ces passages dans le flux de chunking d’AnythingLLM. Signal utile pour calibrer la taille et le chevauchement des chunks sur les corpus techniques denses.

Q5 · instabilité selon le niveau de préparation. Le comportement anti-hallucination est correct en N0 et N2 mais dérape en N1 avec des suggestions de commandes GPG et OpenSSL non documentées dans le corpus. Ce type de dérive, observé uniquement sur le corpus TXT intermédiaire, suggère que le format de préparation influence la prudence du modèle sur les questions sans réponse.

Verdicts

N0 · ★★★☆☆ · Limité · usage avec supervision uniquement : 3,33/5 en moyenne. Fiable sur les extractions directes et le croisement de sections, mais deux angles morts structurels sur Q2 et Q4 limitent fortement l’usage autonome. Supervision indispensable sur tout corpus technique dense en N0.

N1 · ★★★☆☆ · Limité · progression sur Q3 contrebalancée par la dérive sur Q5 : 3,33/5 en moyenne, identique au N0. La conversion TXT améliore la procédure WebDAV mais introduit une instabilité sur le piège anti-hallucination. Le bilan global ne progresse pas. Usage avec supervision uniquement.

N2 · ★★★☆☆ · Limité · meilleure posture mais angles morts non résolus : 3,33/5 en moyenne. Le comportement anti-hallucination retrouve sa rigueur et la procédure technique est la plus complète des trois niveaux. Les deux angles morts (Q2 et Q4) persistent et plafonnent le score global. Supervision indispensable sur corpus technique IT avec ce modèle.

N0 - PDF brut N1 - TXT N2 - Markdown