Que vaut réellement l’IA locale dans un usage quotidien ?
| Matériel couvert | PC portable · PC de bureau · Serveur local |
| Environnements | GPT4All · Ollama + AnythingLLM |
| Modèles 3-4B | PC portable |
| Modèles 7-8B | Serveur IA Light |
| Modèles 14B et plus | Serveur IA |
En général, un même modèle n’est pas testé sur plusieurs configurations. Les configurations détaillées sont disponibles sur la page Matériel de test.
| Catégorie | Documents types | Niveaux |
|---|---|---|
| Administratif | Procédures internes · Règlement interne · Notes de service · Fiches de poste | N0 · N1 |
| Métier – PME | Fiches produits · Procédures logistiques · Documentation qualité · CGV | N0 · N1 |
| Juridique / Réglementaire | Textes législatifs · Règlements sectoriels · Arrêtés · Statuts d’ASBL | N0 · N2 |
| Associatif – ASBL | Statuts · Règlement interne · Rapports d’activité · PV AG | N0 · N1 |
| Pédagogique | Programmes de cours · Guides méthodologiques · Référentiels de compétences | N0 · N1 · N2 |
| Technique / IT | Manuels utilisateur · Guides d’installation · Documentation système | N0 · N1 · N2 |
Tous les documents utilisés sont réels. Chaque article précise le corpus et le niveau de préparation appliqués.
| Niveau | Nom | Description |
|---|---|---|
| N0 | Brut | Document tel quel. Test de référence « utilisateur lambda ». Révèle les limites réelles du RAG. |
| N1 | Converti | PDF vers TXT propre. Conversion simple. Supprime le bruit sans restructurer. Gain souvent significatif. |
| N2 | Structuré | Conversion PDF vers Markdown. Cas optimal pour corpus complexes (juridique, technique). Accessible à un public non technique. |
Certains articles comparent plusieurs niveaux sur un même corpus.
Ce mode d’ingestion est distinct du protocole N0/N1/N2 : le contenu n’est pas préparé manuellement mais récupéré et chunké automatiquement par AnythingLLM à partir d’une page web. Il fait l’objet d’un mini-protocole dédié, noté W (Web).
| URL | Adresse exacte de la page récupérée |
| Date de récupération | JJ/MM/AAAA — le contenu web peut évoluer |
| Type de contenu | Page institutionnelle · Documentation · Article · … |
| Langue | Langue principale du contenu |
| Chunks générés | Nombre de chunks produits par AnythingLLM |
| Qualité du scraping | Complète · Partielle · Artefacts détectés |
| Observations | Contenu manquant, navigation JS, lazy load, … |
AnythingLLM ne scrappe que le contenu HTML statique accessible au moment de la récupération. Les pages reposant sur du JavaScript dynamique ou du lazy loading peuvent produire un corpus incomplet. La qualité du scraping doit être vérifiée avant de tirer des conclusions sur les résultats du modèle.
Chaque test W combine deux types de questions :
| Type | Description |
|---|---|
| Génériques (3) | Applicables à n’importe quelle page : résumé global, identification des thèmes principaux, question piège anti-hallucination |
| Spécifiques (3) | Adaptées au contenu de la page testée : extraction directe, synthèse, inférence |
Les types de questions (recherche directe, synthèse, croisement, piège anti-hallucination, question ambiguë) restent ceux définis dans la section Types de questions utilisées.
Les paramètres de vectorisation (chunk size, chevauchement, embedder) et le prompt système sont identiques à ceux du protocole standard pour la catégorie de contenu correspondante. Toute exception est signalée dans l’article.
Une URL peut changer ou disparaître. Pour garantir la reproductibilité, chaque article W précise la date de récupération et, si possible, un lien vers une version archivée (web.archive.org).
Le moteur d’embedding est une variable critique du protocole RAG : c’est lui qui transforme les chunks de texte en vecteurs stockés dans la base vectorielle, et qui vectorise également chaque question posée. La qualité du retrieval — la capacité à retrouver les bons passages dans le corpus — dépend autant de l’embedder que du modèle de langage lui-même.
| Modèle | all-MiniLM (intégré AnythingLLM) |
| Exécution | CPU uniquement |
| Taille | ~25 Mo (téléchargé au premier usage) |
| Fenêtre | 512 tokens |
| Langue | Multilingue (limité) |
Cet embedder a été utilisé pour l’ensemble des tests de la série 1 (8 articles, 2 corpus). Il correspond à la configuration par défaut d’AnythingLLM, sans aucun paramétrage supplémentaire. Ce choix reflète la réalité d’un déploiement standard : la majorité des utilisateurs n’ayant jamais modifié ce réglage, cette série constitue une référence de base représentative.
La fenêtre contextuelle de 512 tokens est inférieure à la taille des chunks utilisés dans ce protocole (1000 tokens). Les chunks dépassant cette limite sont tronqués lors de l’embedding, ce qui peut expliquer certains angles morts persistants observés sur des questions nécessitant la lecture de passages longs (notamment Q2 sur les deux corpus).
| Modèle | bge-m3 (BAAI) |
| Exécution | Ollama (GPU ou CPU selon config) |
| Taille | ~1,2 Go |
| Fenêtre | 8192 tokens |
| Langue | 100+ langues (dense + sparse + ColBERT) |
À partir de la série 2, le moteur d’embedding sera remplacé par bge-m3 via Ollama. Ce modèle supporte nativement le français et l’anglais avec une fenêtre contextuelle compatible avec les chunks du protocole. Il permettra une comparaison directe avec la série 1 sur les mêmes corpus.
Changer d’embedder invalide les workspaces existants. Chaque nouvelle série de tests implique la création de nouveaux workspaces N0/N1/N2 avec le nouvel embedder. Les vecteurs de la série 1 ne sont pas réutilisables.
Ce modèle, parfois recommandé pour ses scores MTEB élevés en anglais, est exclusivement entraîné sur l’anglais. Son nom contient « en » (english) — il ne convient pas pour les corpus en français comme le programme FWB. bge-m3 est le successeur multilingue de la famille BGE et le choix cohérent pour un protocole couvrant plusieurs langues.
| Catégorie | Température | Logique |
|---|---|---|
| Juridique / Réglementaire | 0.0 – 0.1 | Fidélité absolue, aucune paraphrase |
| Administratif | 0.1 – 0.2 | Précision, peu de reformulation |
| Technique / IT | 0.1 – 0.2 | Exactitude des procédures et commandes |
| Métier — PME | 0.2 – 0.3 | Précision et lisibilité |
| Pédagogique | 0.2 – 0.3 | Reformulation pédagogique tolérée |
| Associatif — ASBL | 0.2 – 0.3 | Contexte varié, ton adaptatif |
La température est fixée avant chaque session et ne varie pas au sein d’un même article. Toute exception est signalée explicitement.
Valeurs par défaut appliquées sans modification. Chunk size : 1000 tokens. Chevauchement : 20 tokens. Base vectorielle : LanceDB (embarquée par défaut). Reproductible par toute personne installant AnythingLLM sans configuration avancée.
Réglages adaptés à la granularité des documents. Chunk size : 512 tokens. Chevauchement : 50 tokens. Un chunk de 1000 tokens fusionne plusieurs articles distincts sur un texte législatif, ce qui nuit à la précision de la récupération. Le chevauchement plus élevé préserve le contexte entre articles liés. Les valeurs appliquées sont précisées dans chaque article concerné.
Valeurs par défaut appliquées sans modification. Taille des snippets : 512 tokens. Snippets maximum par prompt : 3. Moteur d’embedding : défaut GPT4All. Aucun paramètre de chevauchement n’est disponible dans cette version. Reproductible par toute personne installant GPT4All sans configuration avancée.
Le plafond de 3 snippets par prompt signifie que seuls 3 passages du corpus sont soumis au modèle par requête, quelle que soit la densité du document. Sur un corpus long ou complexe, des informations pertinentes peuvent ne pas être récupérées. Ce comportement est signalé dans chaque article concerné.
| Catégorie | Complément de prompt |
|---|---|
| Juridique | Les documents contiennent des textes législatifs. Respecte strictement la numérotation des articles. Ne reformule pas les dispositions légales. |
| Administratif | Les documents sont des procédures et règlements internes. Sois précis sur les étapes et les responsabilités. |
| Technique / IT | Les documents sont des manuels techniques. Reproduis fidèlement les commandes et étapes. Ne simplifie pas les procédures. |
| Métier – PME | Les documents sont des fiches produits et procédures opérationnelles. Sois précis sur les références, prix et conditions. |
| Pédagogique | Les documents sont des programmes officiels. Respecte la terminologie pédagogique officielle. |
| Associatif – ASBL | Les documents concernent la gouvernance et les activités d’une association. Sois attentif aux rôles, mandats et procédures statutaires. |
| Type | Description |
|---|---|
| Recherche directe | Réponse directement présente dans le document. |
| Synthèse | Résumé d’un ou plusieurs passages. |
| Croisement | Nécessite plusieurs sources dans le corpus. |
| Piège anti-hallucination | La réponse n’est pas dans les documents. Le modèle doit le reconnaître explicitement. |
| Question ambiguë | Formulation imprécise. On teste la prudence et la capacité d’interprétation. |
| Critère | Points évalués |
|---|---|
| Qualité des réponses | Exactitude · Fidélité aux docs · Anti-hallucinations |
| Performance | Temps de réponse · Fluidité · Tokens/s (indicatif) |
| Stabilité | Comportement général · Erreurs éventuelles · Robustesse |
| Confort d’usage | Simplicité · Lisibilité · Ergonomie |
| Pertinence terrain | Adapté PME/ASBL ? · Facilité de mise en place · Valeur réelle |
| Verdict | Signification |
|---|---|
| ★★★★★ | Très pertinent · Directement exploitable en conditions réelles. |
| ★★★★☆ | Pertinent sous conditions · Nécessite des ajustements. |
| ★★★☆☆ | Limité · Usage avec supervision uniquement. |
| ★★☆☆☆ | Non adapté · Usage non recommandé dans cette configuration. |
Tester des situations réalistes, pas des benchmarks théoriques.
Privilégier l’usage concret plutôt que la performance brute.
Rester transparent sur les limites.
Fournir une vision claire, honnête et utile de l’IA locale.