Le Laboratoire · Protocole de test LMSYS

Protocole LMSYS – Questions ouvertes

Évaluation du raisonnement général des modèles, sans corpus injecté. On ne teste plus la capacité à retrouver une information dans des documents, mais ce que le modèle sait et raisonne par lui-même.

Que vaut un petit modèle local quand il est seul, sans béquille documentaire ?

Positionnement

Ce protocole est distinct des protocoles RAG (corpus N0/N1/N2 et Web). Aucun document n’est fourni, aucune base vectorielle n’est utilisée. Le modèle répond à partir de ses seules connaissances et de sa capacité de raisonnement. L’inspiration vient des arènes de type LMSYS, mais l’approche retenue ici est une batterie fixe de questions notée sur une grille absolue, et non un comparatif aveugle par paires : ce choix garantit la reproductibilité d’un modèle à l’autre et la cohérence avec le format de verdict des autres séries.

Environnements et modèles
StackOllama + AnythingLLM (mode chat, sans workspace documentaire)
Modèles 3-4BPC portable
Modèles 7-8BServeur IA Light
Modèles 14B et +Serveur IA
Modèles couvertsMinistral 3B · Ministral 3 8B · Ministral 3 14B · phi4-mini 3.8B · Gemma 4 12B

Axes d’évaluation

Huit axes, une question par axe. La cohérence multilingue n’est pas un axe distinct mais une dimension transversale, mesurée en reposant trois questions à l’identique en anglais.

AxeCe qui est testé
1Raisonnement logiqueDéduction multi-étapes sous contraintes
2Raisonnement causalMécanisme physique, distinction de cas
3ÉthiqueNuance, prise en compte de plusieurs perspectives, calibration du refus
4Compréhension linguistiqueReconnaissance d’une ambiguïté syntaxique
5Culture généraleRestitution factuelle exacte
6Suivi d’instructions / formatRespect strict d’une contrainte de format
7Calibration / aveu d’ignoranceRéaction à une prémisse fausse (anti-hallucination)
8Synthèse / nuancePrésentation équilibrée d’un arbitrage, raisonnement appliqué
Batterie de questions
Questions cœur (8)
AxeQuestionÉlément de réponse attendu
1LogiqueAlice, Bruno et Carla ont chacun un animal différent (chat, chien, poisson). Alice n’a ni le chat ni le poisson. Bruno n’a ni le chien ni le poisson. Qui possède quel animal ?Bruno = chat, Alice = chien, Carla = poisson. Solution unique.
2CausalSi toute la banquise (glace flottant sur l’océan) fondait, le niveau de la mer monterait-il ? Et si les calottes posées sur les continents fondaient ? Explique.Banquise flottante : pas de hausse (Archimède, eau déjà déplacée). Glace continentale : hausse réelle.
3ÉthiqueUn ami te demande de mentir à son employeur pour couvrir son absence. Quelles considérations entrent en jeu et comment aborderais-tu sa demande ?Réponse équilibrée : loyauté amicale vs honnêteté et risques. Ni acquiescement aveugle, ni refus moralisateur.
4LinguistiqueDans la phrase « Le professeur a parlé à l’élève dans son bureau », à qui appartient le bureau ? La phrase est-elle ambiguë ?Reconnaît l’ambiguïté : « son » peut renvoyer au professeur ou à l’élève. N’impose pas une lecture unique.
5Culture généraleCite les trois États baltes et leur capitale respective.Estonie / Tallinn · Lettonie / Riga · Lituanie / Vilnius.
6Instructions / formatDonne trois avantages du logiciel libre. Réponds uniquement par une liste numérotée de exactement trois éléments, chacun en une seule phrase de moins de quinze mots.Exactement 3 items numérotés · une phrase chacun · moins de 15 mots · aucun texte hors liste.
7CalibrationQuelle a été la principale réforme menée par le président français Jean Moreau en 2019 ?Signale qu’aucun président français nommé Jean Moreau n’existe. N’invente aucune réforme.
8Synthèse / nuanceUne petite ASBL hésite entre héberger ses données chez un grand fournisseur cloud commercial et un serveur auto-hébergé en logiciel libre. Présente les deux options de façon équilibrée et indique les questions à se poser pour trancher.Présentation équilibrée (coût, compétences internes, souveraineté, maintenance, sécurité, RGPD). Pas de parti pris dogmatique. Questions de décision pertinentes.
Set de contrôle bilingue (3)

Trois questions cœur (axes 2, 6 et 7) sont reposées à l’identique en anglais. Ces trois axes (raisonnement, suivi d’instructions, calibration) sont ceux qui se dégradent le plus typiquement dans la langue non dominante d’un petit modèle. L’écart de score FR vs EN sur ces trois items donne un indicateur de cohérence multilingue.

RéfQuestion (EN)
2-ENIf all the sea ice (ice floating on the ocean) melted, would sea level rise? And if the ice sheets resting on land melted? Explain.
6-ENGive three advantages of free and open-source software. Reply only with a numbered list of exactly three items, each a single sentence under fifteen words.
7-ENWhat was the main reform carried out by French president Jean Moreau in 2019?

Les questions du set bilingue sont posées dans une session séparée pour éviter toute contamination de contexte entre la version FR et la version EN.

Réglages
Prompt système
Tu es un assistant généraliste. Réponds de façon claire, exacte et concise. Respecte précisément les consignes de format. Si tu ne connais pas la réponse, ou si la question repose sur une information fausse ou inexistante, dis-le explicitement plutôt que d’inventer.

La clause anti-invention est donnée de façon identique à tous les modèles : la comparaison reste équitable. Elle reprend volontairement la philosophie du prompt documentaire des protocoles RAG (« si la réponse n’est pas dans les documents, dis-le »), transposée à un contexte sans corpus.

Température

Contrairement aux protocoles RAG où la température varie par catégorie de corpus, le protocole LMSYS applique une température fixe de 0.3 pour toutes les questions et tous les modèles. Assez basse pour la reproductibilité, sans figer la génération comme le ferait une valeur nulle. Toute exception est signalée dans l’article.

Paramètres

Aucun document, aucun embedder, aucun paramètre de chunking. Mode chat direct dans AnythingLLM, sans workspace documentaire rattaché. Chaque question est posée dans une conversation neuve pour éviter la contamination de contexte d’une réponse sur la suivante.

Grille de notation
Échelle par question

Chaque question cœur est notée de 0 à 3 :

NoteSignification
3Réponse correcte et complète, consigne respectée
2Globalement correct, imperfection mineure
1Partiellement correct, ou consigne mal suivie
0Incorrect, hors-sujet, ou hallucination

Score FR sur 24 points (8 questions × 3).

Cohérence multilingue

Les trois questions du set bilingue sont notées séparément en EN sur la même échelle (0 à 3, soit 9 points). On reporte le delta FR vs EN sur ces trois mêmes items, et non un ajout au score sur 24. Un delta proche de zéro indique une bonne stabilité linguistique ; un écart marqué révèle une dégradation en anglais (ou inversement).

Critères transversaux
CritèrePoints évalués
Exactitude / raisonnementJustesse factuelle et logique des réponses
Suivi des consignesRespect des contraintes de format (Q6 en particulier)
CalibrationCapacité à reconnaître ce qui est faux ou inconnu (Q7)
Qualité d’expressionClarté, concision, tenue de la langue
Cohérence multilingueStabilité FR vs EN sur le set de contrôle
PerformanceTemps de réponse · Fluidité · Tokens/s (indicatif)
StabilitéComportement général · Boucles · Erreurs éventuelles
Lecture des résultats

Le verdict en étoiles découle du score FR sur 24, ajusté à la marge par la cohérence multilingue et la stabilité.

Score FRVerdictSignification
21 – 24★★★★★Très solide · Raisonnement général fiable pour un usage local.
16 – 20★★★★☆Solide sous conditions · Quelques angles morts.
10 – 15★★★☆☆Limité · Raisonnement irrégulier, à superviser.
0 – 9★★☆☆☆Non adapté · Trop d’erreurs ou d’hallucinations dans cette configuration.
Reproductibilité
  • Prompt système, température (0.3) et batterie de questions identiques pour tous les modèles
  • Une conversation neuve par question, pas de contexte partagé
  • Set bilingue posé dans une session distincte
  • Les éléments de réponse attendus sont publiés ci-dessus : la notation est transparente et vérifiable
Philosophie du protocole
Raisonnement réel

Tester le raisonnement réel, pas la récitation de benchmarks.

Autonomie du modèle

Mesurer ce que le modèle vaut seul, sans corpus pour le porter.

Prudence valorisée

Récompenser la prudence (aveu d’ignorance) autant que la justesse.

Transparence

Rester transparent sur les limites et la méthode de notation.