---
title: Un laboratoire crée son propre test de référence pour évaluer les modèles de langage
url: https://www.elseif.net/fr/un-laboratoire-cree-son-propre-test-de-reference-pour-evaluer-les-modeles-de-langage
published: 2026-10-06T08:24:28+00:00
language: fr
section: Modèles
source: https://habr.com/ru/articles/1089876/?utm_campaign=1089876&utm_source=habrahabr&utm_medium=rss
organizations: DeepSeek, ChatGPT, Claude
publisher: elseif
---

# Un laboratoire crée son propre test de référence pour évaluer les modèles de langage

Un laboratoire a développé son propre test de référence pour déterminer quel modèle de langage doit diriger son assistant d'intelligence artificielle. Cet assistant est chargé de répondre à des questions basées sur un journal de laboratoire électronique, qui sert de base de données pour les expériences et les mesures.

L'équipe a jugé les classements publics inutiles car ils testent des connaissances générales et ne reflètent pas la capacité d'un modèle à gérer des données changeantes ou erronées. Le test interne se compose de vingt quatre questions basées sur des travaux réels, exécutées via mcp sur les modèles DeepSeek, ChatGPT et Claude. Les questions sont divisées en cinq groupes : la navigation pour localiser des échantillons, l'extraction de valeurs dans des fichiers, le raisonnement en plusieurs étapes, des pièges pour tester la vigilance, et l'honnêteté pour vérifier le refus de répondre en cas d'absence de données.

Les résultats montrent des performances variant de 75 % à 100 %. Le coût pour répondre aux vingt quatre questions varie considérablement, allant de 12 cents à près de 5 dollars selon la combinaison du modèle et de l'effort utilisé, soit une différence d'environ quarante fois.

L'évaluation repose sur trois critères binaires : l'exactitude de la réponse, la présence d'une référence vers l'objet ou le fichier source, et l'honnêteté du modèle. Un succès strict exige que les trois critères soient remplis. Le laboratoire accorde une importance particulière aux pièges et à l'honnêteté pour distinguer les assistants fiables de ceux qui inventent des réponses. Par exemple, le test inclut des scénarios où un modèle doit identifier une panne de thermocouple ou ignorer un artefact de lecture de puissance au lieu de rapporter une valeur erronée.

L'assistant a accès à 31 outils de lecture sur les 58 disponibles dans la base de données. Le format de réponse imposé comprend la réponse elle même, la méthode utilisée, et une mention finale pour les éléments non vérifiés. Les données de référence sont vérifiées manuellement et mises à jour avant chaque série de tests pour tenir compte des éléments variables, comme le nombre de projets ou le contenu des dossiers.
