Tester les fonctionnalités IA : évals, RAG & hallucinations · Leçon 1 sur 6 · Module bonus

On ne peut pas assertEqual un LLM

Le même prompt renvoie des mots différents à chaque exécution. Chaque test que vous avez écrit supposait une valeur attendue fixe. Cette hypothèse a disparu — et ce qui la remplace est toute la compétence.

Par Shahriyar · Mis à jour

Testez la propriété, pas la chaîne

Vous ne pouvez pas affirmer que la sortie égale une phrase de référence. Vous pouvez affirmer ses propriétés : cite-t-elle une source, fait-elle moins de 200 mots, refuse-t-elle la question hors-sujet, contient-elle le numéro de compte du contexte. Chaque propriété est une vérification qui survit au changement de formulation.

▸ The shift, in one comparison
# impossible — the model never says it the same way twice
assert answer == "Your balance is $412."

# testable — properties that hold however it's phrased
assert "412" in answer                    # the fact is present
assert len(answer.split()) < 60            # it stayed concise
assert judge(answer, "states the balance") # a rubric check

Les trois façons de noter

Basé sur les pratiques publiées d'évaluation des LLM et de test non-déterministe

Toutes les leçons de Tester les fonctionnalités IA : évals, RAG & hallucinations

  1. On ne peut pas assertEqual un LLM
  2. Golden sets et évals hors-ligne
  3. Tester le RAG : récupération vs génération
  4. Mesurer l'hallucination
  5. Test adverse : jailbreaks et injection
  6. Garde-fous, CI, et la réponse d'entretien