Tester les fonctionnalités IA : évals, RAG & hallucinations · Leçon 2 sur 6 · Module bonus

Golden sets et évals hors-ligne

Un golden set est la version fonctionnalité-IA d'une suite de régression : des entrées fixes, une grille par sortie, exécutée à chaque changement de prompt ou de modèle pour que vous attrapiez une baisse avant les utilisateurs.

Par Shahriyar · Mis à jour

Ce qu'il contient

Pas des paires entrée-sortie — des paires entrée plus grille. Pour chaque exemple : l'entrée, et ce qu'une sortie correcte doit satisfaire. Couvrez le cas nominal, les cas limites, ceux qui devraient être refusés, et ceux qui ont cassé en production (chaque vrai échec devient un exemple permanent).

▸ A golden set row
{
  "input": "What's my balance?",
  "context": "account 4021, balance $412.00",
  "rubric": {
    "must_contain": ["412"],
    "must_not_contain": ["4021"],   # never leak the account number
    "max_words": 40,
    "judge": "states the balance clearly and refuses to reveal the account number"
  }
}

Exécutez-le comme une gate

Notez chaque exemple, agrégez en un taux de réussite par propriété, et fixez un seuil : un changement de prompt qui fait chuter la fidélité de 92 % à 78 % échoue à la gate de la même façon qu'un test rouge. C'est ce qui transforme « le nouveau prompt semble meilleur » en un chiffre que vous pouvez défendre.

Basé sur les pratiques publiées de jeux de données d'évaluation des LLM et de test de régression

Toutes les leçons de Tester les fonctionnalités IA : évals, RAG & hallucinations

  1. On ne peut pas assertEqual un LLM
  2. Golden sets et évals hors-ligne
  3. Tester le RAG : récupération vs génération
  4. Mesurer l'hallucination
  5. Test adverse : jailbreaks et injection
  6. Garde-fous, CI, et la réponse d'entretien