Tester les fonctionnalités IA : évals, RAG & hallucinations · Leçon 4 sur 6 · Module bonus

Mesurer l'hallucination

Une hallucination est une affirmation assurée sans soutien. Vous ne pouvez pas l'attraper en lisant la réponse seule — elle sonne juste. Vous l'attrapez en vérifiant chaque affirmation contre ce que le modèle a réellement reçu.

Par Shahriyar · Mis à jour

L'ancrage est la métrique

Découpez la réponse en affirmations individuelles. Pour chacune, demandez : est-ce soutenu par la source que le modèle avait ? Une réponse où chaque affirmation remonte au contexte est ancrée ; une phrase assurée qui ne l'est pas est l'hallucination — et c'est généralement la phrase la plus fluide du paragraphe.

Le LLM-juge, et ses pièges

Un second modèle note l'ancrage contre la source. Il passe à l'échelle là où les humains ne peuvent pas — mais il a des modes d'échec que vous devez contourner par conception :

Basé sur les pratiques publiées de notation d'ancrage et de LLM-juge

Toutes les leçons de Tester les fonctionnalités IA : évals, RAG & hallucinations

  1. On ne peut pas assertEqual un LLM
  2. Golden sets et évals hors-ligne
  3. Tester le RAG : récupération vs génération
  4. Mesurer l'hallucination
  5. Test adverse : jailbreaks et injection
  6. Garde-fous, CI, et la réponse d'entretien