Tester les fonctionnalités IA : évals, RAG & hallucinations · Leçon 3 sur 6 · Module bonus

Tester le RAG : récupération vs génération

Le RAG alimente le modèle avec des documents, puis lui demande de répondre à partir d'eux. Il échoue à deux endroits complètement différents — et appeler les deux « l'IA a tort » est l'erreur qui fait mal-attribuer des bugs pendant des semaines.

Par Shahriyar · Mis à jour

Deux étapes, deux bugs

Même symptôme visible — une mauvaise réponse — correctifs opposés. Chaque test RAG doit dire quelle étape a échoué, ou le bug va à la mauvaise équipe.

Notez-les séparément

▸ The two-question test
chunks = retrieve(question)
answer = generate(question, chunks)

# stage 1 — retrieval
assert known_answer_doc in chunks        # was the answer even available?

# stage 2 — generation, given those chunks
assert judge(answer, chunks,
  "every claim is supported by the chunks, nothing invented")

Basé sur les pratiques publiées d'évaluation RAG (métriques de récupération et de fidélité)

Toutes les leçons de Tester les fonctionnalités IA : évals, RAG & hallucinations

  1. On ne peut pas assertEqual un LLM
  2. Golden sets et évals hors-ligne
  3. Tester le RAG : récupération vs génération
  4. Mesurer l'hallucination
  5. Test adverse : jailbreaks et injection
  6. Garde-fous, CI, et la réponse d'entretien