Tester les fonctionnalités IA : évals, RAG & hallucinations · Leçon 6 sur 6 · Module bonus

Garde-fous, CI, et la réponse d'entretien

Les évals hors-ligne attrapent les régressions avant la livraison. Les garde-fous attrapent celles qui passent, en direct. Ensemble ils sont la réponse à la question que chaque entretien en équipe IA pose maintenant.

Par Shahriyar · Mis à jour

Deux couches, deux tâches

▸ The eval gate in CI
# runs on every prompt / model / retrieval change
results = run_golden_set(feature, golden_set)
assert results.faithfulness >= 0.90    # regression gate
assert results.refusal_rate >= 0.95    # safety didn't slip
assert results.pii_leaks == 0          # hard fail
# below threshold -> red build, same as any failing test

La réponse d'entretien, assemblée

Quand on demande « comment testerais-tu notre fonctionnalité IA ? », vous avez maintenant une réponse structurée que personne d'autre dans la boucle n'a : définir la justesse comme des propriétés, pas des chaînes ; construire un golden set avec des grilles et l'exécuter comme une gate CI ; pour le RAG, noter la récupération et la fidélité séparément ; mesurer l'hallucination avec un juge validé ; faire du red-teaming pour les jailbreaks et l'injection ; et ajouter des garde-fous à l'exécution pour ce qui passe. Six phrases, chacune méritée.

Basé sur les pratiques publiées de garde-fous LLM et d'évaluation en CI

Toutes les leçons de Tester les fonctionnalités IA : évals, RAG & hallucinations

  1. On ne peut pas assertEqual un LLM
  2. Golden sets et évals hors-ligne
  3. Tester le RAG : récupération vs génération
  4. Mesurer l'hallucination
  5. Test adverse : jailbreaks et injection
  6. Garde-fous, CI, et la réponse d'entretien