Mesurer l'hallucination
Une hallucination est une affirmation assurée sans soutien. Vous ne pouvez pas l'attraper en lisant la réponse seule — elle sonne juste. Vous l'attrapez en vérifiant chaque affirmation contre ce que le modèle a réellement reçu.
L'ancrage est la métrique
Découpez la réponse en affirmations individuelles. Pour chacune, demandez : est-ce soutenu par la source que le modèle avait ? Une réponse où chaque affirmation remonte au contexte est ancrée ; une phrase assurée qui ne l'est pas est l'hallucination — et c'est généralement la phrase la plus fluide du paragraphe.
Le LLM-juge, et ses pièges
Un second modèle note l'ancrage contre la source. Il passe à l'échelle là où les humains ne peuvent pas — mais il a des modes d'échec que vous devez contourner par conception :
- Il préfère les réponses plus longues et assurées — biais de longueur et de ton. Contrôlez ça ou il récompense la chose même que vous traquez.
- Il est d'accord avec lui-même — juger la sortie de la même famille de modèles gonfle les scores. Utilisez un modèle différent comme juge quand vous pouvez.
- Il dérive — le juge est aussi non-déterministe. Vérifiez régulièrement les scores du juge contre des labels humains, ou vous faites confiance à un correcteur non audité.
Basé sur les pratiques publiées de notation d'ancrage et de LLM-juge