Wer ein RAG-System verbessert, ohne zu messen, verschlechtert es oft unbemerkt. Ein Testset schafft eine stabile Grundlage für Entscheidungen zu Abschnittsgröße, Suchverfahren und Modellwahl.
So bauen Sie es auf:
- Sammeln Sie 50 bis 100 realistische Fragen aus dem Betrieb, auch schwierige und mehrdeutige.
- Ordnen Sie jeder Frage die Dokumentabschnitte zu, die die Antwort enthalten, und formulieren Sie eine Referenzantwort.
- Trennen Sie zwei Messungen: Findet die Suche die richtigen Abschnitte (Retrieval)? Und nutzt das Modell sie korrekt (Antwortqualität)?
Für das Retrieval eignen sich einfache Kennzahlen wie die Trefferquote unter den ersten fünf Ergebnissen. Für die Antwort bewerten Fachleute eine Stichprobe nach Richtigkeit, Vollständigkeit und Quellenbezug. Automatische Bewertung durch ein zweites Modell kann helfen, ersetzt aber die menschliche Stichprobe nicht.
Ändern Sie immer nur einen Parameter pro Testlauf und dokumentieren Sie die Ergebnisse. Ergänzen Sie das Testset laufend um echte Fehlerfälle aus dem Betrieb. Es wächst mit dem System und wird zum Qualitätsnachweis.