Gemessene Antwortqualität
Die meisten KI-Demos behaupten Qualität. Hier ist sie gemessen: an 60 kuratierten Fragen mit bekannter richtiger Antwort (Golden-Set), bewertet u. a. per LLM-as-Judge auf Korrektheit und Quellendeckung. Darunter sind bewusst knifflige Fang- und Fremdfragen — um auch zu messen, wann das System ehrlich „weiß ich nicht" sagt.
100 %
Belegtreue (Groundedness)
Anteil der Antworten, deren Aussagen vollständig durch die zitierten Quellen gedeckt sind.
100 %
Faktenabdeckung
Anteil der erwarteten Kernfakten, die in der Antwort genannt werden.
99 %
Zitat-Genauigkeit
Anteil der angegebenen Quellen, die wirklich relevant sind.
100 %
Zitat-Vollständigkeit
Anteil der nötigen Quellen, die auch zitiert werden.
100 %
Trefferquote (Hit@3)
Wie oft die richtige Quelle unter den Top 3 ist (MRR 0.98).
56 %
Robustheit gegen Fangfragen
Bei bewusst kniffligen Fragen außerhalb des Bestands lehnt das System korrekt ab, statt zu raten — ein Wert, den wir pro Kundendomäne gezielt nachschärfen.
7 %
Fehlverweigerung (niedrig = gut)
Anteil beantwortbarer Fragen, die fälschlich abgelehnt werden — hier bleibt fast keine berechtigte Frage unbeantwortet.
Optimierungs-Verlauf
Wie sich Schlüsselmetriken über unsere Eval-Experimente entwickeln (config-getunt, jeweils derselbe Benchmark).
BelegtreueFaktenabdeckungRobustheit (Fangfragen)
Gemessen an 60 Golden-Fragen · Modell Mistral (EU) · Reranker an · Stand 2026-06-26.