Ein RAG-System mit Fragen starten, die es nicht beantworten darf

Ein Abrufsystem benötigt Belege für die Beantwortung und einen festgelegten Weg für fehlende Belege. Negativfälle machen diese Grenze messbar.

Die einfachste RAG-Demonstration beginnt mit einer Frage, deren Antwort eindeutig in einem Dokument enthalten ist. Der Retriever findet die relevante Passage, das Modell wandelt sie in eine benutzerfreundliche Antwort um, und das Ergebnis wirkt überzeugend.

Ich halte eine andere Frage während der Entwicklung für sinnvoller: Was passiert, wenn die Wissensdatenbank keine Antwort enthält? Dieser Fall zeigt, ob die Anwendung den Unterschied zwischen dem Finden von Ähnlichem und dem Finden ausreichender Belege versteht.

Auch eine nahegelegene Passage kann immer noch ein falscher Hinweis sein

Angenommen, ein Geschäft hat allgemeine Rückgabebedingungen, aber keine Informationen darüber, ob ein bestimmter, auf Bestellung gefertigter Artikel zurückgegeben werden kann. Eine Suchmaschine könnte die allgemeinen Bedingungen mit einem hohen Ähnlichkeitswert finden. Der Text ist zwar themenrelevant, stützt aber nicht unbedingt die konkrete Antwort.

Aus diesem Grund betrachte ich den Rang eines Suchergebnisses nicht als Erlaubnis zur Beantwortung. Bei der Anwendung muss berücksichtigt werden, was in der Frage gefragt wird, welche Tatsachen die Quelle tatsächlich belegt und was noch unbekannt ist.

In der ursprünglichen RAG-Veröffentlichung von Lewis und Kollegen wird die Kombination von Generierung mit abgerufenem externem Speicher beschrieben. Bei einer kundenorientierten Umsetzung müssen jedoch weiterhin produktspezifische Entscheidungen darüber getroffen werden, wann das abgerufene Material als ausreichend gilt.

Erstellen Sie vor der Optimierung der Pipeline einen Bewertungsdatensatz.

Ich beginne mit einer kleinen Auswahl repräsentativer Fragen und beschreibe das erwartete Verhalten. Die Beschreibung ist mehr als nur ein Wunschsatz. Sie umfasst, ob das System antworten, eine klärende Frage stellen oder die Angelegenheit an eine Person weiterleiten soll.

Bei einem Fall, auf den eine Antwort möglich ist, halte ich die zugrunde liegende Quelle und die zugelassenen Ansprüche fest. Bei einem Fall, auf den keine Antwort möglich ist, halte ich fest, was fehlt. Diese Unterscheidung hilft den Prüfern dabei, sich darauf zu einigen, warum eine Antwort angenommen oder abgelehnt wird.

  • Eine Frage, auf die es in einer Quelle eine direkte Antwort gibt.
  • Eine Frage, in der ein Synonym anstelle des Originalwortlauts verwendet wird.
  • Eine Frage zu einem Produkt, das nicht im Katalog aufgeführt ist.
  • Eine Frage, die eine Ausnahmeregelung erfordert, die in den Unterlagen nicht vorgesehen ist.
  • Eine Frage mit einer mehrdeutigen Bezugnahme, wie beispielsweise „das größere“.
  • Eine Frage, die sich lediglich auf ein veraltetes Dokument stützt.

Ich verwende schwierige, aber plausible Formulierungen. Künstlicher Unsinn lässt sich leicht zurückweisen und sagt wenig über realistische, unbegründete Fragen aus.

Unterscheide zwischen Abruffehlern und Antwortfehlern

Wenn die richtige Quelle nie abgerufen wurde, ist es unwahrscheinlich, dass eine Änderung der Antwortaufforderung das zugrunde liegende Problem behebt. Wenn die Quelle zwar abgerufen wurde, die Antwort jedoch eine Bedingung erfunden hat, funktioniert die Abrufphase möglicherweise einwandfrei.

Daher untersuche ich die Kandidatenauswahl, die Rangfolge, die Hinlänglichkeit der Belege und die endgültige Generierung jeweils separat. Ein einziger Gesamtgenauigkeitswert kann ein System verschleiern, das zwar gute Ergebnisse liefert, seine Belege jedoch häufig überbewertet.

Die Schwellenwerte sollten anhand des tatsächlichen Korpus und der Verteilung der Suchanfragen kalibriert werden. Ein Ähnlichkeitswert ist kein allgemeingültiger Konfidenzprozentsatz. Die geeignete Entscheidungsgrenze kann zudem zwischen einer allgemeinen beschreibenden Frage und einer Anfrage zu einem Preis oder einer Garantie variieren.

Machen Sie Unsicherheit für den Kunden nutzbar

Eine gute „Abstention“ erklärt die fehlenden Informationen und schlägt einen nächsten Schritt vor. Wenn die Produktvariante unklar ist, fragen Sie nach der Variante. Wenn die Richtlinie fehlt, leiten Sie die Frage an eine Person weiter, die über den entsprechenden Kontext verfügt.

Ich vermeide vage Aussagen wie „Da kann ich Ihnen nicht weiterhelfen“, wenn das System genau angeben kann, was benötigt wird. Das Ziel ist es, die Customer Journey aufrechtzuerhalten und gleichzeitig keine Fakten zu erfinden.

Bei der Bewertung unterscheide ich zwischen nicht unterstützten Antworten und unnötigen Enthaltungen. Die Anzahl der Ersteren zu reduzieren, indem jede Antwort als nicht hilfreich eingestuft wird, ist keine sinnvolle Verbesserung. Das System muss eine Antwort geben, wenn die Belege ausreichend sind, und erkennen, wenn dies nicht der Fall ist.

Ein negativer Testsatz verleiht dieser Grenze eine konkrete Form. Er wandelt die Aussage „Der Assistent sollte vorsichtig sein“ in Beispiele um, die das Entwicklerteam nach jedem aussagekräftigen Abruf oder jeder Änderung der Eingabeaufforderung ausführen kann.

Aktualisiert am 25. September 2026.