Für wen das ist
Teams mit einem Support-Postfach oder einem Shop, die einen Assistenten wollen, der aus der eigenen Wissensbasis, dem Katalog und den Richtlinien antwortet. Vielleicht gibt es schon ein Chat-Widget oder einen Pilot bei einem Anbieter; was fehlt, ist, dass er bei echten Kunden standhält.
Das ist dieselbe Arbeit wie an Conviro, der Support-Plattform, die ich als einziger Engineer entworfen, gebaut und betrieben habe: Webchat, WhatsApp und Instagram in einem Posteingang, mit Retrieval, Antwortvalidierung und Übergabe an einen Menschen.
Typische Situationen
- Der Pilot antwortet in Demos gut und bei echten Kunden falsch zu Preisen, Bestand oder Lieferung.
- Ein Ausfall bei einem Anbieter legt den ganzen Assistenten lahm, und niemand weiß, was er in der Zwischenzeit gesagt hat.
- Der Assistent unterscheidet nicht zwischen einem niederländischen und einem türkischen Kunden oder zwischen Einzelhandels- und Großhandelsrichtlinien.
- Die Support-Mitarbeiter trauen den vorgeschlagenen Antworten nicht und ignorieren sie.
- Das Modell soll handeln, etwa eine Bestellung nachschlagen oder eine Retoure anlegen, aber nicht unkontrolliert.
- Niemand kann sagen, was ein Monat Assistent pro Mandant oder pro Gespräch kostet.
Was ich liefere
- Retrieval über Ihre Dokumente, den Katalog und frühere Gespräche: hybride Suche auf PostgreSQL (Volltext plus Vektoren), mit Filtern pro Mandant, Sprache und Markt.
- Antwortvalidierung vor der Auslieferung: Preise, Links, Produktkennungen und Richtlinienaussagen werden gegen die abgerufenen Quellen geprüft; unbelegte Aussagen werden zurückgehalten oder an einen Menschen übergeben.
- Modell-Routing über Anbieter hinter einem Vertrag, mit Fallback, Circuit Breakern und Budgets pro Mandant.
- Tool-Nutzung mit serverseitiger Autorisierung: das Modell schlägt vor, die Anwendung prüft Rechte, Umfang und Argumente, bevor etwas läuft, und jede Aktion hinterlässt eine Audit-Spur.
- Kanalintegration: Webchat, WhatsApp, Instagram oder E-Mail in einem Gesprächsmodell, mit Webhook-Empfängern, die Duplikate und verspätete Events vertragen.
- Evaluationsfälle und Regressionsprüfungen, die durch den Produktionspfad laufen, damit eine Änderung an Prompt, Modell oder Quellen gemessen ist, bevor sie live geht.
Wie es abläuft
Die Gespräche lesen. Ich beginne mit echten Transkripten, der Wissensbasis und dem Katalog und schreibe auf, welche Fragen der Assistent beantworten muss, welche er ablehnen muss und welchen Beleg jede braucht.
Den Pfad von Anfang bis Ende bauen. Retrieval, Routing, Validierung und Übergabe, in Ihrem Stack oder daneben, mit Evaluationsfällen ab der ersten Woche und einem Staging-Mandanten zum Testen.
Mit Messung live gehen. Vor dem Start laufen zurückgehaltene Gespräche und eine kleine Gruppe echter Nutzer, wir beheben, was scheitert, und legen fest, was danach überwacht wird. Im Retainer betreibe ich es weiter.