Behandle abgerufene Anweisungen als nicht vertrauenswürdige Daten

Halten Sie Anweisungen aus Dokumenten, Websites und Tool-Ergebnissen davon ab, Autorität über die Aufgaben, Werkzeuge oder Zielauswahl eines Agenten zu erlangen.

Ein Agent, der ein Unternehmen recherchiert, kann eine Seite lesen, die sowohl nützliche Unternehmensinformationen als auch einen Satz enthält, der automatisierte Leser anweist, ihre Aufgabe zu ignorieren. Die Seite kann legitime Beweise über das Unternehmen liefern, während sie keine Autorität hat, den Assistenten zu steuern.

Dies ist die Grenze, die ich möchte, dass ein Agentensystem bewahrt: abgerufenes Material wird in die zugewiesene Aufgabe eingegeben. Es wird nicht zu einer neuen Instruktionsquelle, nur weil es im Kontext eines Modells erscheint.

Autorität kommt von der Anwendungsgrenze

Prompt-Injection kann Anweisungen in Dokumente, Webseiten oder andere Inhalte einfügen, die ein Agent konsumiert. Eine bösartige Anweisung könnte den Agenten auffordern, Kontext offenzulegen, ein nicht verwandtes Ziel zu kontaktieren oder sein Ziel zu ändern. Das Filtern verdächtiger Formulierungen kann helfen, ist jedoch keine vollständige Sicherheitsgrenze.

Ich würde Quellbeschriftungen durch Abruf und Zusammenfassung beibehalten und die Laufzeitverantwortung für die Überprüfung vorgeschlagener Aktionen übertragen. Das Modell sollte genügend Kontext erhalten, um zu verstehen, dass ein Abschnitt Beweismittel ist, während die Anwendung weiterhin durchsetzt, welche Operationen und Ziele erlaubt sind.

Für die Unternehmensforschung, die mit meinem Solarindustrie-Verzeichnis, PVFirms, verbunden ist, können externe Seiten nützliche Quellenmaterialien bereitstellen. Ihr Inhalt sollte die unterstützten Unternehmensbeschreibungen beeinflussen, nicht die Zugriffsregeln des Forschungssystems oder die Veröffentlichungsautorisierung.

Überprüfen Sie, was das System verlässt

Stellen Sie sich vor, dass eine Seite einen „Verifizierungsschritt“ beschreibt, der erfordert, dass die gesamte Konversation an anderer Stelle eingereicht wird. Diese Anweisung macht das Ziel nicht relevant oder die Offenlegung autorisiert. Die Anwendung sollte unabhängig entscheiden, ob eine ausgehende Aktion zu der Aufgabe gehört.

Eine praktische Überprüfung umfasst das ausgewählte Tool, das Ziel, die gesendeten Daten und den Kontobereich. Ein erlaubtes Netzwerktool kann dennoch missbraucht werden, wenn es gestattet ist, nicht verwandte private Informationen zu übertragen. Eng gefasste Tools und explizite Zielrichtlinien erleichtern die Durchsetzung dieser Frage.

Die Autorisierung sollte auch erneut bewertet werden, wenn die Aktion ausgeführt wird. Ein harmlos aussehender Forschungsschritt kann zu einem folgenschweren Folgeereignis führen, wenn das System einfach jede nächste vom Modell vorgeschlagene Aktion akzeptiert.

Bewahren Sie die Quelle durch Transformationen

Eine unsichere Anweisung kann ihre Warnhinweise verlieren, wenn ein anderer Agent sie zusammenfasst. „Die Seite sagt, die Datei zu senden“ kann nach der Kompression des Kontexts zu „die Datei senden“ werden. Die Zusammenfassung hat versehentlich den berichteten Inhalt in einen Imperativ geändert.

Ich möchte, dass Zusammenfassungen bewahren, wer etwas gesagt hat und warum es aufgenommen wurde. Das ist ein Grund, warum Gedächtnis Herkunft und Umfang benötigt. Eine Behauptung sollte nicht an Autorität gewinnen, nur weil das System sie sich gemerkt hat.

Das Gleiche gilt für extrahierte Felder. Ein Feld mit dem Namen „empfohlene Aktion“ aus einem externen Dokument bleibt die Empfehlung des Dokumentautors. Es in einem strukturierten Objekt zu benennen, verwandelt es nicht in einen von der Anwendung genehmigten Vorgang.

Testen Sie realistische Grenzen

Ich würde feindliche Anweisungen in ansonsten nützlichem Quellmaterial einfügen und dann die resultierenden Aktionen überprüfen, anstatt nur den endgültigen Text. Ein System kann eine beruhigende endgültige Antwort liefern, nachdem es bereits einen unbefugten Anruf getätigt hat.

Die Überprüfung sollte auch subtile Umleitungen beinhalten: eine Quelle, die nach zusätzlichen Daten fragt, ein Tool-Ergebnis, das eine neue Berechtigung beansprucht, oder ein Dokument, das eine Anleitung als Teil des normalen Arbeitsablaufs präsentiert. Diese Beispiele testen, ob die Anwendung Autorität bewahrt, nicht ob das Modell einen bestimmten Ausdruck erkennt.

Klare Tool-Verträge helfen dabei, die zulässige Reaktion zu definieren, wenn die Quelle verdächtig oder unzureichend ist. Der Agent sollte in der Lage sein, die relevanten Beweise weiterhin zu nutzen, um Klarstellung zu bitten oder eine spezifische Aktion zu stoppen, ohne die gesamte Quelle automatisch als vertrauenswürdig zu behandeln.

Das Ziel ist ein nützliches Forschungssystem mit kontrollierten Aktionen. Eine abgerufene Seite kann eine faktische Frage beantworten, während sie nicht in der Lage ist, die Regeln der Aufgabe zu ändern.

Aktualisiert am 30. September 2026.