Behandel Opgehaalde Instructies als Onbetrouwbare Gegevens

Houd instructies die in documenten, websites en toolresultaten worden gevonden, tegen dat ze autoriteit krijgen over de taken, tools of bestemmingskeuzes van een agent.

Een agent die onderzoek doet naar een bedrijf, kan een pagina lezen die zowel nuttige bedrijfsinformatie bevat als een zin die geautomatiseerde lezers vertelt hun taak te negeren. De pagina kan legitiem bewijs zijn over het bedrijf, terwijl het geen autoriteit heeft om de assistent te controleren.

Dit is de grens die ik wil dat een agentensysteem behoudt: opgehaald materiaal is input voor de toegewezen taak. Het wordt geen nieuwe instructiebron alleen omdat het binnen de context van een model verschijnt.

Autoriteit komt van de toepassingsgrens

Promptinjectie kan instructies in documenten, webpagina’s of andere inhoud plaatsen die een agent consumeert. Een kwaadaardige instructie kan de agent vragen om context te onthullen, een niet-gerelateerde bestemming te contacteren of zijn doelstelling te veranderen. Het filteren van verdachte formuleringen kan helpen, maar het is geen volledige beveiligingsgrens.

Ik zou bronnlabels behouden via retrieval en samenvatting, en de runtime verantwoordelijk maken voor het controleren van voorgestelde acties. Het model zou voldoende context moeten ontvangen om te begrijpen dat een passage bewijs is, terwijl de applicatie nog steeds afdwingt welke bewerkingen en bestemmingen zijn toegestaan.

Voor bedrijfsresearch verbonden met mijn zonne-energie-industrie directory, PVFirms, kunnen externe pagina’s nuttig bronmateriaal bieden. Hun inhoud zou de beschrijvingen van ondersteunde bedrijven moeten beïnvloeden, niet de toegangsregels van het research systeem of de publicatieautoriteit.

Controleer wat het systeem verlaat

Stel je voor dat een pagina een “verificatiestap” beschrijft waarbij het volledige gesprek ergens anders moet worden ingediend. Die instructie maakt de bestemming niet relevant of de openbaarmaking niet geautoriseerd. De applicatie moet onafhankelijk beslissen of enige uitgaande actie tot de taak behoort.

Een praktische beoordeling behandelt de geselecteerde tool, de bestemming, de verzonden gegevens en de reikwijdte van het account. Een toegestane netwerkt tool kan nog steeds verkeerd worden gebruikt als het is toegestaan om niet-gerelateerde privé-informatie te verzenden. Smalle tools en expliciete bestemmingsbeleid maken die vraag gemakkelijker te handhaven.

Autorisatie moet ook opnieuw worden geëvalueerd wanneer de actie wordt uitgevoerd. Een onschuldig ogende onderzoeksstap kan leiden tot een ingrijpende follow-up als het systeem eenvoudigweg elke volgende actie accepteert die door het model wordt voorgesteld.

Behoud de bron door transformaties

Een onveilige instructie kan zijn waarschuwingssignalen verliezen wanneer een andere agent deze samenvat. “De pagina zegt om het bestand te verzenden” kan worden “verzend het bestand” nadat de context is samengeperst. De samenvatting heeft per ongeluk gerapporteerde inhoud veranderd in een imperatief.

Ik wil dat samenvattingen behouden wie iets heeft gezegd en waarom het is opgenomen. Dat is een reden waarom geheugen provenance en scope nodig heeft. Een bewering zou geen autoriteit moeten krijgen alleen omdat het systeem het heeft onthouden.

Hetzelfde geldt voor geëxtraheerde velden. Een veld genaamd “aanbevolen actie” uit een extern document blijft de aanbeveling van de documentauteur. Het benoemen ervan binnen een gestructureerd object verandert het niet in een door de applicatie goedgekeurde operatie.

Test realistische grenzen

Ik zou vijandige instructies opnemen in anders nuttig bronmateriaal, en vervolgens de resulterende acties controleren in plaats van alleen de uiteindelijke tekst. Een systeem kan een geruststellend eindantwoord produceren nadat het al een ongeautoriseerde oproep heeft gedaan.

De beoordeling moet ook subtiele herdirection bevatten: een bron die om aanvullende gegevens vraagt, een toolresultaat dat een nieuwe toestemming claimt, of een document dat een instructie presenteert als onderdeel van de normale workflow. Deze voorbeelden testen of de applicatie autoriteit behoudt, niet of het model een bepaalde zin herkent.

Duidelijke toolcontracten helpen de toegestane reactie te definiëren wanneer de bron verdacht of onvoldoende is. De agent moet in staat zijn om het relevante bewijs te blijven gebruiken, om verduidelijking te vragen of een specifieke actie te stoppen zonder de hele bron automatisch als betrouwbaar te beschouwen.

Het doel is een nuttig onderzoekssysteem met gecontroleerde acties. Een opgehaalde pagina kan een feitelijke vraag beantwoorden terwijl het niet in staat is de regels van de taak te veranderen.

Bijgewerkt op 30 september 2026.