Alınan Talimatları Güvenilmeyen Veri Olarak Değerlendirin

Belgelerde, web sitelerinde ve araç sonuçlarında bulunan talimatların, bir ajanın görevleri, araçları veya varış yeri seçimleri üzerinde otorite haline gelmesini engelleyin.

Bir işletmeyi araştıran bir ajan, hem faydalı şirket bilgilerini içeren hem de otomatik okuyuculara görevlerini göz ardı etmeleri için bir cümle içeren bir sayfa okuyabilir. Bu sayfa, işletme hakkında geçerli bir kanıt olabilirken, asistanı kontrol etme yetkisine sahip değildir.

Bu, bir ajan sisteminin korumasını istediğim sınırdır: elde edilen malzeme, atanan göreve girdi olarak kullanılır. Bir modelin bağlamında yer aldığı için yeni bir talimat kaynağı haline gelmez.

Yetki, uygulama sınırından gelir.

Prompt enjeksiyonu, bir ajanın tükettiği belgeler, web sayfaları veya diğer içeriklerin içine talimatlar yerleştirebilir. Kötü niyetli bir talimat, ajandan bağlamı ifşa etmesini, alakasız bir hedefle iletişim kurmasını veya amacını değiştirmesini isteyebilir. Şüpheli ifadeleri filtrelemek yardımcı olabilir, ancak bu tam bir güvenlik sınırı değildir.

Kaynak etiketlerini geri alma ve özetleme yoluyla koruyacak ve önerilen eylemleri kontrol etme sorumluluğunu çalışma zamanına vereceğim. Model, bir pasajın kanıt olduğunu anlaması için yeterli bağlam almalı, ancak uygulama yine de hangi işlemlerin ve varış noktalarının izin verildiğini zorunlu kılmalıdır.

Güneş enerjisi endüstrisi dizinim, PVFirms ile bağlantılı şirket araştırmaları için, dış sayfalar faydalı kaynak materyali sağlayabilir. İçerikleri, desteklenen şirket tanımlarını etkilemeli, araştırma sisteminin erişim kurallarını veya yayın yetkisini değil.

Sistemi terk edenleri kontrol et

Bir sayfanın, tam konuşmanın başka bir yere gönderilmesini gerektiren bir “doğrulama adımı”nı tanımladığını hayal edin. Bu talimat, varış noktasını ilgili kılmamakta veya ifşayı yetkilendirmemektedir. Uygulama, herhangi bir dışa dönük eylemin göreve ait olup olmadığına bağımsız olarak karar vermelidir.

Pratik bir inceleme, seçilen aracı, hedefi, gönderilen veriyi ve hesap kapsamını kapsar. İzin verilen bir ağ aracı, alakasız özel bilgilerin iletilmesine izin verildiğinde yine de kötüye kullanılabilir. Dar araçlar ve açık hedef politikaları bu sorunun uygulanmasını kolaylaştırır.

Eylem gerçekleştirildiğinde yetkilendirme yeniden değerlendirilmelidir. Masum görünen bir araştırma adımı, sistemin model tarafından önerilen her bir sonraki eylemi basitçe kabul etmesi durumunda önemli bir takip eylemine yol açabilir.

Dönüşümler aracılığıyla kaynağı koruyun

Bir güvenli olmayan talimat, başka bir ajanın onu özetlemesi durumunda uyarı işaretlerini kaybedebilir. “Sayfa dosyayı göndermeyi söylüyor” ifadesi, bağlam sıkıştırıldığında “dosyayı gönder” haline gelebilir. Özet, kazara bildirilen içeriği bir emir cümlesine dönüştürmüştür.

Özetlerin, bir şeyin kim tarafından söylendiğini ve neden dahil edildiğini korumasını istiyorum. Bu, hafızanın köken ve kapsam gerektirmesi için bir sebeptir. Bir iddia, sistemin onu hatırladığı için otorite kazanmamalıdır.

Çıkarılan alanlar için de aynı durum geçerlidir. Bir dış belgeden alınan “önerilen eylem” adlı bir alan, belgenin yazarının önerisi olarak kalır. Bunu yapılandırılmış bir nesne içinde adlandırmak, onu uygulama onaylı bir işlem haline getirmez.

Gerçekçi sınırları test et

Aksi takdirde yararlı kaynak materyalin içine düşmanca talimatlar eklerdim, ardından yalnızca son metni değil, ortaya çıkan eylemleri kontrol ederdim. Bir sistem, zaten yetkisiz bir arama yaptıktan sonra güven verici bir son cevap üretebilir.

Gözden geçirme, aynı zamanda ince bir yönlendirme de içermelidir: ek veri talep eden bir kaynak, yeni bir izin iddia eden bir araç sonucu veya normal iş akışının bir parçası olarak bir talimat sunan bir belge. Bu örnekler, uygulamanın otoriteyi koruyup korumadığını test eder, belirli bir ifadeyi tanıyıp tanımadığını değil.

Açık araç sözleşmeleri, kaynağın şüpheli veya yetersiz olduğunda izin verilen yanıtı tanımlamaya yardımcı olur. Ajan, ilgili kanıtları kullanmaya devam edebilmeli, açıklama isteyebilmeli veya belirli bir eylemi durdurabilmeli, tüm kaynağı otomatik olarak güvenilir olarak değerlendirmeden.

Amaç, kontrollü eylemlerle faydalı bir araştırma sistemi oluşturmaktır. Elde edilen bir sayfa, görevin kurallarını değiştiremese de bir nesnel soruyu yanıtlayabilir.

30 Eylül 2026’da güncellendi.