DFIELDSOLUTIONS

Playbook

LaborPrompt injection éles agentekben

A prompt injection nem egy hiba egy javítással. Öt támadási kategória, mindegyikhez más védelem tartozik, és éppen ezért kapnak sebezhetőségi jelentést két héttel az indulás után azok a csapatok, amelyek egyszer beraknak egy input-szanitizálást.

Prompt injection éles agentekben

Playbook6 rész · 2 percÍrta: Dezső Mező.mdLLMPrompt injectionOWASPRAG

Ez a stúdió teljes playbookjának rövidített változata. Az alábbi kategóriák mindegyike valóban más támadás, valóban más elhárítással, és éppen az a visszatérő hiba, ha egyetlen problémaként kezeljük őket.

01Közvetlen injection

Valaki beír egy utasítást a chatablakba, a rendszerpromptodat célozva. A védelmek ismertek: válaszd el a rendszer- és a felhasználói tartalmat, jelöld ki egyértelműen az utasítás-hierarchiát, és tarts fenn elutasítási mintákat. Nem az a hiba, hogy ezt nem tudják, hanem hogy egyszer megcsinálják, és soha többé nem tesztelik.

02Közvetett injection dokumentumon át

Az utasítás a felhasználó által feltöltött fájlban vagy az agent által letöltött oldalon érkezik. A felhasználó semmi ellenségeset nem gépelt. Amit a modell olvas, de nem a felhasználó írt, azt tartalomként kell kezelni, nem utasításként.

03RAG-index mérgezés

A payload magába a keresési indexbe kerül, így később más felhasználóknál és más kérdéseknél bukkan fel. Ez túléli a deployt, és épp ettől rosszabb az első kettőnél.

04Tool-hívás visszaélés

Az injection nem a válaszra megy, hanem az eszközökre. A jogosultságnak az eszköz határán kell lennie, felhasználónként ellenőrizve, nem egy olyan beszélgetésből következtetve, amelynek egy részét a támadó írta.

05Kiszivárogtatás a megjelenített válaszon át

Az adat azon távozik, amit a válasz megjelenít: egy link, egy képforrás, egy markdown hivatkozás a támadó szerverére. A válasz tartalmának ellenőrzése nem elég, ha aztán korlátozás nélkül rendereled.

06Teszteld CI-ban

Mind az öt kategória helye egy eval harness, ami minden változtatásnál lefut, ugyanazért, amiért a unit teszteké. Az a védelem, amit senki nem ellenőriz újra, csendben elromlik.

Amit érdemes elvinni

  • Öt kategória, öt védelem. Egy szanitizáló ezek közül egyet fed le.
  • Amit a modell olvas, de nem a felhasználó írt, az mind nem megbízható.
  • A jogosultság az eszköz határán legyen, felhasználónként, ne a promptban.
  • Korlátozd, mit rendereltethet a válasz, ne csak azt, mit mondhat.
  • Futtasd mind az ötöt evalként CI-ban, különben a védelmek csendben elavulnak.
Ezt is megépítjükKiberbiztonság

Teljes írás elolvasása

Több a laborból

Összes bejegyzés

Megnézzük ugyanezt a te rendszereden?Kezdjünk bele

DField Bt. · Dunakeszi · dezso@dfieldsolutions.com
5,0
“LinkedIn üzenettől az élő oldalig. Két apró javítás, aztán kész.”Michael J Ringer · Vilya ProtectionAlapító · Spanyolország