A promptban írt utasítás kérés, nem határ: egy elszánt felhasználó át tudja beszélni a modellt a „soha ne áruld el” utasításon. A guardrail a kikényszerítés — kód, ami blokkolja a prompt-injection-mintát, mielőtt a modellhez érne, ellenőrzi, hogy a válasz az engedélyezett forrásokból jött-e, és az „e-mailt küld” vagy „visszatérít” jellegű eszközhívásokat valódi jogosultságok mögé teszi.
A nyelvi modell becsületes modellje egy gyors, magabiztos, alkalmanként tévedő alkalmazott: annak sem adnád oda az adatbázis-jelszót felülvizsgálat nélkül. A guardrail ez a felülvizsgálat, ott megvalósítva, ahol a modell nem tudja kibeszélni maga mellől.
Kapcsolódó fogalmak
Prompt injection
Olyan támadás, amelyben a modell utasításként hajtja végre azt a szöveget, amit adatként kellett volna olvasnia.
Eszközhívás
Az a mechanizmus, amellyel a modell megkéri a körülötte futó alkalmazást, hogy futtasson egy megnevezett függvényt, és az eredményt szövegként kapja vissza.
Kiértékelés (evals)
Megismételhető tesztkészlet, amely megméri, hogy egy AI rendszeren végzett változtatás jobbá vagy rosszabbá tette-e — nem csak mássá.
Ide tartozó munkapad
KiberbiztonságPurple Team: ugyanaz az ember írja az exploitot és zárja be a rést. A legtöbb ügynökség csak véd, vagyis olyan fenyegetés ellen, amit senki nem tesztelt.
