DFIELDSOLUTIONS

AI és nyelvi modellek

FogalomtárAI-guardrailek

A modell körüli ellenőrzések, amik korlátozzák, mit mondhat és tehet — bemeneti szűrők, kimeneti validálás, jogosultságos eszközök —, hogy a rossz válasz biztonságosan bukjon.

A promptban írt utasítás kérés, nem határ: egy elszánt felhasználó át tudja beszélni a modellt a „soha ne áruld el” utasításon. A guardrail a kikényszerítés — kód, ami blokkolja a prompt-injection-mintát, mielőtt a modellhez érne, ellenőrzi, hogy a válasz az engedélyezett forrásokból jött-e, és az „e-mailt küld” vagy „visszatérít” jellegű eszközhívásokat valódi jogosultságok mögé teszi.

A nyelvi modell becsületes modellje egy gyors, magabiztos, alkalmanként tévedő alkalmazott: annak sem adnád oda az adatbázis-jelszót felülvizsgálat nélkül. A guardrail ez a felülvizsgálat, ott megvalósítva, ahol a modell nem tudja kibeszélni maga mellől.

Kapcsolódó fogalmak

Ide tartozó munkapad

Kiberbiztonság

Purple Team: ugyanaz az ember írja az exploitot és zárja be a rést. A legtöbb ügynökség csak véd, vagyis olyan fenyegetés ellen, amit senki nem tesztelt.

Minden fogalomKezdjünk beszélgetniMarkdown-változat

DField Bt. · Dunakeszi · dezso@dfieldsolutions.com
5,0
“LinkedIn üzenettől az élő oldalig. Két apró javítás, aztán kész.”Michael J Ringer · Vilya ProtectionAlapító · Spanyolország