A számítógép számokat hasonlít össze, nem jelentést. Egy embedding modell néhány száz vagy néhány ezer számmá alakít egy mondatot, és úgy van tanítva, hogy két ilyen lista távolsága azt tükrözze, mennyire kapcsolódik egymáshoz a két mondat. A „hogyan mondhatom le az előfizetésem” közel kerül a „hol van a leiratkozás gomb” mondathoz, pedig alig van közös szavuk.
Ettől működik a szemantikus keresés, és ezért rontja el a kulcsszavas és az embedding alapú keresés épp az ellenkező módon. A kulcsszavas keresés elhibázza azt az ügyfelet, aki más szavakat használt. Az embedding megtalálja, viszont néha olyasmit ad vissza, ami csak ugyanarról a témáról szól, de nem válaszol a kérdésre. Az éles rendszerek általában mindkettőt futtatják, és összefésülik az eredményt.
Kapcsolódó fogalmak
RAG (visszakereséssel bővített generálás)
Először megkeressük a releváns dokumentumokat, és beletesszük a promptba, így a modell a te anyagodból válaszol, nem a memóriájából.
Vektoradatbázis
Olyan adatbázis, amely gyorsan megtalálja azokat a tárolt elemeket, amelyek embeddingje a legközelebb esik a kérdéséhez, akár több millió sor között.
Nagy nyelvi modell (LLM)
Hatalmas szövegmennyiségen tanított modell, amely a következő szövegrészt jósolja meg — és kiderült, hogy ez elég íráshoz, összefoglaláshoz, fordításhoz és sokféle feladat végiggondolásához.
Ide tartozó munkapad
AI automatizálásA heted ismétlődő fele átadva egy szoftvernek, ami nem unja meg. Levelezés szűrése, utánkövetés, riportok, adatmozgatás olyan eszközök között, amiket sosem terveztek együttműködésre.
