A korai chatbotok szöveget kaptak, szöveget adtak; a multimodális modellek szemet és fület kaptak. Ugyanaz az architektúra, ami a következő tokent jósolja, képfoltokat vagy hangkereteket is kezel, így a felhasználó lefotózhat egy hibás alkatrészt, blokkot vagy képernyőképet, és a valóban látottakhoz igazított választ kap.
A gyakorlatban összeomlanak a korábban OCR + szabályok + ember hármasát igénylő csővezetékek: dokumentumfelvétel, kárbejelentés, akadálymentes leírás. A fenntartások a bemenettel skálázódnak — a kép több tokenbe kerül, mint amilyennek látszik, és ami kiolvassa a számládat, az ki tudja olvasni azt is, amit nem kéne.
Kapcsolódó fogalmak
Nagy nyelvi modell (LLM)
Hatalmas szövegmennyiségen tanított modell, amely a következő szövegrészt jósolja meg — és kiderült, hogy ez elég íráshoz, összefoglaláshoz, fordításhoz és sokféle feladat végiggondolásához.
OCR
Optikai karakterfelismerés — a képen lévő szöveg valódi szöveggé alakítása, hogy a beolvasott számla, blokk és űrlap adat legyen, ne kép.
Beszéd-szöveg átalakítás
Beszélt hang írott szöveggé átirata modell segítségével — a hangjegyzetek, hívásösszefoglalók és „beszélj a géphez” felületek bemeneti vége.
Ide tartozó munkapad
Generatív AIStable Diffusion és ComfyUI bekötve oda, ahol a tartalmad valójában készül, finomhangolt modellel, hogy minden úgy nézzen ki, mint te.
