DFIELDSOLUTIONS

AI és nyelvi modellek

FogalomtárMultimodális modell

Modell, ami szövegnél többet fogad és ad — képet, hangot, dokumentumot —, így a „mi a baj ezen a fotón” vagy a „olvasd ki ezt a számlát” egyetlen hívás.

A korai chatbotok szöveget kaptak, szöveget adtak; a multimodális modellek szemet és fület kaptak. Ugyanaz az architektúra, ami a következő tokent jósolja, képfoltokat vagy hangkereteket is kezel, így a felhasználó lefotózhat egy hibás alkatrészt, blokkot vagy képernyőképet, és a valóban látottakhoz igazított választ kap.

A gyakorlatban összeomlanak a korábban OCR + szabályok + ember hármasát igénylő csővezetékek: dokumentumfelvétel, kárbejelentés, akadálymentes leírás. A fenntartások a bemenettel skálázódnak — a kép több tokenbe kerül, mint amilyennek látszik, és ami kiolvassa a számládat, az ki tudja olvasni azt is, amit nem kéne.

Kapcsolódó fogalmak

Ide tartozó munkapad

Generatív AI

Stable Diffusion és ComfyUI bekötve oda, ahol a tartalmad valójában készül, finomhangolt modellel, hogy minden úgy nézzen ki, mint te.

Minden fogalomKezdjünk beszélgetniMarkdown-változat

DField Bt. · Dunakeszi · dezso@dfieldsolutions.com
5,0
“LinkedIn üzenettől az élő oldalig. Két apró javítás, aztán kész.”Michael J Ringer · Vilya ProtectionAlapító · Spanyolország