# Multimodális modell

> Modell, ami szövegnél többet fogad és ad — képet, hangot, dokumentumot —, így a „mi a baj ezen a fotón” vagy a „olvasd ki ezt a számlát” egyetlen hívás.

A korai chatbotok szöveget kaptak, szöveget adtak; a multimodális modellek szemet és fület kaptak. Ugyanaz az architektúra, ami a következő tokent jósolja, képfoltokat vagy hangkereteket is kezel, így a felhasználó lefotózhat egy hibás alkatrészt, blokkot vagy képernyőképet, és a valóban látottakhoz igazított választ kap.

A gyakorlatban összeomlanak a korábban OCR + szabályok + ember hármasát igénylő csővezetékek: dokumentumfelvétel, kárbejelentés, akadálymentes leírás. A fenntartások a bemenettel skálázódnak — a kép több tokenbe kerül, mint amilyennek látszik, és ami kiolvassa a számládat, az ki tudja olvasni azt is, amit nem kéne.

## Kapcsolódó fogalmak

- https://dfieldsolutions.hu/hu/fogalomtar/llm.md
- https://dfieldsolutions.hu/hu/fogalomtar/ocr.md
- https://dfieldsolutions.hu/hu/fogalomtar/speech-to-text.md

---

Source: https://dfieldsolutions.hu/hu/fogalomtar/multimodal
DField Solutions — Dunakeszi, Hungary — dezso@dfieldsolutions.com
Booking: see https://dfieldsolutions.hu/en/contact
