A 2017-es „Attention Is All You Need” című tanulmány mutatta be: a szekvenciális olvasást figyelem váltotta — minden token egyszerre nézi az összes korábbit, és eldönti, melyik releváns. Ez a párhuzamosítás tette lehetővé az internetléptékű szövegen való tanítást.
Szinte minden, amit az iparág LLM-nek hív — a GPT-sorozat, Claude, Gemini, Llama — a következő tokenre tanított transformer. Az architektúra határai a mező határai: fix kontextusablak, beépített memória nélkül, és a hosszal nőő költség.
Kapcsolódó fogalmak
Nagy nyelvi modell (LLM)
Hatalmas szövegmennyiségen tanított modell, amely a következő szövegrészt jósolja meg — és kiderült, hogy ez elég íráshoz, összefoglaláshoz, fordításhoz és sokféle feladat végiggondolásához.
Kontextusablak
A legnagyobb szövegmennyiség, amit a modell egyszerre figyelembe tud venni — az utasításokkal, a beszélgetéssel és a válasszal együtt.
Token
Az egység, amit a nyelvi modell olvas és ír — szótöredék, szó vagy írásjel —, és az az egység, amiben a költségét és a kontextuslimitjét számolják.
