A modellkimenetek nem determinisztikusak, és az „így jobbnak tűnik” nem éli túl a második véleményt. Egy eval készlet valósághű bemenetek rögzített gyűjteménye ismert jó válaszokkal vagy pontozási szempontokkal, automatikusan futtatva — így egy prompt, egy visszakeresési stratégia vagy egy modell megváltoztatása olyan számot ad, amit össze tudsz hasonlítani a tegnapival.
Ennek kihagyása a különbség egy javuló és egy elsodródó AI funkció között. Alapmérés nélkül nem derül ki, hogy az a promptmódosítás, ami egy panaszt megoldott, csendben elrontott három másik esetet, és nem lehet lelkesedésen túl megindokolni egy modellváltást. Egy szerény, valódi hibajegyekből épített eval készlet jobb, mint egy cizellált, fejből kitalált.
Kapcsolódó fogalmak
Hallucináció
Magabiztos, gördülékeny, teljesen kitalált válasz: egy hivatkozás, egy szám vagy egy API, ami nem létezik.
Nagy nyelvi modell (LLM)
Hatalmas szövegmennyiségen tanított modell, amely a következő szövegrészt jósolja meg — és kiderült, hogy ez elég íráshoz, összefoglaláshoz, fordításhoz és sokféle feladat végiggondolásához.
RAG (visszakereséssel bővített generálás)
Először megkeressük a releváns dokumentumokat, és beletesszük a promptba, így a modell a te anyagodból válaszol, nem a memóriájából.
Ide tartozó munkapad
AI automatizálásA heted ismétlődő fele átadva egy szoftvernek, ami nem unja meg. Levelezés szűrése, utánkövetés, riportok, adatmozgatás olyan eszközök között, amiket sosem terveztek együttműködésre.
