# Kiértékelés (evals)

> Megismételhető tesztkészlet, amely megméri, hogy egy AI rendszeren végzett változtatás jobbá vagy rosszabbá tette-e — nem csak mássá.

A modellkimenetek nem determinisztikusak, és az „így jobbnak tűnik” nem éli túl a második véleményt. Egy eval készlet valósághű bemenetek rögzített gyűjteménye ismert jó válaszokkal vagy pontozási szempontokkal, automatikusan futtatva — így egy prompt, egy visszakeresési stratégia vagy egy modell megváltoztatása olyan számot ad, amit össze tudsz hasonlítani a tegnapival.

Ennek kihagyása a különbség egy javuló és egy elsodródó AI funkció között. Alapmérés nélkül nem derül ki, hogy az a promptmódosítás, ami egy panaszt megoldott, csendben elrontott három másik esetet, és nem lehet lelkesedésen túl megindokolni egy modellváltást. Egy szerény, valódi hibajegyekből épített eval készlet jobb, mint egy cizellált, fejből kitalált.

## Kapcsolódó fogalmak

- https://dfieldsolutions.hu/hu/fogalomtar/hallucination.md
- https://dfieldsolutions.hu/hu/fogalomtar/llm.md
- https://dfieldsolutions.hu/hu/fogalomtar/rag.md

---

Source: https://dfieldsolutions.hu/hu/fogalomtar/llm-evaluation
DField Solutions — Dunakeszi, Hungary — dezso@dfieldsolutions.com
Booking: see https://dfieldsolutions.hu/en/contact
