A diffúziós modellt zajtalanításra tanítják: egyre zajosabb képet látva megtanulja visszaállítani a tisztábbat. Tiszta szinből visszafelé futtatva, szöveges prompt által vezetve, ebből a képességből lesz a képgenerálás — a modell „meglátja” a zajban a leíráshoz illő képet.
Mivel lokálisan és nyíltan futnak, a diffúziós modellek a kereskedelmi képmunka gyakorlati gerince: stíluskonzisztens illusztrációk, termékmockupok, kitöltés és javítás. A kontrollmechanizmusok — mélységtérkép, élvezérlés, referenciakép — teszik a „szép képből” „használható assetet”.
Kapcsolódó fogalmak
Stable Diffusion
Nyílt súlyú képmodellek családja, amelyek úgy állítanak elő képet, hogy egy véletlen kiindulásból ismételten zajt távolítanak el, szöveges leírás vezetésével.
ComfyUI
Csomópont-alapú felület képgeneráláshoz, ahol a pipeline explicit gráf, nem pedig szövegdoboz rejtett alapértelmezésekkel.
Multimodális modell
Modell, ami szövegnél többet fogad és ad — képet, hangot, dokumentumot —, így a „mi a baj ezen a fotón” vagy a „olvasd ki ezt a számlát” egyetlen hívás.
Ide tartozó munkapad
Generatív AIStable Diffusion és ComfyUI bekötve oda, ahol a tartalmad valójában készül, finomhangolt modellel, hogy minden úgy nézzen ki, mint te.
