Kako umjetna inteligencija stvara slike. ML inženjer objašnjava

Generativne kontradiktorne mreže i njihovi nedostaci

Prije samo nekoliko godina, najsuvremeniji modeli u ovim

Zadaće su bile generativne suparničke mreže (GAN), koje je 2014. predložio Goodfellow i sur., a znatno su poboljšane u posljednjih devet godina.Na primjer, StyleGAN 3 iz 2021. točno zadržava detalje lica, čak i pri pomicanju i okretanju, dok njegovi prethodnici generirajuU ovom slučaju, "bučni" detalji, kao što su kosa, brade ili uzorci na odjeći.Profesionalci i entuzijasti podjednako su se čudili koliko dobro GAN-ovi mogu generirati fotografije nepostojećih ljudi, životinja ili stanova.

Međutim, zbog natjecateljske prirodeGAN modeli su vrlo nestabilni u obuci i ne pokazuju veliku raznolikost tipova slika kada se generiraju. Osim toga, slabo su primjenjivi u zadatku generiranja slika iz teksta, iako postoje primjeri za to.

Rezultati generiranja slike modelom StyleGAN 3

Boom u difuzijskim modelima

Difuzijski modeli, naprotiv, imajudovoljnu varijabilnost generiranih slika i prilično su stabilne. Glavni im je nedostatak brzina učenja i generiranja. Deseci ili čak stotine video kartica potrebni su za treniranje modela, a generiranje slike pomoću već treniranog modela traje nekoliko sekundi, za razliku od GAN-a, gdje se broj ide do desetaka milisekundi.

Generacija je rezultat difuzijskog modela Ho et al

Bum oko difuzijskih modela potaknut je izlazomveliki generativni modeli teksta u sliku. Sigurno su mnogi čitatelji vidjeli rezultate koje generiraju DALL·E 2, MidJourney, Imagen ili Stable Diffusion. Neki umjetnici i ilustratori brinu se da će im neuronske mreže oduzeti rad, dok drugi vjeruju da će to samo pomoći u kreativnom procesu. Programeri i umjetnici ovladavaju brzim inženjeringom - umijećem odabira teksta za dobivanje preciznijih rezultata generiranja - i dijele zanimljive zahtjeve i ništa manje zanimljive rezultate.

Lofi invazija vanzemaljaca za opuštanje i učenje (Midjourney neuronska mreža) 

Slika Beatlesa iz 17. stoljeća (Model Stable Diffusion 2.1)

Zmajevo voće s karate pojasom na snijegu (Imagen model)

Kako funkcioniraju modeli difuzije?

Difuzijski modeli su iterativni modeli kojiprihvatiti slučajni šum kao ulaz. Za početak, razmotrite najosnovniji model difuzije, DDPM (Denoising Diffusion Probabilistic Model), koji su predstavili Ho et al. Ovaj se model uvježbava korak po korak na uzorku od stotina tisuća slika, pri čemu se nasumični šum neke poznate jačine primjenjuje na sliku iz uzorka u svakom koraku, a model uči preokrenuti taj šum, čime se poboljšava kvaliteta slike. Ako iterativno primijenimo obučeni model na ovaj način na sliku potpuno slučajnog šuma, invertirajući "slabi" šum na svakom koraku, model može generirati potpuno novu sliku, postupno se oslobađajući slučajnog šuma - koristeći povratnu difuziju.

Ilustracija osnovnog procesa difuzije (iz vodiča CVPR 2022) 

Slučajna buka iz koje se generira slika može se kombinirati s uvjetom - zahtjevom za rezultatom, izraženim tekstom ili drugom oglednom slikom.Prvo, pogledajmo primjer iz članka SDEdit, gdje korisnik navodiOvaj trisun je dodatno bučan do te mjere da se ne može razlikovati, na primjer, odbučna fotografija, a zatim se primjenjuje iterativni postupak obrnute difuzije, koji se vraćaVisokokvalitetna slika na temelju navedene slike. 

Ilustracija procesa difuzije vođene uzorkom (iz članka SDEdit)

Još jedan način usmjeravanja generacije na željenorezultat je uvjetovanost modela tekstom. Da bi se to postiglo, koriste se jezični modeli, obučeni na parovima slika i opisima uz njih, koji mogu razumjeti značenje slika i teksta u isto vrijeme. Primjer takvog modela je CLIP (Contrastive Language - Image Pre-training) koji je objavio OpenAI. Ovaj model može prevesti slike i tekstove u zajednički latentni vektorski prostor (gdje je vektor samo stupac nekih vrijednosti). U ovom prostoru postaje, na primjer, moguće pronaći slike najbliže nekom tekstualnom upitu, budući da je to samo algebarska operacija na vektorima.

Model latentne difuzije,uveden 2021. uvjetuje model na vektorskom prostoru tekstova za generiranje slika iz usmjerenog šuma. Ovaj model koristi svojstva zajedničkog latentnog prostora teksta i slike. Stable Diffusion, Imagen i druge velike neuronske mreže teksta u sliku rade na ovom principu.

Još jedna važna tehnika koja poboljšava kvalitetugeneracija koja se koristi u obuci modela uvjetovane difuzije je navođenje bez klasifikatora. Jednostavnim rječnikom rečeno, što je veća vrijednost parametra slobodnog navođenja klasifikatora, to više rezultat nalikuje tekstualnom upitu, što često dovodi do manje varijabilnosti u rezultatima.

Problemi difuzijskih modela

Naravno, difuzijski modeli nisuuniverzalno rješenje za problem generiranja slike. I dalje su podložni istim problemima kao i GAN-ovi - na prvi pogled stvarne slike imaju značajne nedostatke - generirani ljudi mogu imati više od pet prstiju ili 32 zuba. Također, ovi modeli su prilično loši u generiranju teksta na slikama, pa čak i izmišljaju vlastiti “jezik”.

Umjetnici optužuju Midjourney and Stability AI (tvrtku koja razvija Stable Diffusion) za kršenje autorskih prava u pripremi podataka za obuku - tvrde da su tvrtke preuzimale slike s Interneta bez pristanka umjetnika i odgovarajuće naknade.Također se mnogo govori o tome kako se generativne mreže, uključujući stabilnu difuziju, pogoršavajuNegativni stereotipi o rasi, spolu i drugim društvenim pitanjima, jer su obučeni za svjesno pristrane podatke dobivene s Interneta. 

Priča o Adamu i Evi, Noi i Zeusu u stilu DC Comicsa (DALL model· E 2) 

Kako isprobati besplatno

Za razliku od mnogih prethodnih dostignuća u računalnom vidu, koja su često bila dostupna samo programerima, najčešće se mogu pojaviti nove tehnologije u području difuzijskih mrežaOpći trend softvera otvorenog koda i objavljivanje demo verzija neuronskih mreža omogućuje vam dastartupi kao što je Hugging Face za objedinjavanje mnogih verzija modela, kao što je Stabilna difuzija 2.1.Oni također razvijaju biblioteku difuzora, koja je dizajnirana da pojednostavi uporabu modela u kodu. 

Сервис Google Colab позволяет запускать код на GPU i TPU, tako da ga mnogi entuzijasti koriste za objavljivanje svojih verzija modela, na primjer, model Disco Diffusion Warp, koji može promijeniti stil videa. 

Tu su i prikladna sučelja za modele.Dakle, neuronska mreža MidJourney ima besplatnu probnu verziju za nekoliko desetaka generacija, što je dovoljno za isprobavanje modela teksta u sliku. OpenAI također nudi probni pristup modelu DALL·E 2.

Što je sljedeće

Sa sigurnošću možemo reći da proživljavamo zlatno dobadoba generiranja slike neuronske mreže. Zajednica željno iščekuje buduće proizvode od Googlea, koji je objavio model privatne difuzije Imagen i veliki broj članaka o uređivanju i stvaranju slika, uključujući korištenje drugih tehnologija umjetne inteligencije. 

Pojavljuju se novi startupi u području kreiranja iuređivanje slika koje se uspješno natječe s divovima kao što su OpenAI ili Google. Novi članci o difuzijskim modelima objavljuju se gotovo svaki tjedan, a opseg njihove primjene danas nije ograničen na navedene zadatke 2D računalnog vida - koriste se u zadacima medicinske slike, generiranju videa i 3D teksta. 

Čitaj više:

Misterij crvenih pruga na Jupiterovom satelitu je otkriven

Pronađen "nemogući" planet. Ona prkosi modernoj znanosti

Misteriozno šesterokutno "saće" u slanim pustinjama našlo je objašnjenje