Generatyvūs varžovų tinklai ir jų trūkumai
Vos prieš kelerius metus šiuolaikiški modeliai šiuose
Tačiau dėl konkurencinio pobūdžioGAN modeliai yra labai nestabilūs treniruočių metu ir juos generuojant nerodoma labai didelė vaizdų tipų įvairovė. Be to, jie prastai pritaikomi kuriant vaizdus iš teksto, nors yra tokių pavyzdžių.
Vaizdo generavimo pagal StyleGAN 3 modelį rezultatai
Difuzijos modelių bumas
Priešingai, difuzijos modeliai turipakankamas generuojamų vaizdų kintamumas ir yra gana stabilūs. Pagrindinis jų trūkumas – mokymosi ir generavimo greitis. Modeliui išmokyti reikia dešimčių ar net šimtų vaizdo plokščių, o vaizdo generavimas naudojant jau išmokytą modelį užtrunka kelias sekundes, skirtingai nei GAN, kur skaičiavimas siekia keliasdešimt milisekundžių.
Generacijos rezultatai pagal Ho ir kt. difuzijos modelį
Difuzijos modelių bumą skatina išėjimasdideli generatyviniai teksto į vaizdą modeliai. Tikrai daugelis skaitytojų matė DALL·E 2, MidJourney, Imagen arba Stable Diffusion sukurtus rezultatus. Kai kurie menininkai ir iliustratoriai nerimauja, kad neuroniniai tinklai atims jų darbą, o kiti mano, kad tai tik padės kūrybiniame procese. Programuotojai ir menininkai įvaldo greitą inžineriją – teksto atrankos meną, kad būtų gauti tikslesni generavimo rezultatai – ir dalijasi įdomiais prašymais bei ne mažiau įdomiais rezultatais.
Lofi ateivių invazija atsipalaiduoti ir mokytis (Midjourney neuroniniame tinkle)
XVII a. paveikslas „The Beatles“ (Model Stable Diffusion 2.1)
Drakono vaisius, nešiojantis karatė diržą sniege (Imagen modelis)
Kaip veikia difuzijos modeliai?
Difuzijos modeliai yra iteraciniai modeliai, kuriepriimti atsitiktinį triukšmą kaip įvestį. Pirmiausia apsvarstykite pagrindinį difuzijos modelį DDPM (Denoising Diffusion Probabilistic Model), kurį pateikė Ho ir kt. Šis modelis žingsnis po žingsnio yra apmokomas šimtų tūkstančių vaizdų pavyzdyje, kur kiekviename žingsnyje vaizdui iš mėginio taikomas atsitiktinis tam tikro žinomo stiprumo triukšmas, o modelis išmoksta pakeisti šį triukšmą, taip pagerindamas vaizdo kokybę. Jei tokiu būdu ištreniruotą modelį pakartotinai pritaikytume visiškai atsitiktinio triukšmo paveikslui, kiekviename žingsnyje apversdami „silpną“ triukšmą, modelis gali generuoti visiškai naują vaizdą, palaipsniui atsikratydamas atsitiktinio triukšmo – panaudodamas atgalinę difuziją.
Pagrindinio difuzijos proceso iliustracija (iš CVPR 2022 mokymo programos)
Atsitiktinis triukšmas, dėl kurio atsirandavaizdas gali būti derinamas su sąlyga – reikalavimu rezultatui, išreikštu tekstu ar kitu pavyzdiniu vaizdu. Pirmiausia pažiūrėkime į pavyzdį iš SDEdit straipsnio, kur vartotojas nurodo neuroniniam tinklui brėžinį, kurį sudaro dideli potėpiai. Šis piešinys yra dar toks triukšmingas, kad jo negalima atskirti nuo, pavyzdžiui, triukšmingos nuotraukos, tada taikomas pasikartojantis atgalinės difuzijos procesas, kuris pagal pateiktą piešinį atkuria aukštos kokybės vaizdą.
Modeliu pagrįsto difuzijos proceso iliustracija (iš SDEdit straipsnio)
Kitas būdas nukreipti kartą į norimąrezultatas yra modelio sąlygojimas tekstu. Tam naudojami kalbos modeliai, mokomi vaizdų porų ir jų antraštes, kurios gali suprasti vaizdų ir tekstų reikšmę vienu metu. Tokio modelio pavyzdys yra OpenAI išleistas CLIP (Contrastive Language – Image Pre-training). Šis modelis gali išversti vaizdus ir tekstus į bendrą latentinę vektorinę erdvę (kur vektorius yra tik kai kurių reikšmių stulpelis). Šioje erdvėje, pavyzdžiui, galima rasti tam tikros tekstinės užklausos artimiausius vaizdus, nes tai tik algebrinė vektorių operacija.
Latentinės difuzijos modelis,2021 m. pristatytas modelis vektorinėje tekstų erdvėje, kad būtų generuojami vaizdai iš kryptinio triukšmo. Šiame modelyje naudojamos bendros latentinės tekstų ir vaizdų erdvės savybės. Šiuo principu veikia stabilios difuzijos, „Imagen“ ir kiti dideli teksto į vaizdą neuroniniai tinklai.
Kitas svarbus būdas pagerinti kokybękartos, naudojamos treniruojant sąlyginės difuzijos modelius, yra gairės be klasifikatoriaus. Paprastais žodžiais tariant, kuo didesnė laisvo klasifikatoriaus orientavimo parametro reikšmė, tuo rezultatas labiau primena tekstinę užklausą, o tai dažnai reiškia mažesnį rezultatų kintamumą.
Difuzijos modelių problemos
Žinoma, difuzijos modeliai nėrauniversalus įvaizdžio generavimo problemos sprendimas. Jie vis dar susiduria su tomis pačiomis problemomis kaip ir GAN – iš pirmo žvilgsnio realūs vaizdai turi didelių trūkumų – sukurti žmonės gali turėti daugiau nei penkis pirštus arba 32 dantis. Be to, šie modeliai gana prastai generuoja tekstą ant vaizdų ir netgi sugalvoja savo „kalbą“.
Menininkai kaltina Midjourney ir stabilumo AI(įmonei už „Stable Diffusion“) už autorių teisių pažeidimą rengiant mokymo duomenis – jie teigia, kad įmonės atsisiuntė vaizdus iš interneto be menininkų sutikimo ar tinkamo atlyginimo. Taip pat didėja susirūpinimas, kad generatyvūs tinklai, įskaitant stabilią sklaidą, stiprina neigiamus stereotipus apie rasę, lytį ir kitas socialines problemas, nes jie mokomi remiantis šališkais duomenimis, gautais iš interneto.
Adomo ir Ievos, Nojaus ir Dzeuso istorija DC komiksų stiliumi (modelis DALL·E 2)
Kaip išbandyti nemokamai
Skirtingai nuo daugelio ankstesnių įvykiųkompiuterinio matymo sritis, kurios dažnai buvo prieinamos tik programuotojams, naujas technologijas difuzijos tinklų srityje dažnai gali išbandyti visi. Bendra atvirojo kodo programinės įrangos ir neuroninių tinklų demonstracinių versijų publikavimo tendencija leidžia pradedantiesiems, tokiems kaip Hugging Face, sujungti daugybę modelių versijų, pavyzdžiui, Stable Diffusion 2.1. Jie taip pat kuria difuzorių biblioteką, kuri skirta supaprastinti modelių naudojimą kode.
„Google Colab“ paslauga leidžia paleisti kodąGPU ir TPU, todėl daugelis entuziastų naudoja juos skelbdami savo modelio versijas, pavyzdžiui, Disco Diffusion Warp modelį, kuris gali pakeisti vaizdo įrašo stilių.
Taip pat yra patogios sąsajos su modeliais.Taigi, MidJourney neuroninis tinklas turi nemokamą bandomąją versiją kelioms dešimtims kartų, kurios pakanka norint išbandyti teksto į vaizdą modelius. „OpenAI“ taip pat suteikia bandomąją prieigą prie DALL·E 2 modelio.
Kas toliau
Galime drąsiai teigti, kad išgyvename aukso amžiųneuroninio tinklo vaizdo generavimo era. Bendruomenė nekantriai laukia būsimų „Google“ produktų, kurie išleido privačios sklaidos modelį „Imagen“ ir daugybę straipsnių apie vaizdų redagavimą ir generavimą, įskaitant kitų dirbtinio intelekto technologijų naudojimą.
Kūrimo srityje atsiranda naujų startuolių irvaizdų redagavimas, kuris sėkmingai konkuruoja su tokiais milžinais kaip OpenAI ar Google. Nauji straipsniai apie difuzijos modelius skelbiami beveik kas savaitę, o jų taikymo sritis šiandien neapsiriboja išvardintomis 2D kompiuterinio matymo užduotimis – jie naudojami atliekant medicininio vaizdavimo užduotis, vaizdo įrašų generavimą ir 3D tekstą.
Skaityti daugiau:
Atskleidžiama raudonų juostelių ant Jupiterio palydovo paslaptis
Rasta „neįmanoma“ planeta. Ji nepaiso šiuolaikinio mokslo
Paslaptingi šešiakampiai „koriai“ druskos dykumose rado paaiškinimą