Генеративне супарничке мреже и њихови недостаци
Пре само неколико година, најсавременији модели у овим
Међутим, због такмичарске природеГАН модели су веома нестабилни у обуци и не показују велику разноликост типова слика када се генеришу. Поред тога, они су слабо применљиви у задатку генерисања слика из текста, иако постоје примери за то.
Резултати генерисања слике помоћу модела СтилеГАН 3
Бум у дифузионим моделима
Дифузиони модели, напротив, имајудовољну варијабилност генерисаних слика и прилично су стабилне. Њихов главни недостатак је брзина учења и генерисања. Десетине или чак стотине видео картица су потребне за обуку модела, а генерисање слике помоћу већ обученог модела траје неколико секунди, за разлику од ГАН-а, где број иде на десетине милисекунди.
Генерисање резултати из дифузионог модела Хо ет ал
Бум око дифузијских модела је подстакнут излазомвелики генеративни модели текста у слику. Сигурно су многи читаоци видели резултате које генерише ДАЛЛ·Е 2, МидЈоурнеи, Имаген или Стабле Диффусион. Неки уметници и илустратори брину да ће им неуронске мреже одузети рад, док други верују да ће то само помоћи у креативном процесу. Програмери и уметници савладавају брзи инжењеринг – уметност одабира текста да би добили прецизније резултате генерисања – и деле занимљиве захтеве и ништа мање занимљиве резултате.
Лофи инвазија ванземаљаца за опуштање и учење (неурална мрежа Мидјоурнеи)&нбсп;
Слика Битлса из 17. века (Модел Стабле Диффусион 2.1)
Змајево воће са карате појасом у снегу (Имаген модел)
Како функционишу модели дифузије?
Дифузиони модели су итеративни модели којиприхвати насумични шум као улаз. За почетак, размотрите најосновнији модел дифузије, ДДПМ (Деноисинг Диффусион Пробабилистиц Модел), који су представили Хо ет ал. Овај модел се обучава корак по корак на узорку од стотина хиљада слика, где се насумични шум неке познате јачине примењује на слику из узорка у сваком кораку, а модел учи да преокрене овај шум, чиме се побољшава квалитет слике. Ако итеративно применимо обучени модел на овај начин на слику потпуно насумичне буке, инвертујући „слабу“ буку на сваком кораку, модел може да генерише потпуно нову слику, постепено се ослобађајући насумичне буке – користећи повратну дифузију.
Илустрација основног процеса дифузије (из упутства за ЦВПР 2022)&нбсп;
Случајни шум из којег се генеришеслика се може комбиновати са условом - захтевом за резултат, израженим у тексту или другом примеру слике. Прво, погледајмо пример из чланка СДЕдит, где корисник указује неуронској мрежи на цртеж који се састоји од великих потеза. Овај цртеж је додатно бучан до те мере да се не може разликовати од, на пример, бучне фотографије, а затим се примењује итеративни процес повратне дифузије, који реконструише слику високог квалитета на основу датог цртежа.&нбсп;
Илустрација процеса дифузије вођеног шаблоном (из СДЕдит чланка)
Још један начин да усмерите генерацију ка жељеномрезултат је условљеност модела текстом. Да би се то урадило, користе се језички модели, обучени на паровима слика и натписа према њима, који су у стању да разумеју значење слика и текстова у исто време. Пример таквог модела је ЦЛИП (Цонтрастиве Лангуаге - Имаге Пре-траининг) који је објавио ОпенАИ. Овај модел је у стању да преведе слике и текстове у заједнички латентни векторски простор (где је вектор само колона неких вредности). У овом простору постаје, на пример, могуће пронаћи слике најближе неком текстуалном упиту, пошто је ово само алгебарска операција над векторима.
Модел латентне дифузије,уведен 2021. условљава модел на векторском простору текстова за генерисање слика из усмереног шума. Овај модел користи својства заједничког латентног простора текстова и слика. Стабле Диффусион, Имаген и друге велике неуронске мреже текст-слика раде на овом принципу.
Још једна важна техника која побољшава квалитетгенерација која се користи у моделима условљене дифузије за обуку је вођење без класификатора. Једноставно речено, што је већа вредност параметра слободног навођења класификатора, то више резултат подсећа на текстуални упит, што се често преводи у мању варијабилност у резултатима.
Проблеми дифузијских модела
Наравно, дифузиони модели нисууниверзално решење за проблем генерисања слике. И даље су подложни истим проблемима као и ГАН - на први поглед, стварне слике имају значајне недостатке - генерисани људи могу имати више од пет прстију или 32 зуба. Такође, ови модели су прилично лоши у генерисању текста на сликама, па чак и измишљају сопствени „језик“.
Уметници криве Мидјоурнеи и стабилност АИ(компанија која стоји иза Стабле Диффусион-а) због кршења ауторских права у припреми података о обуци – тврде да су компаније преузимале слике са интернета без сагласности уметника или одговарајуће надокнаде. Такође расте забринутост да генеративне мреже, укључујући Стабле Диффусион, јачају негативне стереотипе о раси, полу и другим друштвеним питањима јер су обучени на пристрасним подацима добијеним са интернета.&нбсп;
Прича о Адаму и Еви, Ноју и Зевсу у стилу ДЦ Цомицс-а (модел ДАЛЛ·Е 2)&нбсп;
Како пробати бесплатно
За разлику од многих претходних развоја уобласти компјутерског вида које су често биле доступне само програмерима, нове технологије у области дифузионих мрежа често могу испробати сви. Општи тренд ка софтверу отвореног кода и објављивању демо верзија неуронских мрежа омогућава стартапима као што је Хуггинг Фаце да агрегирају многе верзије модела, на пример, Стабле Диффусион 2.1. Такође развијају библиотеку дифузора, која је дизајнирана да поједностави коришћење модела у коду.&нбсп;
Услуга Гоогле Цолаб вам омогућава да покренете кодГПУ и ТПУ, па га многи ентузијасти користе за објављивање својих верзија модела, на пример, Дисцо Диффусион Варп модела, који може да промени стил видеа.&нбсп;
Постоје и погодни интерфејси за моделе.Дакле, неуронска мрежа МидЈоурнеи има бесплатну пробну верзију за неколико десетина генерација, што је довољно да испробате моделе текст-слика. ОпенАИ такође пружа пробни приступ моделу ДАЛЛ·Е 2.
Шта је следеће
Са сигурношћу можемо рећи да доживљавамо златно добаера генерисања слике неуронске мреже. Заједница жељно ишчекује будуће производе од Гугла, који је објавио приватни модел дифузије Имаген и велики број чланака о уређивању и генерисању слика, укључујући коришћење других технологија вештачке интелигенције.&нбсп;
Појављују се нови стартапови у области креирања иуређивање слика које се успешно такмичи са гигантима као што су ОпенАИ или Гоогле. Нови чланци о дифузионим моделима објављују се скоро сваке недеље, а обим њихове примене данас није ограничен само на наведене задатке 2Д компјутерског вида – користе се у задацима медицинског снимања, генерисању видео записа и 3Д текста.&нбсп;
Опширније:
Откривена је мистерија црвених пруга на сателиту Јупитера
Пронађена "немогућа" планета. Она пркоси модерној науци
Мистериозно шестоугаоно „саће“ у сланим пустињама нашло је објашњење