Laget et verktøy som hjelper til med å eliminere skjevhet i datasynet

Selv om kildene til skjevheter i AI-systemer er varierte, er en av hovedårsakene stereotyping.

bilder i store settdata samlet inn fra nettkilder som ingeniører bruker til å utvikle datasyn. Dette er en gren av AI som lar datamaskiner gjenkjenne mennesker, objekter og handlinger. Fordi grunnlaget for datasyn er bygget på disse datasettene, kan bilder som reflekterer sosiale stereotyper og skjevheter utilsiktet påvirke datasynsmodeller.

For å hjelpe til med å løse dette problemet i henneOpprinnelig har forskere ved Princeton Visual AI Lab utviklet et åpen kildekodeverktøy som automatisk oppdager potensielle korrupsjoner i visuelle datasett. Verktøyet lar datasettskapere og brukere korrigere problemer med underrepresentasjon eller stereotype bilder før bildesamlinger brukes til å trene datamaskinsynmodeller. I relatert arbeid publiserte medlemmer av Visual AI Lab en sammenligning av eksisterende skjevhetsforebyggende teknikker i datasynsmodeller selv og foreslo en ny, mer effektiv tilnærming til skjevhetsreduksjon.

Det første verktøyet, kalt REVISE, brukerstatistiske metoder for å undersøke et datasett for potensielle skjevheter eller underrepresentasjonsproblemer langs tre dimensjoner: objekt, kjønn og geografi. 

REVISE evaluerer innholdet i datasettet,ved hjelp av eksisterende bildekommentarer og målinger som antall objekter, sameksistens av objekter og mennesker og opprinnelsesland for bilder Blant disse målingene identifiserer verktøyet mønstre som skiller seg fra medianfordelingen.

I ett datasett identifiserte REVISE et potensialkjønnsforskjell i bilder som viser mennesker (røde rektangler) og orgelet til et musikkinstrument (blå rektangler). En analyse av fordelingen av de anslåtte tredimensjonale avstandene mellom en person og et organ viste at menn vanligvis ble avbildet som faktisk spilte instrumentet, mens kvinner ofte bare var i samme rom som instrumentet. Kreditt: Princeton Visual AI Lab.

For eksempel i et av de testede setteneREVISE data viste at bilder som involverer mennesker og blomster var forskjellig mellom menn og kvinner: menn var mer sannsynlig å dukke opp med blomster på seremonier eller møter, og kvinner var mer sannsynlig å dukke opp i scener eller malerier. 

Når verktøyet oppdager denne typenavvik, "oppstår spørsmålet om dette er et helt ufarlig faktum eller om det er noe viktigere på gang, og dette er veldig vanskelig å automatisere," forklarer Olga Rusakovskaya, assisterende professor i informatikk og hovedetterforsker ved Visual AI Lab.  

“Praksisen med å samle datasett på datamaskinenvitenskap til nylig har ikke blitt studert så grundig, avslutter medforfatter Angelina Wang, en kandidatstudent i informatikk. Hun forklarer at bilder for det meste er “fra Internett, og folk forstår ikke alltid at bildene deres blir brukt [i datasett]. Vi må samle bilder fra flere forskjellige grupper av mennesker og gjøre det med respekt. "

Les også:

Det er mulig å lage en termonukleær reaktor på jorden. Hva blir konsekvensene?

Dommedagsbreen viste seg å være farligere enn forskere trodde. Vi forteller det viktigste

På sykdomsdag 3 mister de fleste COVID-19 pasienter luktesansen og lider ofte av en rennende nese