211service.com
OpenAIs fiksjonsspende AI lærer å generere bilder
Ben Barry / OpenAI
I februar i fjor, det San Francisco-baserte forskningslaboratoriet OpenAI annonsert at AI-systemet nå kunne skrive overbevisende avsnitt på engelsk. Mat begynnelsen av en setning eller avsnitt inn i GPT-2, som det ble kalt, og den kunne fortsette tanken like lenge som et essay med nesten menneskelignende sammenheng.
Nå undersøker laboratoriet hva som ville skje hvis den samme algoritmen i stedet ble matet med en del av et bilde. Resultatene , som ble gitt en hederlig omtale for beste artikkel på denne ukens internasjonale konferanse om maskinlæring, åpner opp en ny vei for bildegenerering, moden med muligheter og konsekvenser.
I kjernen er GPT-2 en kraftig prediksjonsmotor. Den lærte å forstå strukturen til det engelske språket ved å se på milliarder av eksempler på ord, setninger og avsnitt, skrapet fra hjørnene av internett. Med den strukturen kan den deretter manipulere ord til nye setninger ved statistisk å forutsi rekkefølgen de skal vises i.
Så forskere ved OpenAI bestemte seg for å bytte ut ordene med piksler og trene den samme algoritmen på bilder i ImageNet, den mest populære bildebanken for dyp læring. Fordi algoritmen ble designet for å fungere med endimensjonale data (dvs. tekststrenger), foldet de ut bildene til en enkelt sekvens med piksler. De fant ut at den nye modellen, kalt iGPT, fortsatt var i stand til å forstå de todimensjonale strukturene til den visuelle verdenen. Gitt sekvensen av piksler for den første halvdelen av et bilde, kan det forutsi andre halvdel på måter som et menneske ville anse som fornuftige.
Nedenfor kan du se noen eksempler. Kolonnen lengst til venstre er inngangen, kolonnen lengst til høyre er originalen, og de midterste kolonnene er iGPTs antatte fullføringer. (Se flere eksempler her .)
OPENAIResultatene er oppsiktsvekkende imponerende og viser en ny vei for bruk av uovervåket læring, som trener på umerkede data, i utviklingen av datasynssystemer. Mens tidlige datasynssystemer på midten av 2000-tallet prøvde slike teknikker før, falt de i unåde da overvåket læring, som bruker merkede data, viste seg å være langt mer vellykket. Fordelen med uovervåket læring er imidlertid at det lar et AI-system lære om verden uten et menneskelig filter, og reduserer det manuelle arbeidet med å merke data betydelig.
Det faktum at iGPT bruker samme algoritme som GPT-2 viser også dens lovende tilpasningsevne. Dette er i tråd med OpenAIs ultimate ambisjon for å oppnå mer generaliserbar maskinintelligens.
Samtidig presenterer metoden en bekymringsfull ny måte å lage dypfalske bilder på. Generative kontradiktoriske nettverk , den vanligste kategorien av algoritmer som tidligere ble brukt til å lage dype forfalskninger, må trenes på svært kuraterte data. Hvis du ønsker å få en GAN til å generere et ansikt, for eksempel, bør treningsdataene bare inkludere ansikter. iGPT, derimot, lærer ganske enkelt nok om strukturen til den visuelle verden på tvers av millioner og milliarder av eksempler til å spytte ut bilder som muligens kan eksistere i den. Selv om opplæringen av modellen fortsatt er beregningsmessig dyr, og den tilbyr en naturlig barriere for tilgangen, vil det kanskje ikke være tilfellet på lenge.
OpenAI innvilget ikke en intervjuforespørsel, men i et internt møte i policyteamet som MIT Technology Review deltok på i fjor, funderte dets policydirektør, Jack Clark, over de fremtidige risikoene ved generering av GPT-stil, inkludert hva som ville skje hvis det ble brukt på Bilder. Video kommer, sa han, og projiserer hvor han så feltets forskningsbane gå. Om sannsynligvis fem år vil du ha betinget videogenerering over en horisont på fem til ti sekunder. Deretter fortsatte han med å beskrive hva han forestilte seg: du ville mate inn et bilde av en politiker og en eksplosjon ved siden av dem, og det ville generere en sannsynlig utgang av at politikeren ble drept.
Oppdater: Denne artikkelen har blitt oppdatert for å fjerne navnet på politikeren i det hypotetiske scenariet beskrevet til slutt.