Disse skumle falske menneskene varsler en ny tidsalder innen AI

syntetiske mennesker

Med tillatelse fra Datagen





Du kan se de svake skjeggstubbene som kommer inn på overleppen, rynkene i pannen, flekkene på huden. Han er ikke en ekte person, men han er ment å etterligne en – det samme er de hundretusener av andre laget av Datagen, et selskap som selger falske, simulerte mennesker.

Disse menneskene er ikke spillavatarer eller animerte figurer for filmer. De er syntetiske data designet for å gi næring til den økende appetitten til dyplæringsalgoritmer. Firmaer som Datagen tilbyr et overbevisende alternativ til den dyre og tidkrevende prosessen med å samle inn data fra den virkelige verden. De vil lage det for deg: hvordan du vil ha det, når du vil – og relativt billig.

For å generere sine syntetiske mennesker, Datagen først skanner faktiske mennesker. Det samarbeider med leverandører som betaler folk for å gå inn i gigantiske helkroppsskannere som fanger opp hver eneste detalj fra irisene til hudteksturen til fingrenes krumning. Oppstarten tar deretter rådataene og pumper dem gjennom en rekke algoritmer, som utvikler 3D-representasjoner av en persons kropp, ansikt, øyne og hender.



Selskapet, som er basert i Israel, sier at det allerede jobber med fire store amerikanske teknologigiganter, selv om det ikke vil avsløre hvilke på posten. Dens nærmeste konkurrent, Syntese AI , tilbyr også on-demand digitale mennesker. Andre selskaper genererer data som skal brukes i finansiere , forsikring , og helsevesen . Det er omtrent like mange syntetiske dataselskaper ettersom det finnes typer data.

En gang sett på som mindre ønskelig enn ekte data, blir syntetiske data nå av noen sett på som et universalmiddel. Ekte data er rotete og full av skjevheter. Nye regler for personvern gjør det vanskelig å samle inn. Derimot er syntetiske data uberørte og kan brukes til å bygge flere forskjellige datasett. Du kan produsere perfekt merkede ansikter, for eksempel av forskjellige aldre, former og etnisiteter for å bygge et ansiktsgjenkjenningssystem som fungerer på tvers av populasjoner.

Men syntetiske data har sine begrensninger. Hvis den ikke reflekterer virkeligheten, kan den ende opp med å produsere enda verre AI enn rotete, partiske data fra den virkelige verden – eller den kan ganske enkelt arve de samme problemene. Det jeg ikke vil gjøre er å gi tommelen opp til dette paradigmet og si: 'Å, dette vil løse så mange problemer,' sier Cathy O'Neil, en dataforsker og grunnlegger av det algoritmiske revisjonsfirmaet ORCAA. For det vil også ignorere mange ting.



Realistisk, ikke ekte

Dyplæring har alltid handlet om data. Men de siste årene har AI-miljøet lært det god data er viktigere enn stor data . Selv små mengder av de riktige, renmerkede dataene kan gjøre mer for å forbedre ytelsen til et AI-system enn 10 ganger mengden ukuraterte data, eller til og med en mer avansert algoritme.

Det endrer måten selskaper bør nærme seg utviklingen av AI-modellene sine på, sier Datagens administrerende direktør og medgründer, Ofir Chakon. I dag starter de med å innhente så mye data som mulig og deretter finjustere og justere algoritmene for bedre ytelse. I stedet burde de gjøre det motsatte: bruk den samme algoritmen mens de forbedrer sammensetningen av dataene deres.

Datagen genererer også falske møbler og innemiljøer for å sette sine falske mennesker i sammenheng.



DATAGEN

Men å samle inn virkelige data for å utføre denne typen iterative eksperimentering er for kostbart og tidkrevende. Det er her Datagen kommer inn. Med en syntetisk datagenerator kan team lage og teste dusinvis av nye datasett om dagen for å identifisere hvilken som maksimerer en modells ytelse.

For å sikre realismen til dataene sine, gir Datagen sine leverandører detaljerte instruksjoner om hvor mange individer som skal skanne i hver aldersgruppe, BMI-område og etnisitet, samt en liste over handlinger de skal utføre, som å gå rundt i et rom eller drikker en brus. Leverandørene sender tilbake både statiske high-fidelity-bilder og bevegelsesfangstdata for disse handlingene. Datagens algoritmer utvider deretter disse dataene til hundretusenvis av kombinasjoner. De syntetiserte dataene blir noen ganger deretter sjekket på nytt. Falske ansikter plottes mot ekte ansikter, for eksempel for å se om de virker realistiske.

Datagen genererer nå ansiktsuttrykk for å overvåke førervåkenhet i smarte biler, kroppsbevegelser for å spore kunder i kassefrie butikker, og iris og håndbevegelser for å forbedre øye- og håndsporingsfunksjonene til VR-headset. Selskapet sier at dataene deres allerede har blitt brukt til å utvikle datasynssystemer som betjener titalls millioner brukere.



Det er ikke bare syntetiske mennesker som blir masseprodusert. Klikk-Ins er en oppstart som bruker syntetisk AI for å utføre automatiserte kjøretøyinspeksjoner. Ved å bruke designprogramvare gjenskaper den alle bilmerker og modeller som AI trenger å gjenkjenne, og gjengir dem deretter med forskjellige farger, skader og deformasjoner under forskjellige lysforhold, mot forskjellige bakgrunner. Dette lar selskapet oppdatere sin AI når bilprodusenter legger ut nye modeller, og hjelper det å unngå brudd på datapersonvernet i land der skiltene anses som privat informasjon og dermed ikke kan være til stede i bilder som brukes til å trene AI.

Click-Ins gjengir biler av forskjellige merker og modeller mot forskjellige bakgrunner.

KLIKK-INN

Mest.ai samarbeider med finans-, telekommunikasjons- og forsikringsselskaper for å levere regneark med falske klientdata som lar selskaper dele kundedatabasen sin med eksterne leverandører på en lovlig måte. Anonymisering kan redusere et datasetts rikdom, men likevel mislykkes i å beskytte folks personvern tilstrekkelig. Men syntetiske data kan brukes til å generere detaljerte falske datasett som deler de samme statistiske egenskapene som et selskaps virkelige data. Den kan også brukes til å simulere data som selskapet ennå ikke har, inkludert en mer mangfoldig kundepopulasjon eller scenarier som uredelig aktivitet.

Tilhengere av syntetiske data sier at det også kan bidra til å evaluere AI. I en fersk artikkel publisert på en AI-konferanse, Suchi Saria, en førsteamanuensis i maskinlæring og helsevesen ved Johns Hopkins University, og hennes medforfattere demonstrerte hvordan datagenereringsteknikker kan brukes til å ekstrapolere forskjellige pasientpopulasjoner fra et enkelt sett med data. Dette kan være nyttig hvis for eksempel et selskap bare hadde data fra New York Citys mer ungdommelige befolkning, men ønsket å forstå hvordan AI presterer på en aldrende befolkning med høyere forekomst av diabetes. Hun starter nå sitt eget selskap, Bayesian Health, som vil bruke denne teknikken til å teste medisinske AI-systemer.

Grensene for å forfalske det

Men er syntetiske data overhypet?

Når det gjelder personvern, bare fordi dataene er 'syntetiske' og ikke direkte samsvarer med ekte brukerdata, betyr det ikke at de ikke koder for sensitiv informasjon om virkelige mennesker, sier Aaron Roth, professor i informatikk og informasjonsvitenskap ved University of Pennsylvania. Noen datagenereringsteknikker har vist seg å reprodusere bilder eller tekst som finnes i treningsdataene, for eksempel, mens andre er sårbare for angrep som får dem til å gjengi dataene fullstendig.

Dette kan være greit for et firma som Datagen, hvis syntetiske data ikke er ment å skjule identiteten til personene som samtykket til å bli skannet. Men det ville være dårlige nyheter for selskaper som tilbyr sin løsning som en måte å beskytte sensitiv finansiell eller pasientinformasjon på.

Året deepfakes ble mainstream I 2020 begynte AI-syntetiske medier å bevege seg bort fra de mørkere hjørnene av internett.

Forskning tyder på at kombinasjonen av to syntetiske datateknikker spesielt – differensielt personvern og generative kontradiktoriske nettverk – kan produsere den sterkeste personvernbeskyttelsen, sier Bernease Herman, en dataforsker ved University of Washington eScience Institute. Men skeptikere bekymrer seg for at denne nyansen kan gå tapt i markedsføringsspråket til leverandører av syntetiske data, som ikke alltid vil være åpent om hvilke teknikker de bruker.

I mellomtiden tyder lite bevis på at syntetiske data effektivt kan redusere skjevheten til AI-systemer. For det første gir ekstrapolering av nye data fra et eksisterende datasett som er skjevt ikke nødvendigvis data som er mer representative. Datagens rådata inneholder for eksempel proporsjonalt færre etniske minoriteter, noe som betyr at den bruker færre reelle datapunkter for å generere falske mennesker fra disse gruppene. Selv om generasjonsprosessen ikke er helt gjetting, kan de falske menneskene fortsatt ha større sannsynlighet for å avvike fra virkeligheten. Hvis ansiktene dine med mørkere hudtoner ikke er spesielt gode tilnærminger til ansikter, så løser du faktisk ikke problemet, sier O'Neil.

For en annen, perfekt balanserte datasett blir ikke automatisk oversatt til helt rettferdige AI-systemer, sier Christo Wilson, en førsteamanuensis i informatikk ved Northeastern University. Hvis en kredittkortutlåner prøvde å utvikle en AI-algoritme for å score potensielle låntakere, ville det ikke eliminert all mulig diskriminering ved å representere hvite mennesker så vel som svarte mennesker i dataene sine. Diskriminering kan fortsatt snike seg inn gjennom forskjeller mellom hvite og svarte søkere.

For å komplisere saken ytterligere, viser tidlig forskning at det i noen tilfeller kanskje ikke engang er mulig å oppnå begge private og rettferdig AI med syntetiske data. I en fersk artikkel publisert på en AI-konferanse, forsøkte forskere fra University of Toronto og Vector Institute å gjøre det med røntgen av thorax. De fant ut at de ikke var i stand til å lage et nøyaktig medisinsk AI-system da de prøvde å lage et mangfoldig syntetisk datasett gjennom kombinasjonen av forskjellig personvern og generative motstridende nettverk.

Ingenting av dette betyr at syntetiske data ikke skal brukes. Faktisk kan det godt bli en nødvendighet. Ettersom regulatorer konfronterer behovet for å teste AI-systemer for lovlig overholdelse, kan det være den eneste tilnærmingen som gir dem fleksibiliteten de trenger for å generere målrettede testdata på forespørsel, sier O’Neil. Men det gjør spørsmål om begrensningene enda viktigere å studere og svare på nå.

Syntetiske data vil sannsynligvis bli bedre over tid, sier hun, men ikke ved et uhell.

gjemme seg