211service.com
Et nytt sett med bilder som lurer AI kan bidra til å gjøre det mer hackersikkert
fotografi som viser en sopp, øyenstikker og ekorn, alle feilmerket som kringle, kumlokk og sjøløve Unsplash: Florian Van Duyn / Krzysztof Niewolny / Pranay Pareek
Kunstig intelligens er utmerket til å identifisere objekter i bilder, men det er fortsatt ganske enkelt å rote det til. Legg til noen få valgfrie slag eller lag i statisk støy som er usynlig for det menneskelige øyet, og du kan kaste av deg et bildegjenkjenningssystem, noen ganger med dødelig effekt. Å legge til klistremerker på et stoppskilt kan få en selvkjørende bil til å tro at skiltet har en fartsgrense på 45 mil i timen , for eksempel, mens å legge dem til en vei kan få en Tesla til å svinge inn i møtende kjørefelt. (På den lyse siden kan de samme teknikkene også skjerme deg fra overvåkingstilstanden. Du vinner noe, du taper noe.)
Alle disse er kjent som motstridende eksempler - og forskere prøver nå å utvikle måter å beskytte AI-systemer mot dem. Men i en papir i fjor argumenterte en gruppe forskere ved Google Brain og Princeton, inkludert en av de tidligste forskerne på dette emnet, Ian Goodfellow , at det nye stipendet var for teoretisk og gikk glipp av poenget.
Mens mesteparten av forskningen fokuserte på å beskytte systemer mot spesialdesignede forstyrrelser, ville en hacker, sa de, sannsynligvis velge et sløvere verktøy: et helt annet bilde i stedet for et støymønster å legge på et eksisterende. Dette kan også føre til at systemet oppfører seg feil.
Kritikken fikk Dan Hendrycks, en doktorgradsstudent ved University of California, Berkeley, til å sette sammen en nytt bildedatasett . Han kaller bildene den inneholder naturlige motstridende eksempler - uten noen spesielle justeringer, lurer de et system uansett.
De inkluderer ting som et ekorn som vanlige systemer feilmerker som en sjøløve, eller en øyenstikker som de feilidentifiserer som et kumlokk. Disse eksemplene fremstår som mye vanskeligere å forsvare seg mot, sier han. Syntetiske motstridende eksempler trenger å kjenne alle AI-systemets forsvar for å være mest effektive. Derimot kan naturlige eksempler fungere ganske bra selv når disse forsvarene endres, sier han.
Hendrycks ga ut en tidlig versjon av datasettet, med rundt 6000 bilder, forrige uke på den internasjonale konferansen om maskinlæring. Han planlegger å gi ut en endelig versjon med nærmere 8000 i løpet av et par uker. Han har til hensikt at forskningsmiljøet skal bruke datasettet som målestokk.
Med andre ord, i stedet for å trene bildegjenkjenningssystemer direkte på bildene, bør de reservere dem kun for testing. Hvis folk bare skulle trene på dette datasettet, er det bare å huske disse eksemplene, sier han. Det ville være å løse datasettet, men ikke oppgaven med å være robust overfor nye eksempler.
Å knekke logikken bak de noen ganger forvirrende feilene eksemplene forårsaker kan føre til mer motstandsdyktige systemer. Hvordan forvirrer dette en øyenstikker med guacamole? Hendrycks vitser. Det er ikke så klart hvorfor feilen blir gjort i det hele tatt.