Facebooks radioaktive data sporer bildene som brukes til å trene en AI

Kategori: Kunstig intelligens Lagt ut 06. februar Et bilde av en haug med fotografier Et bilde av en haug med fotografier





Nyhetene: Et team fra Facebook AI Research har utviklet en måte for å spore nøyaktig hvilke bilder i et datasett ble brukt til å trene en maskinlæringsmodell. Ved å gjøre umerkelige justeringer av bilder, lage et slags vannmerke, var de i stand til å gjøre små tilsvarende endringer i måten en bildeklassifiserer trent på disse bildene fungerer, uten å svekke dens generelle nøyaktighet. Dette lot dem senere matche modeller med bildene som ble brukt til å trene dem.

Hvorfor det er viktig: Facebook kaller teknikken radioaktiv data fordi den er analog med bruken av radioaktive markører i medisinen, som dukker opp i kroppen under røntgen. Å fremheve hvilke data som har blitt brukt til å trene en AI, gjør modellene mer transparente, og flagger potensielle kilder til skjevheter – for eksempel en modell som er trent på et ikke-representativt sett med bilder – eller avslører når et datasett ble brukt uten tillatelse eller til upassende formål.

Ikke gjør feil: En stor utfordring var å endre bildene uten å ødelegge den resulterende modellen. Små justeringer av en AIs input kan noen ganger føre til at den gjør dumme feil, for eksempel å identifisere en skilpadde som en pistol eller en dovendyr som en racerbil. Facebook sørget for å designe vannmerkene sine slik at dette ikke skjedde. Teamet testet teknikken sin på ImageNet, et mye brukt datasett med mer enn 14 millioner bilder, og fant ut at de kunne oppdage bruk av radioaktive data med høy tillit til en bestemt modell selv når bare 1 % av bildene var merket.