211service.com
Feilfylte datasett forvrider følelsen vår av hvor god AI egentlig er
Jeremy Lwanga/Unsplash
De 10 mest siterte AI-datasett er fulle av etikettfeil, ifølge en ny studie fra MIT , og det forvrenger vår forståelse av feltets fremgang.
Dataryggrad: Datasett er ryggraden i AI-forskning, men noen er mer kritiske enn andre. Det er et kjernesett av dem som forskere bruker til å evaluere maskinlæringsmodeller som en måte å spore hvordan AI-evner utvikler seg over tid. En av de mest kjente er det kanoniske bildegjenkjenningsdatasettet ImageNet, som startet den moderne AI-revolusjonen. Det er også MNIST, som samler bilder av håndskrevne tall mellom 0 og 9. Andre datasett tester modeller som er opplært til å gjenkjenne lyd, tekst og håndtegninger.
Ja men: De siste årene har studier funnet at disse datasettene kan inneholde alvorlige feil. ImageNet inneholder for eksempel rasistiske og sexistiske merkelapper samt bilder av folks ansikter innhentet uten samtykke . Den siste studien ser nå på et annet problem: mange av etikettene er rett og slett feil. En sopp er merket som en skje, en frosk er merket som en katt, og en høy tone fra Ariana Grande er merket som en fløyte. ImageNet-testsettet har en estimert etikettfeilrate på 5,8 %. I mellomtiden har testsettet for QuickDraw, en samling av håndtegninger, en estimert feilrate på 10,1 %.
Hvordan ble det målt? Hvert av de 10 datasettene som brukes til å evaluere modeller har et tilsvarende datasett som brukes til å trene dem. Forskerne, MIT-studentene Curtis G. Northcutt og Anish Athalye og alun Jonas Mueller, brukte treningsdatasettene til å utvikle en maskinlæringsmodell og brukte den deretter til å forutsi etikettene i testdataene. Hvis modellen var uenig med den originale etiketten, ble datapunktet flagget opp for manuell gjennomgang. Fem menneskelige anmeldere på Amazon Mechanical Turk ble bedt om å stemme på hvilken etikett – modellens eller originalen – de mente var riktig. Hvis flertallet av de menneskelige anmelderne var enige i modellen, ble den opprinnelige etiketten oppgitt som en feil og deretter rettet.
Betyr dette noe? Ja. Forskerne så på 34 modeller hvis ytelse tidligere ble målt mot ImageNet-testsettet. Deretter målte de hver modell på nytt mot de rundt 1500 eksemplene der dataetikettene ble funnet å være feil. De fant ut at modellene som ikke presterte så bra på originalen stemmer ikke etiketter var noen av de beste ytelsene etter at etikettene ble korrigert. Spesielt så ut til at de enklere modellene klarte seg bedre på de korrigerte dataene enn de mer kompliserte modellene som brukes av teknologigiganter som Google for bildegjenkjenning og antas å være de beste på feltet. Med andre ord kan vi ha en oppblåst følelse av hvor gode disse kompliserte modellene er på grunn av feilaktige testdata.
Hva nå? Northcutt oppfordrer AI-feltet til å lage renere datasett for å evaluere modeller og spore feltets fremgang. Han anbefaler også at forskere forbedrer sin datahygiene når de jobber med egne data. Ellers, sier han, hvis du har et støyende datasett og en haug med modeller du prøver ut, og du kommer til å distribuere dem i den virkelige verden, kan du ende opp med å velge feil modell. For dette formål, han åpen kildekode koden han brukte i sin studie for å korrigere etikettfeil, som han sier allerede er i bruk hos noen få store teknologiselskaper.