211service.com
Det neste store steget for AI? Forstå video

Et skjermbilde fra en av videoene i Moments in Time-datasettet, som kan hjelpe AI bedre å forstå videoinnhold. Moments in Time Datasett
For en datamaskin er det ganske smart å gjenkjenne en katt eller en and i et stillbilde. Men en stivere test for kunstig intelligens vil være forståelse når katten rir på en Roomba og jager anda rundt på et kjøkken .
MIT og IBM ga denne uken ut et stort datasett med videoklipp møysommelig kommentert med detaljer om handlingen som ble utført. De Moments in Time Datasett inkluderer tre-sekunders utdrag av alt fra fiske til break-dance.
Mange ting i verden forandrer seg fra det ene sekundet til det neste, sier Aude Oliva , en hovedforsker ved MIT og en av personene bak prosjektet. Hvis du vil forstå hvorfor noe skjer, gir bevegelse deg mye informasjon som du ikke kan fange i en enkelt ramme.
Den nåværende boomen innen kunstig intelligens ble delvis utløst av suksess med å lære datamaskiner å gjenkjenne innholdet i statiske bilder ved å trene dype nevrale nettverk på store merkede datasett (se The Revolutionary Technique That Quietly Changed Machine Vision Forever ).
AI-systemer som tolker video i dag, inkludert systemene som finnes i enkelte selvkjørende biler, er ofte avhengige av å identifisere objekter i statiske rammer i stedet for å tolke handlinger. Mandag lanserte Google et verktøy som er i stand til å gjenkjenne objektene i video som en del av Cloud Platform, en tjeneste som allerede inkluderer AI-verktøy for behandling av bilde, lyd og tekst.
Den neste utfordringen kan være å lære maskiner å forstå ikke bare hva en video inneholder, men også hva som skjer i opptakene. Det kan ha noen praktiske fordeler, kanskje føre til kraftige nye måter å søke, kommentere og utvinne videoopptak på. Det er også viktig å gi roboter eller selvkjørende biler en bedre forståelse av hvordan verden rundt dem utspiller seg.
MIT-IBM-prosjektet er faktisk bare ett av flere videodatasett designet for å stimulere fremgang i treningsmaskiner for å forstå handlinger i den fysiske verden. I fjor, for eksempel, ga Google ut et sett med åtte millioner merkede YouTube-videoer kalt YouTube-8M. Facebook utvikler et kommentert datasett med videohandlinger kalt scener, handlinger og objekter.
Olga Russakovsky, en assisterende professor ved Princeton University som spesialiserer seg på datasyn, sier det har vist seg vanskelig å utvikle nyttige videodatasett fordi de krever mer lagring og datakraft enn stillbilder gjør. Jeg er spent på å leke med disse nye dataene, sier hun. Jeg synes lengden på tre sekunder er flott – den gir tidsmessig kontekst samtidig som lagrings- og beregningskravene holdes lave.
Andre tar en mer kreativ tilnærming. Tjue milliarder nevroner , en oppstart basert i Toronto og Berlin, opprettet et tilpasset datasett ved å betale crowdsourcede arbeidere for å utføre enkle oppgaver. En av selskapets medstiftere, Roland Memisevic , sier at den også bruker et nevralt nettverk designet spesielt for å behandle informasjon om tidssyn.
Nettverk som er trent på de andre datasettene kan fortelle deg om videoen viser en fotballkamp eller en fest, sier han. Våre nettverk kan fortelle deg om noen nettopp har kommet inn i rommet.
Danny Gutfreund, en forsker ved IBM som samarbeidet om prosjektet, sier å gjenkjenne handlinger effektivt vil kreve at maskiner lærer om for eksempel en person som tar en handling og overfører denne kunnskapen til et tilfelle der for eksempel et dyr utfører den samme handlingen. Fremgang på dette området, kjent som overføringslæring, vil være viktig for fremtiden til AI. La oss se hvordan maskiner kan gjøre denne overføringslæringen, denne analogien, som vi gjør veldig bra, sier han.
Gutfreund legger til at teknologien kan ha praktiske anvendelser. Du kan bruke den til eldreomsorg, fortelle om noen har falt eller om de har tatt medisinen sin, sier han. Du kan tenke på enheter som hjelper blinde mennesker.