211service.com
Når AI leverer lyden i videoklipp, kan ikke mennesker se forskjellen
Maskinlæring endrer måten vi tenker på bilder og hvordan de skapes. Forskere har trent maskiner til å generere ansikter, tegne tegneserier og til og med overføre stilen til malerier til bilder. Det er bare et kort skritt fra disse teknikkene til å lage videoer på denne måten, og dette blir faktisk allerede gjort.
Alt dette peker på en måte å lage virtuelle miljøer helt på maskin. Det åpner alle slags muligheter for fremtiden til menneskelig erfaring.
Men det er et problem. Video er ikke bare en visuell opplevelse; å generere realistisk lyd er like viktig. Så et interessant spørsmål er om maskiner på en overbevisende måte kan generere lydkomponenten til en video.
I dag får vi svar takket være arbeidet til Yipin Zhou og venner ved University of North Carolina i Chapel Hill og noen få kompiser ved Adobe Research. Disse gutta har trent en maskinlæringsalgoritme for å generere realistiske lydspor for korte videoklipp.
Faktisk er lydene så realistiske at de lurer de fleste mennesker til å tro at de er ekte. Du kan ta en test selv her for å se om du kan se forskjell.
Teamet tar standardtilnærmingen til maskinlæring. Algoritmer er alltid like gode som dataene som brukes til å trene dem, så det første trinnet er å lage et stort, høykvalitets kommentert datasett med videoeksempler.
Teamet oppretter dette datasettet ved å velge et undersett av klipp fra en Google-samling kalt Audioset, som består av over to millioner 10-sekunders klipp fra YouTube som alle inkluderer lydhendelser. Disse videoene er delt inn i menneskemerkede kategorier med fokus på ting som hunder, motorsager, helikoptre og så videre
For å trene en maskin må laget ha klipp der lydkilden er godt synlig. Så enhver video som inneholder lyd fra hendelser utenfor skjermen er uegnet. Teamet filtrerer disse ut ved å bruke crowdsourcede arbeidere fra Amazons Mechanical Turk-tjeneste for å finne klipp der lydkilden er godt synlig og dominerer lydsporet.
Det produserte et nytt datasett med over 28 000 videoer, hver omtrent syv sekunder lang, som dekker 10 forskjellige kategorier.
Deretter brukte teamet disse videoene til å trene en maskin til å gjenkjenne bølgeformene knyttet til hver kategori og til å reprodusere dem fra bunnen av ved hjelp av et nevralt nettverk kalt SampleRNN.
Til slutt testet de resultatene ved å be menneskelige evaluatorer om å vurdere kvaliteten på lyden som følger med en video, og for å finne ut om den er ekte eller kunstig generert.
Resultatene tyder på at maskiner kan bli ganske gode til denne oppgaven. Eksperimentene våre viser at de genererte lydene er ganske realistiske og har god tidssynkronisering med de visuelle inngangene, sier Zhou og co.
Og menneskelige evaluatorer ser ut til å være enige. Evalueringer viser at over 70 % av den genererte lyden fra modellene våre kan lure mennesker til å tro at de er ekte, sier Zhou og co.
Det er interessant arbeid som baner vei for automatisert lydredigering. Et vanlig problem i videoer er at fremmed støy fra en kilde utenfor skjermen kan ødelegge et klipp. Så det vil være nyttig å ha en måte å automatisk erstatte lyden med et realistisk maskingenerert alternativ.
Og med Adobes engasjement i denne forskningen, kan det ikke ta lang tid før vi ser denne typen kapasitet i kommersiell videoredigeringsprogramvare.
Ref: arxiv.org/abs/1712.01393 : Visuelt til lyd: Generer naturlig lyd for videoer i naturen