211service.com
Facebooks nye polyglot AI kan oversette mellom 100 språk
Edurne Chopeitia / Unsplash
Nyhetene: Facebook er åpen kildekode en ny AI-språkmodell kalt M2M-100 som kan oversette mellom et hvilket som helst par blant 100 språk. Av de 4450 mulige språkkombinasjonene, oversetter den 1100 av dem direkte. Dette i motsetning til tidligere flerspråklige modeller, som er sterkt avhengige av engelsk som mellomledd. En oversettelse fra kinesisk til fransk, for eksempel, går vanligvis fra kinesisk til engelsk og deretter engelsk til fransk, noe som øker sjansen for å introdusere feil.
Datakurering: Modellen ble trent på 7,5 milliarder setningspar. For å kompilere et så stort datasett, stolte forskerne sterkt på automatisert kurering. De brukte webcrawlere for å skrape milliarder av setninger fra nettet og fikk en annen språkmodell kalt FastText til å identifisere språket. (De brukte ingen Facebook-data.) Deretter brukte de et program kalt LASER 2.0, utviklet tidligere av Facebooks AI-forskningslaboratorium, som bruker uovervåket læring – maskinlæring som ikke krever manuelt merkede data – for å matche setninger på tvers av språk ved å deres betydning.
LASER 2.0 skaper det som kalles innebygging fra store, ustrukturerte datasett med setninger. Den trener på de tilgjengelige setningseksemplene på hvert språk og kartlegger deres forhold til hverandre basert på hvor ofte og hvor tett sammen de brukes. Disse innebyggingene hjelper maskinlæringsmodellen med å tilnærme betydningen av hver setning, som deretter lar LASER 2.0 automatisk koble sammen setninger som deler samme betydning på forskjellige språk.
Sammenkoblingsspråk: Forskerne fokuserte på språkkombinasjonene som de trodde ville bli mest etterspurt. De grupperte språk etter språklige, geografiske og kulturelle likheter, med antagelsen om at folk som bor i samme region ville kommunisere oftere. En språkgruppe inkluderte for eksempel de vanligste språkene som ble snakket i India, inkludert bengali, hindi, tamil og urdu. LASER 2.0 målrettet deretter søket etter setningspar på alle mulige språkpar i hver gruppe.
Pågående utfordringer: Språk som snakkes i steder som Afrika og Sørøst-Asia lider fortsatt av problemer med oversettelseskvaliteten fordi for lite språkdata er tilgjengelig til å bli skrapet fra nettet, sier Angela Fan, hovedforskeren på prosjektet. Gitt avhengigheten av nettdata, må forskerne også finne ut teknikker for å identifisere og utrydde eventuell innebygd sexisme, rasisme og andre diskriminerende skjevheter. Akkurat nå har forskerne brukt et banningsfilter for å rydde opp i et spesielt grovt språk, men det er stort sett begrenset til engelsk.
Kun forskning: Facebook har foreløpig ingen planer om å bruke modellen i produktene sine. M2M-100 er kun ment for forskningsformål, sier Fan. Til syvende og sist er imidlertid målet at modellen skal forbedre og utvide Facebooks eksisterende oversettelsesmuligheter. Applikasjoner kan inkludere brukerkommunikasjon (for eksempel funksjonen som lar folk oversette innlegg til sitt morsmål) og kanskje innholdsmoderering.