211service.com
Googles autofullføring for tale kan dekke over feil i videosamtaler
Kategori: Kunstig intelligens Lagt ut 06. april
Nyhetene: Siden mange av oss nå er avhengige av videosamtaler for ansikt-til-ansikt-interaksjon, er hakkete forbindelser mer frustrerende enn noen gang. En kunstig intelligens som etterligner den enkelte høyttalers måte å snakke på, kan jevne ut sprekkene ved å fylle ut små hull med fragmenter av generert tale. Teknologien er utviklet av et team hos Google og brukes nå i Googles app for videosamtaler Duo .
Hva er problemet? Når du er i en nettsamtale, blir stemmen din kuttet opp i mange små biter som er zippet over internett i datablokker kjent som pakker. Pakker kommer ofte sammen i den andre enden og programvare må omorganisere dem. Men noen ganger kommer ikke pakker i det hele tatt, noe som skaper feil og hull i en samtale. Dette skjer på de beste tidspunkter. I følge Google må 99 % av Duo-samtalene håndtere rotete eller tapte pakker. En tidel av disse samtalene mister mer enn 8 % av lyden.
Generer tale: For å fikse problemet bygde teamet på et nevralt nettverk utviklet av DeepMind som kan generere realistisk tale fra tekst . Kalt WaveNetEQ, ble det nye nevrale nettverket trent på et stort datasett med 100 registrerte menneskestemmer som snakket 48 forskjellige språk, til det kunne autofullføre korte deler av tale basert på vanlige mønstre i måten folk snakker på. Fordi Duo er ende-til-ende-kryptert, kjører AI på enheten, ikke skyen. Under en samtale er WaveNetEQ i stand til å lære egenskapene til en høyttalers stemme og genererer lydbiter som matcher både stilen og innholdet til det høyttaleren sier. Når en pakke går tapt, settes den AI-genererte stemmen inn på plass.
Foreløpig kan AI bare generere stavelser i stedet for hele ord eller setninger. Men kort eksempler som Google har lagt ut på nettet viser at resultatene kan være ganske naturtro. I ett tilfelle erstatter AI den andre stavelsen i ordet problemer i en stemme som etterligner den mannlige høyttaleren nøyaktig.