En fantastisk AI-fremskritt gjør Googles smarte butler til å høres mye bedre ut

Kategori: Ukategorisert Lagt ut 05. okt

Du kan takke DeepMind for den glatte nye stemmen som kommer fra Googles Home-høyttaler og Assistant-app.





Denne gangen i fjor annonserte Googles London-baserte AI-avdeling en ny måte å syntetisere tale på. Programvaren, kalt WaveNet, rev opp den vanlige regelboken for generering av menneskelignende stemmer: i stedet for å sy sammen biter av lyd, som ender opp med å skape de klønete robotstemmene vi er vant til, genererte den en hel lydbølgeform fra bunnen av, en prøve etter den neste. Resultatet var langt jevnere, med mer naturlige intonasjoner enn andre tilnærminger til talesyntese.

Men det var et problem: programvaren tok ett sekund å generere 0,02 sekunder med lyd, noe som gjør den upraktisk for bruk i forbrukerprodukter. DeepMind sa at den ikke ville bli brukt i noen av Googles programvare på en stund, noe som betyr at de klønete stemmene i gammel stil måtte forbli.

Men i løpet av de siste 12 månedene har ting endret seg. DeepMind nå rapporter at den har klart å øke hastigheten på algoritmen med en faktor på 1000, slik at den kan lage 20 sekunder med lyd på ett sekund av beregningstid. (Det gjør den samtidig som den faktisk skaper lyd med høyere kvalitet enn den gamle algoritmen.) Det er et stort sprang, og det har gjort det mulig å kjøre programvaren på Googles AI-skysystem.



Faktisk er det det som nå brukes til å lage all talen som ytres av Googles Assistant AI (som forresten, kommer nå i både mannlige og kvinnelige versjoner ) på telefoner og smarthøyttalere.

Du kan høre et eksempel på gammeldags ikke-WaveNet-talesyntese her og den samme setningen uttalt av den nye, raske algoritmen her . Forskjellen er ganske sterk.

Dessverre har DeepMind ennå ikke publisert detaljer om hvordan den klarte å lage den ultraeffektive versjonen av WaveNet, men den sier at den planlegger å gjøre det i nær fremtid.