211service.com
AI-stemmeskuespillere høres mer menneskelige ut enn noen gang – og de er klare til å ansette
Ms Tech | Getty
Selskapets blogginnlegg drypper av entusiasmen til en amerikansk inforeklame fra 90-tallet. WellSaid Labs beskriver hva kunder kan forvente av sine åtte nye digitale stemmeskuespillere! Tobin er energisk og innsiktsfull. Paige er balansert og uttrykksfull. Ava er polert, selvsikker og profesjonell.
Hver av dem er basert på en ekte stemmeskuespiller, hvis likhet (med samtykke) er bevart ved hjelp av AI. Bedrifter kan nå lisensiere disse stemmene til å si hva de trenger. De mater ganske enkelt litt tekst inn i stemmemotoren, og ut vil et skarpt lydklipp av en naturlig klingende forestilling.
WellSaid Labs , en Seattle-basert oppstart som spunnet ut av forsknings-non-profit Allen Institute of Artificial Intelligence, er det siste firmaet som tilbyr AI-stemmer til kunder. Foreløpig spesialiserer den seg på stemmer for e-læringsvideoer for bedrifter. Andre startups lager stemmer for digitale assistenter , telefonsenteroperatører , Til og med videospillkarakterer .
KH · En WellSaid AI-stemmeskuespiller i reklamestil
For ikke så lenge siden hadde slike dypfalske stemmer noe av et elendig rykte for deres bruk i svindelsamtaler og internett-lureri . Men deres forbedrede kvalitet har siden vekket interessen til et økende antall selskaper. Nylige gjennombrudd innen dyp læring har gjort det mulig å gjenskape mange av subtilitetene i menneskelig tale. Disse stemmene pauser og puster på alle de riktige stedene. De kan endre stil eller følelser. Du kan oppdage trikset hvis de snakker for lenge, men i korte lydklipp har noen blitt umulig å skille fra mennesker.
AI-stemmer er også billige, skalerbare og enkle å jobbe med. I motsetning til et opptak av en menneskelig stemmeskuespiller, kan syntetiske stemmer også oppdatere manuset deres i sanntid, noe som åpner for nye muligheter for å tilpasse reklame.
Men fremveksten av hyperrealistiske falske stemmer er ikke konsekvensfri. Spesielt menneskelige stemmeskuespillere har blitt overlatt til å lure på hva dette betyr for deres levebrød.
Hvordan forfalske en stemme
Syntetiske stemmer har eksistert en stund. Men de gamle, inkludert stemmene til originalen syria og Alexa , bare limt sammen ord og lyder for å oppnå en klønete, roboteffekt. Å få dem til å høres mer naturlige ut var en møysommelig manuell oppgave.
Dyp læring endret det. Stemmeutviklere trengte ikke lenger å diktere den nøyaktige tempoet, uttalen eller intonasjonen til den genererte talen. I stedet kunne de mate noen timer med lyd inn i en algoritme og få algoritmen til å lære disse mønstrene på egen hånd.
Hvis jeg er Pizza Hut, kan jeg absolutt ikke høres ut som Domino's, og jeg kan absolutt ikke høres ut som Papa John's.
Rupal Patel, grunnlegger og administrerende direktør i VocaliD
Gjennom årene har forskere brukt denne grunnleggende ideen til å bygge stemmemotorer som er mer og mer sofistikerte. Den ene WellSaid Labs konstruerte, for eksempel, bruker to primære dyplæringsmodeller. Den første forutsier, fra en tekstpassasje, de brede strekene for hvordan en høyttaler vil høres ut – inkludert aksent, tonehøyde og klang. Den andre fyller ut detaljene, inkludert pust og måten stemmen resonerer i omgivelsene.
Å lage en overbevisende syntetisk stemme krever imidlertid mer enn bare å trykke på en knapp. Noe av det som gjør en menneskelig stemme så menneskelig er dens inkonsekvens, uttrykksfullhet og evne til å levere de samme linjene i helt forskjellige stiler, avhengig av konteksten.
Å fange disse nyansene innebærer å finne de riktige stemmeskuespillerne for å levere passende treningsdata og finjustere dyplæringsmodellene. WellSaid sier at prosessen krever minst en time eller to med lyd og noen uker med arbeid for å utvikle en syntetisk replika med realistisk klingende.
KH · En Resemble.ai kundeserviceagent KH · En Resemble.ai stemmeskuespiller i samtalestil
AI-stemmer har blitt spesielt populære blant merker som ønsker å opprettholde en konsistent lyd i millioner av interaksjoner med kunder. Med allestedsnærværende smarthøyttalere i dag, og fremveksten av automatiserte kundeserviceagenter så vel som digitale assistenter innebygd i biler og smarte enheter, kan merkevarer trenge å produsere oppover hundre timer med lyd i måneden. Men de ønsker heller ikke lenger å bruke de generiske stemmene som tilbys av tradisjonell tekst-til-tale-teknologi – en trend som akselererte under pandemien da flere og flere kunder hoppet over interaksjoner i butikk for å engasjere seg virtuelt med selskaper.
Hvis jeg er Pizza Hut, kan jeg absolutt ikke høres ut som Domino's, og jeg kan absolutt ikke høres ut som Papa Johns, sier Rupal Patel, professor ved Northeastern University og grunnlegger og administrerende direktør for VocaliD, som lover å bygge tilpassede stemmer som samsvarer med en bedrifts merkevareidentitet. Disse merkene har tenkt på fargene sine. De har tenkt på skriftene sine. Nå må de også begynne å tenke på hvordan stemmen deres høres ut.
Karen Hao, MIT Tech Review · Et VocaliD-annonseeksempel med en mannsstemme Karen Hao, MIT Tech Review · Et VocaliD-annonseeksempel med en kvinnelig stemmeMens selskaper før måtte ansette forskjellige stemmeskuespillere for forskjellige markeder – Nordøst versus Sør-USA, eller Frankrike versus Mexico – kan noen stemme-AI-firmaer manipulere aksenten eller bytte språk til en enkelt stemme på forskjellige måter. Dette åpner for muligheten for å tilpasse annonser på strømmeplattformer avhengig av hvem som lytter, og endrer ikke bare egenskapene til stemmen, men også ordene som blir sagt. En ølreklame kan fortelle en lytter om å stikke innom en annen pub, avhengig av om den spilles i for eksempel New York eller Toronto. Resemble.ai, som designer stemmer for annonser og smarte assistenter, sier at de allerede jobber med kunder for å lansere slike personlige lydannonser på Spotify og Pandora.
Spill- og underholdningsindustrien ser også fordelene. Sonantic, et firma som spesialiserer seg på emosjonelle stemmer som kan le og gråte eller hviske og rope, samarbeider med videospillprodusenter og animasjonsstudioer for å levere voice-overs til karakterene deres. Mange av kundene bruker de syntetiserte stemmene kun i pre-produksjon og bytter til ekte stemmeskuespillere for den endelige produksjonen. Men Sonantic sier at noen har begynt å bruke dem gjennom hele prosessen, kanskje for karakterer med færre linjer. Resemble.ai og andre har også jobbet med film- og TV-serier for å lappe opp skuespillernes prestasjoner når ordene blir forvirret eller uttalt feil.
Men det er begrensninger for hvor langt AI kan gå. Det er fortsatt vanskelig å opprettholde realismen til en stemme over lange tidsperioder som kan kreves for en lydbok eller podcast. Og det er liten evne til å kontrollere ytelsen til en AI-stemme på samme måte som en regissør kan veilede en menneskelig utøver. Vi er fortsatt i de tidlige dagene med syntetisk tale, sier Zohaib Ahmed, grunnlegger og administrerende direktør for Resemble.ai, og sammenligner det med tiden da CGI-teknologien ble brukt primært til touch-ups i stedet for å skape helt nye verdener fra grønne skjermer .
Et menneskelig preg
Med andre ord, menneskelige stemmeskuespillere forsvinner ikke ennå. Ekspressive, kreative og langvarige prosjekter gjøres fortsatt best av mennesker. Og for hver syntetisk stemme laget av disse selskapene, må en stemmeskuespiller også levere de originale treningsdataene.
Men noen skuespillere har blitt stadig mer bekymret for levebrødet sitt, sier en talsperson ved SAG-AFTRA, fagforeningen som representerer stemmeskuespillere i USA. Hvis de ikke er redde for å bli automatisert bort av AI, er de bekymret for å bli urettferdig kompensert eller miste kontrollen over stemmene deres, som utgjør deres merkevare og rykte.
Dette er nå gjenstand for søksmål mot TikTok brakt av den kanadiske stemmeskuespilleren Bev Standing, som hevder at appens innebygde voice-over-funksjon bruker en syntetisk kopi av stemmen hennes uten hennes tillatelse. Standings opplevelse gjenspeiler også den av Susan Bennett , den originale stemmen til amerikanske Siri, som ble betalt for de første opptakene hennes, men ikke for fortsatt bruk av vokallikheten hennes på millioner av Apple-enheter.
Noen selskaper ønsker å være mer ansvarlige i hvordan de engasjerer seg i stemmeskuespillindustrien. De beste, sier SAG-AFTRAs representant, har henvendt seg til fagforeningen for å finne ut den beste måten å kompensere og respektere stemmeskuespillere for arbeidet deres.
Relatert historie
Disse skumle falske menneskene varsler en ny tidsalder innen AI Trenger du mer data for dyp læring? Syntetiske dataselskaper vil gjøre det for deg.
Flere bruker nå en overskuddsdelingsmodell for å betale skuespillere hver gang en klient lisensierer sin spesifikke syntetiske stemme, noe som har åpnet for en ny strøm av passiv inntekt. Andre involverer aktørene i prosessen med å designe deres AI-likhet og gir dem vetorett over prosjektene den skal brukes i. SAG-AFTRA presser også på for lovgivning for å beskytte aktører mot illegitime kopier av stemmen deres.
Men for VocaliDs Patel er poenget med AI-stemmer til syvende og sist ikke å gjenskape menneskelig ytelse eller å automatisere eksisterende voice-over-arbeid. I stedet er løftet at de kan åpne helt nye muligheter. Hva om i fremtiden, sier hun, kan syntetiske stemmer brukes til raskt å tilpasse nettbasert undervisningsmateriell til ulike målgrupper? Hvis du prøver å nå, la oss si, en gruppe barn i en indre by, ville det ikke vært flott om den stemmen faktisk hørtes ut som om den kom fra samfunnet deres?