211service.com
Podcast: AI finner stemmen sin
Dagens stemmeassistenter er fortsatt langt unna de hyperintelligente tenkemaskinene vi har fundert på i flere tiår. Og det er fordi teknologien faktisk er kombinasjonen av tre forskjellige ferdigheter: talegjenkjenning, naturlig språkbehandling og stemmegenerering.
Hver av disse ferdighetene byr allerede på store utfordringer. For å mestre kun den naturlige språkbehandlingsdelen? Du må ganske mye gjenskape intelligens på menneskelig nivå. dyp læring, teknologien som driver den nåværende AI-boomen , kan trene maskiner til å bli mestere til alle slags oppgaver. Men den kan bare lære én om gangen. Og fordi de fleste AI-modeller trener ferdighetene sine på tusenvis eller millioner av eksisterende eksempler, ender de opp med å replikere mønstre i historiske data – inkludert de mange dårlige avgjørelsene folk har tatt, som å marginalisere fargede og kvinner.
Likevel har systemer som brettspillmesteren AlphaZero og den stadig mer overbevisende falske tekstgeneratoren GPT-3 skapt debatten om når mennesker vil skape en kunstig generell intelligens -maskiner som kan multitaske, tenke og resonnere for seg selv. I denne episoden utforsker vi hvordan maskiner lærer å kommunisere – og hva det betyr for menneskene i den andre enden av samtalen.
Vi møtes:
- Susan C. Bennett, stemmen til Siri
- Cade Metz, The New York Times
- Charlotte Jee, MIT Technology Review
Studiepoeng
Denne episoden ble produsert av Jennifer Strong, Emma Cillekens, Anthony Green, Karen Hao og Charlotte Jee. Vi er redigert av Michael Reilly og Niall Firth.
Avskrift
[TR ID]
Jim: Jeg vet ikke om det var AI... Hvis de hadde tatt opptaket av noe han hadde gjort... og var i stand til å manipulere det... men jeg sier deg, det var sønnen min.
Sterk: Dagen startet som alle andre for en mann ... vi skal ringe Jim. Han bor utenfor Boston.
Og forresten... han har et familiemedlem som jobber for MIT.
Vi kommer ikke til å bruke etternavnet hans fordi de er bekymret for deres sikkerhet.
Jim: Det var en tirsdag eller onsdag morgen, klokken ni er jeg dypt i tanker og jobber med noe,
Sterk: Det vil si... helt til han mottok denne samtalen.
Jim: Telefonen ringer... og jeg tar den opp og det er sønnen min. Og han er tydelig opprørt. Dette, denne ungen er en veldig avslappet fyr, men når han blir opprørt, har han en rekke vokale væremåter. Og dette var som, herregud, han er i trøbbel.
Og han sa egentlig til meg, se, jeg er i fengsel, jeg er i Mexico. De tok telefonen min. Jeg har bare 30 sekunder. De sa at jeg drakk, men det var jeg ikke, og folk er såret. Og se, jeg må gå av telefonen, ringe denne advokaten og den gir meg et telefonnummer og må legge på.
Sterk: Sønnen hans er i Mexico ... og det er bare ingen tvil i tankene hans ... det er ham.
Jim: Og jeg må fortelle deg, Jennifer, det var ham. Det var stemmen hans. Det var alt. Tone. Bare disse små manerismene, pausene, slukingen etter luft, alt du kunne forestille deg.
Sterk: Hjertet hans er i halsen...
Jim: Håret mitt står på kanten
Sterk: Så han ringer det telefonnummeret ... En mann tar opp ... og han gir flere detaljer om hva som skjer.
Jim: Sønnen din blir siktet for å ha slått denne bilen. Det var en gravid kvinne som kjørte hvis arm var brukket. Datteren hennes satt i baksetet.. er i kritisk tilstand, og de anklaget ham for kjøring i påvirket tilstand. Vi tror ikke han har gjort det. Dette er vi, vi har vært borti dette flere ganger før, men det viktigste er å få ham ut av fengselet, få ham trygg, så fort som mulig.
Sterk: Så går samtalen over på penger ... han har fortalt at kausjonen er satt ... og han må sette ned ti prosent.
Jim: Så snart han begynte å snakke om penger, du vet, flagget gikk på en måte opp og jeg sa, unnskyld meg, er det noen sjanse for at dette er en slags svindel? Og han ble skikkelig irritert. Han er som, hei, du ringte meg. Se, jeg synes dette er veldig støtende at du anklager meg for noe. Og så går hjertet mitt tilbake i halsen. Jeg er som om dette er den ene fyren som er mellom sønnen min og enda verre fengsel. Så jeg trakk meg tilbake...
[Musikk]
Min kone går inn 10 minutter senere og sier, vel, du vet, jeg sendte en tekstmelding med ham sent i går kveld. Som om dette er rundt den tiden han sannsynligvis ville blitt arrestert og fengslet. Så selvfølgelig sender vi en melding til ham, han står bare opp. Han har det helt fint.
Sterk: Han er fortsatt ikke sikker på hvordan noen fanget essensen av sønnens stemme. Men han har noen teorier...
Jim: De måtte ha fått et opptak av noe da han var lei seg. Det er det eneste jeg kan si, for de kunne ikke ha hånet opp noen av disse tingene han gjør. Det kunne de ikke gjette seg til. Jeg tror ikke, og så de, jeg tror de absolutt hadde noe råstoff å jobbe med og hva de gjorde med det derfra. Jeg vet ikke.
Sterk: Og det er ikke bare Jim som er usikker... Vi aner ikke om AI hadde noe med dette å gjøre.
Men poenget er at vi nå lever i en verden der vi heller ikke kan være sikre på at den ikke gjorde det.
Det er utrolig enkelt å forfalske noens stemme med bare noen få minutter med opptak ... og tenåringer som Jims sønn? De deler utallige opptak gjennom innlegg og meldinger på sosiale medier.
Jim: Jeg var ganske imponert over hvor bra det var. Um, som jeg sa, jeg er ikke lett å lure og mann, de hadde det spikret. Så, um, bare forsiktig.
Sterk: Jeg heter Jennifer Strong, og denne episoden ser vi på hva som skal til for å lage en stemme.
[VIS ID]
Zeyu Gin: Dere har laget rare ting på nettet.
Sterk: Zeyu Jin er forsker ved Adobe... Dette er han som taler på en bedriftskonferanse for omtrent fem år siden... som viser hvordan programvare kan omorganisere ordene i dette opptaket.
Nøkkel: Jeg hoppet på sengen og kysset hundene mine og kona mi – i den rekkefølgen.
Zeyu: Så hva med å rote med hvem han faktisk kysset. // Vi introduserer Project VoCo. Project VoCo lar deg redigere tale i tekst. Så la oss ta det opp. Så jeg laster bare inn dette lydstykket i VoCo. Så som du kan se har vi lydbølgeformen og vi har teksten under den. //
Så hva gjør vi? Kopier og lim inn. Åh! Ja det er gjort. La oss lytte til det.
Nøkkel: Og jeg kysset min kone og hundene mine.
Zeyu: Vent, det er mer. Vi kan faktisk skrive noe som ikke er her.
Nøkkel: Og jeg kysset Jordan og hundene mine.
Sterk: Adobe ga aldri ut denne prototypen ... men den underliggende teknologien blir stadig bedre.
For eksempel, her er en datagenerert forfalskning av podcaster Joe Rogan fra 2019... Den ble produsert av Squares AI-lab kalt Dessa for å øke bevisstheten om teknologien.
Rogan: 10-7 venner, jeg har noe nytt å fortelle dere alle. Jeg har bestemt meg for å sponse et hockeylag som utelukkende består av sjimpanser.
Sterk: Selv om det høres ut som moro og lek... eksperter advarer om at disse kunstige stemmene kan gjøre enkelte typer svindel mye mer vanlig. Ting som det vi hørte om tidligere.
Mona Sedky: Kommunikasjonsfokusert kriminalitet har historisk sett vært lavere på totempælen.
Sterk: Det er den føderale aktor Mona Sedky som snakket i fjor ved Federal Trade Commission om stemmekloningsteknologi.
Mona Sedky: Men nå med fremkomsten av ting som dyp falsk video … nå dyp falsk lyd kan du i utgangspunktet ha anonymiseringsverktøy og være hvor som helst på internett du vil være …. hvor som helst i verden ... og kommuniser anonymt med folk. Så som et resultat har det vært en enorm økning i kommunikasjonsfokusert kriminalitet.
Balasubramaniyan: Men tenk om du som finansdirektør eller sjefskontrollør får en telefon som kommer fra din administrerende direktørs telefonnummer.
Sterk: Og dette er Pindrop Security-sjef Vijay Balasubramaniyan på en sikkerhetskonferanse i fjor.
Balasubramaniyan: Den er fullstendig forfalsket ... så den bruker faktisk adresseboken din, og den vises som administrerende direktørs navn ... og så på den andre enden hører du administrerende direktørs stemme med en enorm mengde haster. Og vi begynner å se vanvittige angrep som det. Det var et eksempel som mange pressemedier dekket, som er en 220 000 dollar ledning som skjedde fordi en administrerende direktør i et britisk firma trodde han snakket med morselskapet sitt ... så han sendte pengene ut. Men vi har sett så høyt som $17 millioner dollar gå ut døren.
Sterk: Og selve ideen om falske stemmer... kan være like skadelig som en falsk stemme i seg selv... Som da tidligere president Donald Trump prøvde å skylde på teknologien for noen støtende ting han sa som ble fanget på bånd.
Men som alle andre teknologier ... det er ikke iboende bra eller dårlig ... det er bare et verktøy ... og jeg brukte det i traileren for sesong én for å vise hva teknologien kan gjøre.
Sterk: Hvis det å se er å tro...
Hvordan navigerer vi i en verden hvor vi ikke kan stole på øynene... eller ørene våre?
Og så du vet ... hva du hører på ... Det er ikke bare jeg som snakker. Jeg fikk litt hjelp av en kunstig versjon av stemmen min … fylte inn ord her og der.
Møt syntetiske Jennifer.
Syntetisk Jennifer: Hei, folkens!
Sterk: Jeg kan til og med klikke for å justere humøret mitt...
Syntetisk Jennifer: Hei.
Strong: Ja, la oss ikke gjøre det sint..
Sterk: I en ikke så fjern fremtid vil denne teknologien bli brukt på en rekke måter ... for enkle justeringer av forhåndsinnspilte presentasjoner ... til og med ... for å bringe tilbake stemmene til animerte karakterer fra en serie ...
Kunstige stemmer er med andre ord kommet for å bli. Men de har ikke alltid vært så enkle å lage... og jeg ringte en ekspert hvis stemme kanskje hørtes kjent ut..
Bennett: Hvordan høres dette ut? Kanskje jeg kunne vært litt mer vennlig. Hvordan har du det?
Hei, jeg heter Susan C. Bennet, den originale stemmen til Siri.
Vel, dagen Siri dukket opp, som var 4. oktober 2011, sendte en annen stemmeskuespiller meg en e-post og sa: «Hei, vi leker med denne nye iPhone-appen, er ikke dette deg?» Og jeg sa, hva ? Jeg gikk på Apple-siden og lyttet... og ja. Det var stemmen min. [ler]
Sterk: Du hørte rett. Den originale kvinnestemmen som millioner forbinder med Apple-enheter...? Hadde ingen anelse. Og hun var ikke alene. De menneskelige stemmene bak andre tidlige stemmeassistenter ble også overrasket.
Bennett: Ja, det har vært en interessant ting. Det var en justering i begynnelsen som du kan forestille deg, fordi jeg ikke forventet det. Det var litt skummelt til å begynne med, jeg må si, jeg snakket aldri så mye til meg selv som Siri, men etter hvert ble jeg akseptert og faktisk endte det opp med å bli til noe veldig positivt så...
Sterk: For å være tydelig, stjal ikke Apple Susan Bennetts stemme. I flere tiår har hun utført stemmearbeid for selskaper som McDonald's og Delta Airlines ... og år før Siri kom ut ... gjorde hun en merkelig serie innspillinger som drev utviklingen.
Bennett: I 2005 kunne vi ikke ha forestilt oss noe som Siri eller Alexa. Og så alle av oss, jeg har snakket med andre mennesker som har hatt den samme opplevelsen, som har vært en virtuell stemme. Du vet at vi bare trodde vi bare gjorde generiske telefontalemeldinger. Og så da plutselig Siri dukket opp i 2011, er det som: Jeg er hvem, hva, hva er dette? Så det var en ekte overraskelse, men jeg liker å tenke på det siden vi bare var på forkant med denne nye teknologien. Så, du vet, jeg velger å tenke på det som en veldig positiv ting, selv om vi, ingen av oss, noen gang ble betalt for millioner og millioner av telefoner som stemmene våre blir hørt på. Så det er en ulempe.
Sterk: Noe annet som er vanskelig ... hun sier at Apple aldri anerkjente henne som den amerikanske stemmen til Siri ... det er til tross for at hun ble en tilfeldig kjendis ... når millioner.
Bennett: Den eneste faktiske anerkjennelsen jeg noen gang har fått er via Siri. Hvis du spør Siri 'Hvem er Susan Bennett?' hun vil si, jeg er den opprinnelige stemmen til Siri. Tusen takk, Siri. Setter pris på det.
Sterk: Men det er ikke første gang hun gir stemmen sin til en maskin.
Bennett: På slutten av 70-tallet, da de introduserte minibanker, liker jeg å si at det var min første erfaring som en maskin, og du vet, det var ingen personlige datamaskiner eller noe på den tiden, og folk stolte ikke på maskiner. De ville ikke bruke minibankene fordi de ikke stolte på at maskinene ga dem de riktige pengene. De, du vet, hvis de la penger i maskinen, var de redde for at de aldri ville se det igjen. Og derfor bestemte et veldig driftig reklamebyrå i Atlanta på den tiden McDonald og Little seg for å menneskeliggjøre maskinen. Så de skrev en jingle og jeg ble stemmen til Tilly, all-time teller, og så satte de til slutt et lite ansikt på maskinen.
Sterk: Den menneskelige stemmen hjelper bedrifter med å bygge tillit hos forbrukerne...
Bennett: Det er så mange forskjellige følelser og betydninger som vi kommer over gjennom lyden av stemmene våre i stedet for bare på trykk. Det er derfor jeg tror emojier dukket opp fordi du ikke får nyansene inn der uten stemmen. Og så jeg tror det er derfor stemmen har blitt en så viktig del av teknologien.
Sterk: Og i hennes egen erfaring, har interaksjoner med denne syntetiske versjonen av stemmen hennes ført til at folk stoler på og stoler på henne ... til å kalle henne en venn, selv om de aldri har møttes henne .
Bennett: Vel, jeg tror det merkeligste med å være stemmen til Siri, for meg, er at da jeg først avslørte meg selv, var det forbløffende for meg hvor mange som betraktet Siri som sin venn eller en slags enhet som de virkelig kunne forholde seg til. Jeg tror de faktisk i mange tilfeller tenker på henne som menneskelig.
Sterk: Det er anslått at det globale markedet for stemmeteknologi vil nå nesten 185 milliarder dollar i år... og AI-genererte stemmer? er en game changer.
Bennett: Du vet, etter år og år med arbeid med disse stemmene, er det virkelig, virkelig vanskelig å få den faktiske rytmen til den menneskelige stemmen. Og jeg er sikker på at de sannsynligvis vil gjøre det på et tidspunkt, men du vil merke selv den dag i dag, du vet, du vil høre på Siri eller Alexa eller en av de andre og de vil snakke sammen og det høres ut bra til det ikke gjør det. Som, Å, jeg skal til butikken. Du vet, det er noe rart i den rytmiske forstanden.
Sterk: Men selv når menneskelignende stemmer blir vanlig ... hun er ikke helt sikker på at det vil være en god ting.
Bennett: Men du vet, fordelen for dem er at de egentlig ikke trenger å komme overens med Siri. De kan bare fortelle Siri hva de skal gjøre hvis de ikke liker det hun sier, de kan bare slå det av. Så det er ikke som ekte menneskelige relasjoner. Det er kanskje som folk vil at menneskelige relasjoner skal være. Alle gjør det jeg vil. (latter) Da er alle glade. Ikke sant?
Sterk: Selvfølgelig er ikke stemmeassistenter som Siri og Alexa det bare stemmer. Deres evner kommer også fra AI bak kulissene.
Det har blitt utforsket i science fiction-filmer som denne, kalt Henne … om en mann som forelsker seg i stemmeassistenten sin.
Theodore: Hvordan jobber du?
Samantha (AI): Vel... I utgangspunktet har jeg intuisjon. Jeg mener.. DNAet til hvem jeg er er basert på millioner av personligheter til alle programmererne som skrev meg, men det som gjør meg Jeg er min evne til å vokse gjennom mine erfaringer. Så i utgangspunktet utvikler jeg meg i hvert øyeblikk, akkurat som deg.
Sterk: Men dagens stemmeassistenter er langt unna de hyperintelligente tenkemaskinene vi har fundert på i flere tiår.
Og det er fordi teknologien... faktisk er det mange teknologier. Det er kombinasjonen av tre forskjellige ferdigheter ... talegjenkjenning, naturlig språkbehandling og stemmegenerering.
Talegjenkjenning er det som lar Siri gjenkjenne lydene du lager og transkribere dem til ord. Naturlig språkbehandling gjør disse ordene til mening... og finner ut hva de skal si som svar. Og stemmegenerering er det siste stykket ... det menneskelige elementet ... som gir Siri evnen til å snakke.
Hver av disse ferdighetene er allerede en stor utfordring... For å mestre kun den naturlige språkbehandlingsdelen? Du må ganske mye gjenskape intelligens på menneskelig nivå.
Og det er vi ikke i nærheten av. Men vi har sett bemerkelsesverdige fremskritt med fremveksten av dyp læring ... noe som hjelper Siri og Alexa til å være litt mer nyttige.
Metz: Det folk kanskje ikke vet om Siri er at originalteknologi var noe annerledes.
Sterk: Cade Metz er en teknisk reporter for New York Times. Hans nye bok heter Genius Makers: Mavericks Who Braught AI til Google, Facebook og verden .
Metz: Måten Siri opprinnelig ble bygget på... Du måtte ha et team med ingeniører, i et rom, ved datamaskinene deres og bit for bit, de måtte definere med datakode hvordan den skulle gjenkjenne stemmen din.
Sterk: Den gang... ingeniører brukte dager på å skrive detaljerte regler for å vise maskiner hvordan de gjenkjenner ord og hva de mener.
Og dette ble på det meste gjort grunnleggende nivå ... jobber ofte med bare stemmebiter om gangen.
Tenk deg alle de forskjellige måtene folk kan si ordet hei på ... eller alle måtene vi setter sammen setninger på ... som forklarer hvorfor tiden flyr eller hvordan noen verb også kan være substantiv.
Metz: Du kan aldri sette sammen alt du trenger, uansett hvor mange ingeniører du har, uansett hvor rik bedriften din er. Å definere hver minste ting som kan skje når noen snakker inn i iPhonen deres... Du har bare ikke nok personkraft til å bygge alt du trenger å bygge. Det er bare for komplisert.
Sterk: Nevrale nettverk gjorde den prosessen mye enklere... De lærer ganske enkelt ved å gjenkjenne mønstre i data som mates inn i systemet.
Metz: Du tar den menneskelige talen... Du gir den til det nevrale nettverket... Og det nevrale nettverket lærer mønstrene som definerer menneskelig tale. På den måten kan den gjenskape den uten at ingeniører trenger å definere hver eneste lille del av den. Det nevrale nettverket lærer bokstavelig talt oppgaven på egen hånd. Og det er nøkkelendringen... er at et nevralt nettverk kan lære å gjenkjenne hvordan en katt ser ut, i motsetning til at folk må definere for maskinen hvordan en katt ser ut.
Sterk: Men selv før nevrale nettverk... Teknologiselskaper som Microsoft hadde som mål å bygge systemer som kunne forstå den daglige måten folk skriver og snakker på.
Og i 1996 hyret Microsoft inn en lingvist ... Chris Brocket ... for å begynne arbeidet med det de kalte naturlig AI.
Metz: Fyren er ikke informatiker, men jobben hans var å definere måten språket er satt sammen på, ikke sant. For en datamaskin. Og det er bare en utrolig vanskelig oppgave, ikke sant? Hvorfor bestiller vi som engelsktalende ordene våre, slik vi gjør, ikke sant? Og han, han tilbrakte år, bokstavelig talt år, fem eller seks år hos Microsoft, du vet, sakte, du vet, og prøvde å fortelle datamaskinen hvordan engelsk er satt sammen. Så da kan datamaskinen gjøre det.
Sterk: Så, en ettermiddag i 2003... begynte en liten gruppe hos Microsoft... nede i gangen fra Brockett... å jobbe med et nytt prosjekt. De bygde et system som oversatte språk ved hjelp av en teknikk basert på statistikk.
Tanken var at hvis et sett med ord på ett språk dukket opp med samme frekvens og kontekst på et annet, var det den sannsynlige oversettelsen.
Metz: De satte sammen en prototype i løpet av noen uker og viste den frem for en gruppe ved Microsofts forskningssenter – inkludert Chris Brocket.
Sterk: Systemet er... ganske brosteinsbelagt. Det bare virker når de ble brukt på deler av en setning... Og selv da... ble oversettelsene rotete.
Metz: Når han ser dem demonstrere dette .. får han et panikkanfall til et punkt hvor han bokstavelig talt tror han har et hjerteinfarkt fordi han innser at karrieren hans kan være over. At alt han har brukt de siste seks årene på // er meningsløst og har blitt gjort meningsløst av systemet som disse gutta bygde i løpet av få uker.
Sterk: På den tiden hadde vi ikke mengden data som trengs for å trene et nevralt nettverk, og heller ikke prosessorkraften ... men ideen om en har eksistert siden 1980-tallet.
Og en av disse ideene kom i form av NetTalk... som ble utviklet av AI-pioneren Terry Sejnowski.
Systemet kan lære å snakke ord på egen hånd ved å studere barnebøker.
Metz: Terry hadde denne utrolige demoen som han ville vise til folk på konferanser. Det var på en måte forsinket fordi det tok en stund før det nevrale nettverket lærte seg, men han kunne vise at etter hvert som det begynte å analysere mønstrene i disse barnebøkene, kunne de begynne å pludre...
[Lyder fra NetTalk Demo]
Metz: og så kunne den pludre litt bedre, og så kunne den begynne å lappe ord sammen, og så kunne den plutselig uttale disse ordene.
[Lyder fra NetTalk Demo]
Metz: Han kunne vise publikum // med denne demoen hvordan et nevralt nettverk kan lære.
Sterk: Det ville ta ytterligere to tiår før datakraften eksisterte for å virkelig gjøre dette nyttig.
Metz: Så naturlig språk var et område der folk tenkte, selv etter suksessen til nevrale nettverk med tale og bilde: Å, vel, det kommer ikke til å fungere med naturlig språk. Vel, det har det. Det betyr ikke at det er perfekt.
Sterk: Deep learning, (teknologien som driver den nåværende AI-boomen), kan trene maskiner til å bli mestere i alle slags oppgaver. Men den kan bare lære ting én om gangen. Og fordi de fleste AI-modeller trener ferdighetene sine på tusenvis eller millioner av eksempler, ender de opp med å gjenta mønstre som finnes i gamle data – inkludert de mange dårlige avgjørelsene som folk har tatt, som å marginalisere fargede og kvinner.
Og alle store fremskritt vekker denne debatten om når mennesker vil skape en kunstig generell intelligens – eller maskiner som kan multitaske, tenke og resonnere for seg selv. Nylig har det vært fremskritt som brettspillmesteren AlphaZero ... og den stadig mer overbevisende falske tekstgeneratoren GPT-3 ...
Metz: Det kan, det kan generere blogginnlegg. Det kan generere tweets, e-poster. Den kan generere dataprogrammer. Du vet, det fungerer kanskje halvparten av tiden, men når det fungerer, kan du ikke se forskjell på engelsk og engelsk. Greit. Det er fremgang. Det er ikke hjernen, det er ikke engang i nærheten, men det er fremskritt.
Sterk: Og disse og andre verktøy er også... utrolig splittende.
Metz: Kan vi i nær fremtid bygge et system som kan gjøre alt den menneskelige hjerne kan gjøre. Ikke sant. Og folk vil krangle om dette, som å skumme i munnen på hver side. Realiteten er at vi ikke aner. Som om det er folk som er helt sikre på at dette kommer til å skje ganske snart, men de vet ikke hva veien er der. Ingen av oss kan forutsi fremtiden. Og så er det en krangel om ingenting som fundamentalt kan avgjøres. Så selvfølgelig tar argumentet aldri slutt. Du går tilbake til 50-tallet og det er, det er alle de samme tingene, ikke sant?
Sterk: Men hvis vi er å en dag replikere den intelligensen ... kan vi også være i stand til å replikere oss selv?
…Det er etter pause.
[Midroll]
[Musikkovergang]
Sterk : Kunstige stemmer har eksistert en stund ... men de begynte ikke å bli mer menneskelignende før de siste fem årene.
Som da Deepminds tekst-til-tale-algoritme kalt WaveNet kom på scenen ... som er grunnlaget for Googles assistent Duplex ... den som kan bestille din hårtime eller restaurantreservasjon.
[Sounds of Google Duplex planlegger en hårtime på brukerens vegne]
*Telefonen ringer*
Stylist: Hallo. Hvordan kan jeg hjelpe deg?
AI: Hei. Jeg ringer for å bestille en dameklipp for en kunde. Umm... jeg ser etter noe 3. mai.
Stylist: Sikker. Gi meg ett sekund.
Sterk: Siden den gang har mange andre selskaper jobbet for å kommersialisere lignende taleteknologier. Lyrebird... Beskriv... Respeecher... bare for å nevne noen.
Det er også en rekke selskaper som er rettet mot å bevare minnet om våre kjære ... ved å lage interaktive, digitale versjoner av dem.
Ett selskap, kalt HereAfter, gjør dem om til chatbots som kan brukes med taleassistenter.
Og Tech Review-reporter Charlotte Jee prøvde det ut med foreldrene sine...
Jeee: Alexa, åpne HereAfter.
Syntetisk stemme: Velkommen til HereAfter. Vil du heller snakke med Paul eller med Jane?
Jeee: Jeg vil heller snakke med Jane.
Virtual Jane: Hei, dette er Jane Jee, og jeg forteller deg gjerne om livet mitt.
Jeee: HAHA ÅH HERREGUD!
Virtual Jane: Hvordan har du det i dag?
Jeee: Jeg har det bra, takk, mamma. Hvordan har du det?
Virtual Jane: Bra.
Sterk: Systemets lytteferdigheter ... er ikke de beste. Du kan bare stille korte, enkle spørsmål... og du må vente til systemet er ferdig med å snakke før du kan stille et nytt spørsmål.
Virtual Jane: Det er så mye å snakke om. Min barndomskarriere og mine interesser, hvilken av disse høres best ut?
Jeee: Uh... barndommen din.
Virtual Jane: Klart det. Jeg fikk problemer som barn fordi jeg var veldig uavhengig og jeg likte å bruke friheten min...
Sterk: Men det du hører nå... er faktisk ikke en falsk eller syntetisk versjon av Charlottes mor. Faktisk er denne opplevelsen avhengig av overraskende mindre AI enn du skulle tro.
Foreldrene hennes ble intervjuet i timevis av HereAfter med spørsmål fra Charlotte og søsteren hennes. Det intervjuet ble deretter redigert og delt inn i emneseksjoner... som kan tas opp og spilles av systemet basert på spørsmålene de stiller.
Men ... som vi har sett ... stemmen er kraftig. Spesielt når det presenteres som en interaktiv opplevelse.
Jeee: Herregud. (latter) Det var så rart!
Det var som å høre mamma... som en maskin. Det var virkelig skummelt.
Jeg følte meg mer emosjonell av å lytte til det enn jeg forventet? Når, liksom, stemmen slappet av og det hørtes ut som henne.
Sterk: Dette føles mye som noe vi har sett før. Som i en episode av Svart speil … der en kvinne bruker partnerens smarttelefondata til å lage en syntetisk versjon av stemmen hans etter at han dør.
[Lydes fra Svart speil - AI-sikting gjennom delte medier, montasje av lydklipp fra kvinnens avdøde partner]
Sterk: Den siler gjennom gamle videoer, tekster, talemeldinger og innlegg på sosiale medier for å bygge et system som er i stand til å etterligne stemmen hans... og personlighet.
AI: Hallo?
Kvinne: ...Hei! Du... høres ut som ham.
AI: Nesten skummelt, ikke sant? Jeg sier skummelt.... Jeg mener, det er helt vanvittig at jeg til og med kan snakke med deg. Jeg mener...jeg har ikke engang en munn.
Kvinne: Det er...Det er bare...
AI: Er det hva?
Kvinne: Det er akkurat den typen ting han ville sagt.
AI: Vel... det er derfor jeg sa det.
Sterk: Som bringer opp et vanskelig problem... bygger hun tillit til AI-partneren sin... eller er det bare å fortelle henne hva hun vil høre...?
Og utover hvordan vi kan utvikle stemmeteknologier som er i stand til sunn fornuft eller selvforbedring... ligger enda et spørsmål vi nettopp har begynt å reise... som er... hvordan regner vi med denne nyvunne kraften... til å syntetisere noe så personlig som noens stemme?
[KREDITTER]
Sterk: Neste episode... Vi ser på rollen til automatisering på kreditt.
Michele Gilman: Statens vitne som var sykepleier, kunne ikke forklare noe om algoritmen. Hun gjentok bare om og om igjen at det var internasjonalt og statistisk validert, men hun kunne ikke fortelle oss hvordan det fungerte, hvilke data som ble matet inn i det, hvilke faktorer det veide, hvordan faktorene ble veid. Og så ser advokatstudenten min på meg og vi ser på hverandre og tenker, hvordan kryssundersøker vi en algoritme...
Sterk: Denne episoden ble laget av meg, Emma Cillekens, Anthony Green, Karen Hao og Charlotte Jee. Vi er redigert av Michael Reilly og Niall Firth.
Takk for at du lyttet, jeg heter Jennifer Strong.
[TR ID]