211service.com
Alexa, Forstå meg
romerske muradov
31. august 2012 innleverte fire Amazon-ingeniører det grunnleggende patentet for det som til slutt ble Alexa, et kunstig intelligenssystem designet for å engasjere seg i et av verdens største og mest sammenfiltrede datasett: menneskelig tale. Ingeniørene trengte bare 11 ord og et enkelt diagram for å beskrive hvordan det ville fungere. En mannlig bruker i et stille rom sier: Vennligst spill «Let It Be» av Beatles. En liten bordmaskin svarer: Ikke noe problem, John, og begynner å spille den forespurte sangen.
Fra den beskjedne starten har stemmebasert kunstig intelligens for hjemmet blitt en stor bedrift for Amazon og i økende grad en strategisk slagmark med sine teknologirivaler. Google, Apple, Samsung og Microsoft setter hver tusenvis av forskere og forretningsspesialister i arbeid med å prøve å lage uimotståelige versjoner av brukervennlige enheter som vi kan snakke med. Til nå har vi alle bøyd oss for å imøtekomme teknologi, når det gjelder å skrive, trykke eller sveipe. Nå bøyer de nye brukergrensesnittene seg mot oss, observerer Ahmed Bouzid, administrerende direktør i Witlingo, som bygger stemmedrevne apper av alle slag for banker, universiteter, advokatfirmaer og andre.
Denne historien var en del av utgaven for september 2017
- Se resten av saken
- Abonnere
For Amazon har det som startet som en plattform for en bedre jukeboks blitt noe større: et kunstig intelligenssystem bygget på, og stadig lærer av, menneskelige data. Dens Alexa-drevne Echo-sylinder og tinier Dot er allestedsnærværende husholdningshjelpere som kan slå av lysene, fortelle vitser eller la deg lese nyhetene håndfritt. De samler også inn mengder av data om brukerne deres, som brukes til å forbedre Alexa og legge til bruken.
Titalls millioner av Alexa-drevne maskiner har blitt solgt siden deres markedsdebut i 2014. I det amerikanske markedet for stemmedrevne AI-enheter antas Amazon å ta opp rundt 70 prosent av alt enhetsalg, selv om konkurransen tiltar. Google Home har også solgt millioner av enheter, og Apple og Microsoft lanserer snart sine egne versjoner.
Den ultimate gevinsten er muligheten til å kontrollere – eller i det minste påvirke – tre viktige markeder: hjemmeautomatisering, hjemmeunderholdning og shopping. Det er vanskelig å vite hvor mange som ønsker å snakke med kjøleskapet sitt, men hverdagsmønstrene endrer seg raskt. På samme måte som smarttelefoner har endret alt fra datingetikett til fotgjengeres ganghastighet, begynner stemmebasert AI å endre mange aspekter av hjemmelivet. Hvorfor stå opp for å låse inngangsdøren eller starte bilvarmeren på en bitende kald dag, når Alexa eller hennes slektninger umiddelbart kan ordne opp i ting i stedet?
Foreløpig prøver ikke Amazon å samle inn inntekter fra selskaper som lager smarte termostater, lyspærer og andre Alexa-tilkoblede enheter. På veien er det imidlertid lett å forestille seg hvordan inntektsdelingsordninger eller andre betalinger kan slå på. Det minste av disse tre markedene, hjemmeautomatisering, står allerede for mer enn 5 milliarder dollar i utgifter hvert år, mens detaljsalget i USA i fjor var 4,9 billioner dollar. I dag tjener Amazon penger på selve maskinene, til priser som varierer fra $50 for Dots til $230 for de høyeste Echos med videoskjermer, og høster en ny gevinst hvis brukere ender opp med å handle mer i Amazons store nettbutikk. (Amazon vil imidlertid ikke avsløre disse trafikktallene.)
For at Echos skal bli like gjennomgripende som smarttelefoner, må de gjøre mange flere ting. For det formål oppfordrer Amazon uavhengige utviklere til å bygge nye tjenester på plattformen, akkurat som Apple lenge har gjort med apputviklere. Mer enn 15 000 slike ferdigheter, eller apper, har blitt bygget så langt, og app-byggingsverktøy har blitt så enkle å koble sammen at det nå er mulig å bygge en enkel ferdighet på omtrent en time, uten mye programmeringskunnskap. Blant de mest populære appene er ride-hailing-alternativer fra Uber og Lyft. Duds inkluderer 48 separate ferdigheter som bombarderer lyttere med fornærmelser.
Blant de mest ambisiøse utviklerne er selskaper som lager maskinvare eller selger tjenester som fungerer med Alexa. Capital One, for eksempel, tilbyr Alexa-basert regningsbetaling til sine bankkunder; Toronto-baserte Ecobee er en av en rekke produsenter av smarte termostater for å rigge opp Alexa-drevne versjoner som lar folk heve eller senke romtemperaturen bare ved å si noen få ord. Kundene våre har travle liv, sier Stuart Lombard, administrerende direktør i Ecobee, som nå får omtrent 40 prosent av det totale salget fra sine Alexa-enheter, det 10 år gamle selskapets raskest voksende produktlinje. De må kjempe mot trafikken for å komme seg hjem, og så må de mate barna, bleie babyen, og hvem vet hva mer. Vi gir dem en håndfri måte å få noe gjort mens de er midt i andre oppgaver.
Når tale møter AI
Det som gjør stemmebasert AI så attraktivt for forbrukere, er løftet om å tilpasse seg oss, å svare på måten vi snakker – og tenker – uten å kreve at vi skriver på et tastatur eller en skjerm. Det er også det som gjør det så teknisk vanskelig å bygge. Vi er ikke i det hele tatt ryddige når vi snakker. I stedet avbryter vi oss selv. Vi lar tankene dingle. Vi bruker ord, nikk og grynt på rare måter, og vi antar at vi gir mening selv når vi ikke er det.
Noen sier nei, nei, nei; andre foretrekker Avbryt det, og en tredje gjeng prøver en eller annen variant av Vent, faktisk, her er det jeg vil ha i stedet. Alexa trenger ikke å dekode hver ytring.
Tusenvis av Amazon-ansatte jobber med denne utfordringen, inkludert noen ved forskningsknutepunkter i Seattle, Sunnyvale, California og Cambridge, Massachusetts. Likevel tilbød Amazons karriereside nylig 1100 flere Alexa-jobber fordelt på et dusin avdelinger, inkludert 215 spilleautomater for maskinlæringsspesialister. Under et møte på selskapets Cambridge-kontorer spurte jeg Alexas sjefforsker, Rohit Prasad, hvorfor han trenger så mange mennesker – og når forskerteamet hans kan være fullt bygget ut.
Jeg ler av alle aspekter av spørsmålet ditt, svarte Prasad.
Etter noen sekunder, etter å ha gjenvunnet fatningen, forklarte Prasad at han har jobbet med taleteknologi i 20 år, med frustrerende trege resultater i det meste av den perioden. De siste fem årene har det imidlertid åpnet seg store muligheter. Å lage en virkelig effektiv stemmeutløst AI er en kompleks og fortsatt uovervunnet oppgave (se AIs språkproblem). Men mens taleforskere tidligere slet med å bestemme den eksakte betydningen av noen ganger kaotiske ytringer på første forsøk, gjør nye tilnærminger til maskinlæring fremskritt ved å ta en annen takt: de jobber fra ufullkomne treff i begynnelsen, etterfulgt av raske finjustering av foreløpige gjetninger. Nøkkelen er å jobbe gjennom store mengder brukerdata og lære av tidligere feil. Jo mer tid Alexa bruker med brukerne sine, jo mer data samler den inn å lære av, og jo smartere blir den. Med fremgang kommer flere muligheter, og behovet for mer arbeidskraft.
La meg gi deg et eksempel, sa Prasad. Hvis du spør Alexa «Hva var Adeles første album?» bør svaret være « 19 .’ Hvis du så sier «Spill det», vil Alexa vite nok til å begynne å spille det albumet. Men hva om det er noen samtalespiker i midten? Hva om du først spør Alexa hvilket år albumet kom ut, og hvor mange eksemplarer det solgte? Fullfør en slik utveksling med den kryptiske Play it, og tidligere versjoner av Alexa ville ha blitt stusset. Nå kan teknologien følge den tankegangen, i det minste noen ganger, og innse at den fortsatt betyr 19 .
Denne forbedringen kommer fra maskinlæringsteknikker som revurderte tusenvis av tidligere utvekslinger der Alexa snublet. Systemet lærer hva sangbrukere faktisk ønsket å høre, og hvor de tidligere delene av samtalen først identifiserte det musikkstykket. Du må gjøre noen antagelser i begynnelsen om hvordan folk vil spørre om ting, sier James Glass, leder av gruppen for tale--språksystemer ved MIT. Deretter samler du inn data og justerer modellene dine.
Saken for en slik maskinlæringstilnærming er allment verdsatt, sier Glass, men å få det til å fungere krever langt mer data enn universitetsforskere lett kan mønstre. Med Alexas bruk økende, har Amazon nå tilgang til et ekspansivt oppbevaringssted for taleinteraksjoner mellom mennesker og datamaskiner – noe som gir den den slags fordel i finjustering av stemmeteknologien som Google lenge har hatt glede av i tekstbaserte søk. Eksterne data hjelper også: en massiv database med sangtekster lastet inn i Alexa i 2016, for eksempel, har bidratt til å sikre at brukere som spør etter sangen med kjørte min Chevy til floden, vil bli styrt til Don McLeans American Pie.
Et av de nyeste prosjektene for Prasads gruppe fremhever fleksibiliteten til denne tilnærmingen. Det innebærer å tyde øyeblikkene når brukere går tilbake på sine første forespørsler. Signalsetningsfraser kan variere enormt. Noen sier nei, nei, nei; andre foretrekker Avbryt det, og en tredje gjeng prøver en eller annen variant av Vent, faktisk, her er det jeg vil ha i stedet. Alexa trenger ikke å dekode hver ytring. Store prøver og semi-overvåket maskinlæring gjør det mulig for den å skissere en klynge av sannsynlige markører for negert tale, og deretter plukke opp en sammenhengende ny forespørsel etter kursendringen.
I tillegg til å gjøre Alexa til en bedre lytter, bruker Amazons AI-eksperter mengder av data for å gjøre den til en bedre høyttaler, og finjusterer kadensene til maskinens syntetiske kvinnestemme, for å øke vedvarende bruk. Tradisjonelle forsøk på talesyntese er avhengige av å smelte sammen mange fragmenter av innspilt menneskelig tale. Selv om denne teknikken kan produsere en rimelig naturlig lyd, egner den seg ikke til hvisking, ironi eller andre modulasjoner en engasjerende menneskelig høyttaler kan bruke. For å skjerpe Alexas håndtering av alt fra heftig dialog til rolige fremføringer, kan Amazons maskinlæringsalgoritmer ta en annen tilnærming, og trene på de ivrige, engstelige – og klokt-klingende – stemmene til profesjonelle fortellere. Det hjelper at Amazon eier lydbokutgiveren Audible.
Så mye å snakke om
Blant de mest ivrige brukerne av stemmebasert AI er folk som ikke enkelt kan skrive på telefoner eller nettbrett. Gavin Kerr, administrerende direktør i Philadelphia's Inglis, som tilbyr boliger og tjenester for funksjonshemmede, har installert Amazon Echo og Dot-enheter i åtte beboeres hjem. Han håper å til slutt legge dem til alle 300-noen boliger når pilottestingen er fullført. Det er en utrolig velsignelse for innbyggerne, sier Kerr. De kan være mer komfortable. Det gir dem selvstendighet.
Kerr jobber med hundrevis av mennesker som har multippel sklerose eller andre svekkende tilstander. For de som er sengeliggende eller bruker rullestol, kan en vanskelig tilgjengelig veggtermostat være en konstant kilde til plager. Kroppen deres har vanskelig for å regulere temperaturen, forklarer Kerr. Et rom som er 72 °F kan føles varmt én time og kaldt den neste. Med begrenset mobilitet er det ingen enkel måte å bli komfortabel på, spesielt hvis assistanse hele døgnet ikke er tilgjengelig.
Med litt fiksing kan Alexas programvare tjene selv de med sterkt begrenset tale. Kerr forteller om en mann i slutten av 30-årene som ønsket å forlate en langtidspleie og flytte tilbake til et hverdagssamfunn. Han fortalte oss: 'Jeg vil aldri kunne bruke Alexas kommandoer,' husker Kerr. Så vi spurte ham: ‘Hva kan du si?’ Så omarbeidet vi programvaren slik at han kunne få Alexa til å fungere på sine premisser. Nå sier han «mamma» når han vil tenne kjøkkenlysene, og «John» når han vil tenne lysene på badet.
Selv om Inglis gir sine Echo-brukere fire timers trening, er det langt mer vanlig at nye brukere famler seg frem. Trekk et ekko ut av esken, og litt innpakning vil fremheve spesielt vanlige applikasjoner, som å spille musikk, stille inn alarmer eller oppdatere handlelister. Organiserte brukere kan ringe opp Alexa-kontrollpaneler på smarttelefoner eller bærbare datamaskiner for å justere innstillinger, lete etter nye apper eller få veiledning om hvilke spørsmål som får en app til å fungere best.
Alexas bredere suksess ligger i dens evne til å lindre stresset i et overbooket liv. Det er følgesvennen som alltid er klar til å engasjere seg.
I en mye lest blogginnlegg i juni skrev Microsofts produktsjef Darren Austin at Alexas bredere suksess ligger i dens evne til å lindre stresset i et overbooket liv. Med den enkle handlingen å spørre, skrev Austin, lindrer Alexa de negative følelsene av usikkerhet og frykten for å glemme. Brukere blir hekta på å bringe alle slags øyeblikkelige gåter eller ønsker til Alexa, hevdet han; det er følgesvennen som alltid er klar til å engasjere seg.
Hver uke – noen ganger oftere – skanner Alexa daglig leder Rob Pulciani samlede data om de vanligste ytringene fra Alexa- og Dot-brukere. Vanligvis domineres toppen av listen av forespørsler om musikk, nyheter, vær, trafikk og spill. Den siste våren steg imidlertid en nykommer raskt. Trendsetningen: Alexa, hjelp meg å slappe av.
Når brukere kommer med denne forespørselen, blir de styrt inn i en samling beroligende lyder. fugler kvitrer; fjerne bølger treffer kysten; godstog buldrer gjennom natten. Slike omgivelsesstøysløyfer kan fortsette å spille i timevis hvis brukerne velger det. Pulciani hadde sett på disse appene som små rariteter da de først dukket opp på Alexa-plattformen, i 2015. Men de har raskt fått en stor tilhengerskare. Stressede voksne bruker lydene for å sovne. Foreldre gjør dem til vuggeviserstatninger for grinete spedbarn. I løpet av de neste ukene etter oppdagelsen hans, finjusterte Pulciani og kollegene Alexas interne arkitektur slik at nye Echo-kjøpere raskt kunne oppdage beroligende lyder hvis de ba om tips om hvilke nye ferdigheter de skulle prøve.
Vedvarende samtale
I studier viser AI-plattformer fra Google, Apple, Microsoft og Amazon alle forskjellige styrker. Google Assistant er best på omfattende søkekommandoer. Apples Siri og Microsofts Cortana har andre talenter. Alexa gjør det spesielt godt med shoppingkommandoer.
Den ultimate triumfen for stemmebasert AI ville være å føre en realistisk samtale på flere minutter med brukere. En slik prestasjon vil kreve store hopp i maskinens evne til å se menneskelige høyttaleres hensikt, selv når det ikke er en åpenbar forespørsel. Mennesker kan finne ut at en venn som sier at jeg ikke har vært på treningssenteret på flere uker, sannsynligvis vil snakke om stress eller selvtillit. For AI-programvare er det et vanskelig sprang. Plutselige skifter i emne - eller skrå hentydninger - er også vanskelige.
Ivrig etter å styrke båndene med neste generasjon AI- og taleforskere, inviterte Amazon for et år siden ingeniørstudenter ved et dusin universiteter over hele verden til å bygge stemmeroboter som kan opprettholde en 20-minutters samtale. Campus som gjør størst fremgang innen novembers frist vil vinne en premie på $500 000. Jeg var på audition på et halvt dusin av disse robotene en helg, og flyttet hver gang fra enkle spørsmål til vanskeligere åpne meningserklæringer som inviterte til alle mulige svar. Vi fikk en god start da en bot spurte meg: Har du sett noen nyere filmer? Ja, svarte jeg, vi så Skjulte figurer . I stedet for å etterligne avisanmeldelser av denne gripende filmen om NASAs tidlige år, skjøt den sosiale boten tilbake: Jeg trodde Skjulte figurer var veldig tynn på den faktiske matematikken av det hele. Ikke mitt syn på filmen, men det virket som en sjarmerende passende ting for et AI-program å si. Samtalen vår stoppet opp like etterpå, men vi hadde i det minste det korte, vakre øyeblikket.
Relatert historie
Relatert historie Maskiner som virkelig forstår språk ville være utrolig nyttige. Men vi vet ikke hvordan vi skal bygge dem.Akk, ingen av de andre robotene kunne komme i nærheten. Den mest forvirrede røpet ut setninger som Liker du fortaustjeneste? da jeg trodde vi prøvde å snakke om internettsider. Jeg sa noe kanskje litt skarpt om botens begrensninger, bare for å bli spurt: Kan du ta kollektive forhandlinger?
Noen dager senere, da jeg spurte Amazons Prasad om hans syn på sosiale roboter, plaget ingen av de tidlige feilene ham. Det er et superviktig område, fortalte han meg. Det er dit Alexa kan gå når det gjelder å være veldig smart. Men dette er mye vanskeligere enn å spille spill som Go eller sjakk. Med disse spillene, selv om de har mange mulige trekk, vet du hva sluttmålet er. Med en samtale vet du ikke engang hva den andre personen prøver å oppnå. Når Alexa er i stand til å finne ut av det, vil vi virkelig snakke.
George Anders har dekket Amazon for nasjonale publikasjoner siden slutten av 1990-tallet. Hans nyeste bok er Du kan gjøre hva som helst.
