Siri kan bli smartere ved å lære av sine feil

Apples stemmeassistent, Siri.





Prøv å holde en kort samtale med Siri, Cortana eller Alexa, og du kan ende opp med å banke hodet mot nærmeste vegg i frustrasjon.

Taleassistenter er ofte flinke til å svare på enkle spørsmål, men de sliter med kompliserte forespørsler eller noen form for frem og tilbake. Dette kan imidlertid begynne å endre seg ettersom nye maskinlæringsteknikker blir brukt på utfordringen med menneske-maskin-dialog i løpet av de neste årene.

Talte på en stor AI-konferanse i forrige uke, Steve Young , en professor ved University of Cambridge som også jobber deltid på Apples Siri-team, snakket om hvordan nyere fremskritt begynner å forbedre dialogsystemer. Young kommenterte ikke arbeidet hans hos Apple, men beskrev hans akademiske forskning.

Tidlige stemmeassistenter, inkludert Siri, brukte maskinlæring for stemmegjenkjenning, men reagerte på språk i henhold til hardkodede regler. Dette endrer seg stadig mer ettersom maskinlæringsteknikker brukes til å analysere språk (se AIs språkproblem).

Young sa spesielt at forsterkende læring, teknikken DeepMind brukte for å bygge et program som er i stand til å slå en av verdens beste Go-spillere, kan bidra til å fremme den nyeste teknologien betydelig. Mens AlphaGo lærte ved å spille tusenvis av spill mot seg selv, og fikk positiv forsterkning med hver seier, kunne samtaleagenter variere svarene sine og motta positive (eller negative) tilbakemeldinger i form av brukernes handlinger.

Jeg tror det må være en stor ting, sa Young om forsterkningslæring da jeg snakket med ham etter foredraget hans. Den kraftigste ressursen du har er brukeren.

Young sa at stemmeassistenter ikke trengte å variere atferden sin dramatisk for at dette skulle ha en effekt. De kan rett og slett prøve å utføre en handling på en litt annen måte. Du kan gjøre det på en veldig kontrollert måte, sa han. Du trenger ikke gjøre dumme ting.

Under foredraget forklarte Young hvorfor det er så vanskelig å analysere språk for maskiner. I motsetning til bildegjenkjenning, for eksempel, er språk komposisjonell, noe som betyr at de samme komponentene kan omorganiseres for å produsere vidt forskjellige betydninger. En annen sentral utfordring med språk er at det bare gir et ufullstendig glimt av hva en annen person tenker, så det er ofte nødvendig å gjette på hva en setning eller setning betyr. På et praktisk nivå, ettersom et talt søk blir lengre, krever tolking av det ofte sammenslåing av kunnskap fra forskjellige domener. For eksempel kan et komplekst spørsmål om en restaurant kreve en forståelse av tid, sted og mat.

Likevel mener Young at tiden er inne for samtaleassistenter å bli mye bedre. Den kommersielle etterspørselen er der, og teknologien er der, sier han. Jeg tror du vil se virkelig betydelig fremgang i løpet av de neste fem årene.

Young begynte i Apple etter at selskapet kjøpte opp oppstarten hans, VocalIQ, i 2015. Apple har blitt anklaget for å ligge bak konkurrenter i kappløpet om å utnytte teknologi basert på fremskritt innen maskinlæring og AI, men Youngs arbeid tyder på at dette er langt fra sant. Og selskapet har også anstrengt seg for å åpne opp sin AI-forskning for å tiltrekke seg topptalenter. Selskapet ansatte nylig Ruslan Salakhutdinov, en professor fra Carnegie Mellon University, til å fungere som dets første direktør for AI, og forskerne har begynt å presentere og publisere artikler for første gang (se Apple får sin første direktør for AI).

Apple er selvfølgelig ikke det eneste selskapet som er interessert i samtaleteknologi. Amazons Alexa – en enhet for hjemmet som helt og holdent er avhengig av stemmestyring – har blitt en hit, og andre selskaper har hastet med å utvikle lignende hjemmehjelpere. Googles tilbud, kalt Google Home, bruker spesielt avanserte språkanalyseteknikker (se Googles assistent er mer ambisiøs enn Siri og Alexa).

Forskere ved IBM, i samarbeid med et team fra University of Michigan, eksperimenterer også med samtalesystemer som utnytter forsterkende læring. Satinder Baveja , en professor ved University of Michigan som er involvert i det prosjektet, sier forsterkningslæring tilbyr en kraftig ny måte å trene dialogsystemer på, men han tror ikke Siri oppnår virkelig menneskelignende kommunikasjonsevner i løpet av livet.

Disse systemene vil begynne å bruke rikere kontekst, sier han. Selv om jeg tror at de vil forbli begrenset i omfang, og adresserer spesifikke oppgaver som restaurantreservasjoner, reiser, teknisk støtte og så videre.

gjemme seg