IBMs debatterende AI ble bare mye nærmere å være et nyttig verktøy

IBMs debattsystem i Cambridge

IBMs debattsystem i Cambridge IBM Research





Datamaskiner har ledet oss til månen og tilbake, men kan ikke hjelpe oss med de største avgjørelsene vi står overfor i dag. Bør Donald Trump stilles for riksrett og fjernes fra embetet? Bør Storbritannia forlate EU? Bør Australia slutte å eksportere fossilt brensel? Spørsmål som disse har ikke enkle ja eller nei svar, uansett hvor fristende det er å tro noe annet.

Vi tar beslutninger ved å veie fordeler og ulemper. Kunstig intelligens har potensial til å hjelpe oss med det ved å sile gjennom stadig økende hauger med data. Men for å være virkelig nyttig, må den resonnere mer som et menneske. Vi benytter oss av overbevisende språk og all slags bakgrunnskunnskap som er svært vanskelig å modellere i AI, sier Jacky Visser ved Center for Argument Technology ved University of Dundee, Storbritannia. Dette har vært en av de hellige gralene siden folk begynte å tenke på AI.

En kjerneteknikk som brukes til å hjelpe maskiner med fornuft, kjent som argument mining, innebærer å bygge programvare for å analysere skriftlige dokumenter og trekke ut nøkkelsetninger som gir bevis for eller mot et gitt krav. Disse kan deretter settes sammen til et argument. I tillegg til å hjelpe oss med å ta bedre beslutninger, kan slike verktøy brukes til å fange opp falske nyheter – undergrave tvilsomme påstander og sikkerhetskopiere fakta – eller for å filtrere søkeresultater på nettet, og returnere relevante utsagn i stedet for hele dokumenter.



Andre gruppers arbeid med argumentutvinning har fokusert på spesifikke typer tekster, for eksempel juridiske dokumenter eller studentoppgaver, som har en tendens til å inneholde mye strukturert argument til å begynne med. Det er nyttig hvis du vil ha et sammendrag av alle bevisene på tvers av mange forskjellige dokumenter i en rettssak, for eksempel. Men det endelige målet er å bygge et system som kan tråle gjennom så mange informasjonskilder som mulig og bygge et argument ved å bruke hvert eneste bevis det kan finne.

IBM har nettopp tatt et stort skritt i den retningen. Selskapets Project Debater-team har brukt flere år på å utvikle en AI som kan bygge argumenter. I fjor demonstrerte IBM sin pågående teknologi i en livedebatt mot en verdensmester i menneskelig debattant, tilsvarende Watsons Fare! showdown. Slike stunt er morsomme, og det ga et proof of concept. Nå gjør IBM leketøyet sitt til et genuint nyttig verktøy.

Versjonen av Project Debater som ble brukt i livedebattene inkluderte frøene til det siste systemet, for eksempel muligheten til å søke i hundrevis av millioner av nye artikler. Men i månedene siden har teamet omfattende finpusset de nevrale nettverkene de bruker, og forbedret kvaliteten på bevisene systemet kan avdekke. Et viktig tillegg er BERT , et nevralt nettverk Google bygde for naturlig språkbehandling, som kan svare på spørsmål. Arbeidet vil bli presentert på konferansen Association for the Advancement of Artificial Intelligence i New York neste måned.



For å trene sin AI, trakk hovedforsker Noam Slonim og hans kolleger ved IBM Research i Haifa, Israel, på 400 millioner dokumenter hentet fra LexisNexis-databasen med avis- og tidsskriftartikler. Dette ga dem rundt 10 milliarder setninger, et naturlig språkkorpus rundt 50 ganger større enn Wikipedia. De paret denne enorme bevismassen med påstander om flere hundre forskjellige emner, for eksempel at bloddonasjon bør være obligatorisk eller vi bør forlate Valentinsdagen.

De ba så publikumsarbeidere på Figure Eight-plattformen om å merke setninger i henhold til om de ga bevis for eller mot bestemte påstander. De merkede dataene ble matet til en overvåket læringsalgoritme.

De resulterende nevrale nettverk kan håndtere spørsmål om et bredt spekter av emner, og returnerer setninger som er mer relevante enn de som er identifisert av tidligere systemer. Den rangerer setningene den finner etter hvor gode de er som bevis. For eksempel, gitt påstanden om at bloddonasjon burde være obligatorisk, fant programvaren setningen En studie publisert i American Journal of Epidemiology fant at blodgivere har 88 prosent mindre risiko for å lide av hjerteinfarkt og hjerneslag.



En stor utfordring er å fortelle setninger som gir bevis fra de som ikke gjør det, selv om de inneholder de samme begrepene. Project Debater fant også denne setningen for bloddonasjonspåstanden, for eksempel, men kunne fortelle at den verken støttet den eller undergravde den: Statistikk fra Nakasero Blood Bank viser at studentene er de viktigste blodgiverne, og bidrar med omtrent 80 prosent av blodet samlet over hele verden.

Nøyaktig hva det er med disse setningene som det nevrale nettverket fanger opp for å klassifisere er ikke klart, sier Slonim. Likevel, da prosjektet ble testet, oppnådde Project Debater 95 % nøyaktighet for de 50 beste setningene over 100 forskjellige emner, sier han og legger til: Disse tallene er uhørte. Andre systemer har taklet bare noen få dusin emner. Det er også en stor forbedring i forhold til livedebattsystemet Slonim viste frem i fjor.

Andre forskere jeg snakket med, inkludert Visser og Oana Cocarascu, som studerer argumentasjonsprogramvare og naturlig språkbehandling ved Imperial College London, var også imponert over det nye systemet. For Cocarascu er det potensialet for virkelige applikasjoner som er mest spennende. Et system som er trent på juridiske dokumenter vil ikke takle de mange forskjellige typer bevis som finnes på nettet. Slonims team har vist at Project Debater kan håndtere dette brede spekteret av kilder. Det er det som gjør det flott, sier Cocarascu.



Teamet gir nå ut sine treningsdata for andre å jobbe med. Visser ønsker å bygge argument mining-verktøy som Project Debater som kan evaluere kvaliteten på argumenter, og se etter ting som kognitiv skjevhet. Han og kollegene hans har brukt AI for å vurdere kvaliteten på argumentasjonen i de amerikanske presidentdebattene i 2016, for eksempel.

IBM gjør noe lignende selv. Via et tillegg, kalt Speech by Crowd, kan Project Debater crowdsource argumenter for og imot et forslag og deretter vurderer automatisk kvaliteten på innsendte argumenter ved å bruke et nevralt nettverk trent på et datasett med rundt 30 000 argumenter som tidligere ble scoret for kvalitet av mennesker.

IBM planlegger å tilby Project Debater som en plattform til selskaper og myndigheter. Vi ser fremtiden til Project Debater som en AI-skytjeneste, sier Christopher Sciacca, en talsperson for selskapet. I en eksempelapplikasjon samlet IBM 3500 meninger fra innbyggere i Lugano, Sveits, om hvorvidt byen burde investere i autonome kjøretøy og brukte AI til å trekke ut og vurdere argumenter for og mot forslaget. Lokale myndigheter kan bruke resultatene til å ta en politisk beslutning.

Men for Slonim handler det om å forbedre interaksjonen vår med AI på et personlig nivå. Argumenter spiller en viktig rolle i hvordan mennesker kommuniserer: vi lister opp grunner for våre valg, vi spør om råd, vi overtaler og lokker. Å snakke med virtuelle assistenter som kunne snakke på det nivået ville føles langt mer naturlig. Det vi holder på med berører noe grunnleggende for livene våre, sier han. Vi prøver å knytte språkforståelsesteknologier sammen for å hjelpe folk til å ta bedre beslutninger.

gjemme seg