Googles medisinske AI var supernøyaktig i et laboratorium. Det virkelige liv var en annen historie.

fundus kamera bilde av netthinnen

Wikimedia Commons





Covid-19-pandemien strekker sykehusressurser til bristepunktet i mange land i verden. Det er ingen overraskelse at mange mennesker håper AI kan øke hastigheten på pasientscreeningen og lette belastningen på klinisk personale. Men en studie fra Google Health—den først for å se på virkningen av et dyplæringsverktøy i reelle kliniske omgivelser — Avslører at selv de mest nøyaktige AI-ene faktisk kan gjøre ting verre hvis de ikke er skreddersydd til de kliniske miljøene de vil jobbe i.

Eksisterende regler for utplassering av kunstig intelligens i kliniske omgivelser, for eksempel standarder for FDA-godkjenning i USA eller et CE-merke i Europa, fokuserer først og fremst på nøyaktighet. Det er ingen eksplisitte krav om at en AI må forbedre resultatet for pasienter, hovedsakelig fordi slike forsøk ikke har kjørt ennå. Men det må endres, sier Emma Beede, en UX-forsker ved Google Health: Vi må forstå hvordan AI-verktøy kommer til å fungere for mennesker i kontekst – spesielt i helsevesenet – før de blir bredt distribuert.

Googles første mulighet til å teste verktøyet i en ekte setting kom fra Thailand. Landets helsedepartement har satt et årlig mål om å screene 60 % av personer med diabetes for diabetisk retinopati, som kan forårsake blindhet hvis den ikke oppdages tidlig. Men med rundt 4,5 millioner pasienter til bare 200 netthinnespesialister – omtrent det dobbelte av forholdet i USA – sliter klinikker med å nå målet. Google har CE-merkegodkjenning, som dekker Thailand, men den venter fortsatt på FDA-godkjenning. Så for å se om AI kunne hjelpe, utstyrte Beede og hennes kolleger 11 klinikker over hele landet med et dyplæringssystem som er trent til å oppdage tegn på øyesykdom hos pasienter med diabetes.



I systemet Thailand hadde brukt, tar sykepleiere bilder av pasientenes øyne under kontroller og sender dem for å bli sett på av en spesialist andre steder – en prosess som kan ta opptil 10 uker. AI utviklet av Google Health kan identifisere tegn på diabetisk retinopati fra en øyeskanning med mer enn 90 % nøyaktighet – som teamet kaller menneskelig spesialistnivå – og i prinsippet gi et resultat på mindre enn 10 minutter. Systemet analyserer bilder for avslørende indikatorer på tilstanden, for eksempel blokkerte eller lekkende blodkar.

Mer om koronaviruset

  • Vår viktigste dekning av covid-19 er gratis, inkludert:

    Hva er flokkimmunitet?

    Hva er serologisk testing?



    Hvordan fungerer koronaviruset?

    Hva er potensielle behandlinger?

    Hvilke medikamenter fungerer best?



    Hva er den riktige måten å gjøre sosial distansering på?

    Andre vanlige spørsmål om koronavirus

    ---



    Nyhetsbrev: Coronavirus Tech Report

    Zoomshow: Radio Corona

  • Se også:

    All vår covid-19-dekning

    Covid-19 spesialutgaven

  • Klikk her for å abonnere og støtte vår non-profit journalistikk.

Lyder imponerende. Men en nøyaktighetsvurdering fra et laboratorium går bare så langt. Det sier ingenting om hvordan AI vil prestere i kaoset i et virkelig miljø, og dette er hva Google Health-teamet ønsket å finne ut. Over flere måneder observerte de sykepleiere som utførte øyeskanninger og intervjuet dem om deres erfaringer med det nye systemet. Tilbakemeldingene var ikke helt positive.

Når det fungerte bra, satte AI fart på ting. Men noen ganger klarte det ikke å gi et resultat i det hele tatt. Som de fleste bildegjenkjenningssystemer hadde dyplæringsmodellen blitt trent på skanninger av høy kvalitet; for å sikre nøyaktighet, ble den designet for å avvise bilder som falt under en viss kvalitetsgrense. Med sykepleiere som skanner dusinvis av pasienter i timen og ofte tar bildene under dårlige lysforhold, ble mer enn en femtedel av bildene avvist.

Pasienter hvis bilder ble kastet ut av systemet, ble fortalt at de måtte besøke en spesialist ved en annen klinikk en annen dag. Hvis de syntes det var vanskelig å ta fri fra jobben eller ikke hadde bil, var dette åpenbart upraktisk. Sykepleiere følte seg frustrerte, spesielt når de mente at de avviste skanningene ikke viste tegn på sykdom og oppfølgingsavtalene var unødvendige. Noen ganger kastet de bort tid på å prøve å ta eller redigere et bilde som AI hadde avvist.

En sykepleier betjener netthinneskanneren og tar bilder av baksiden av pasientens øye. (Google)

Fordi systemet måtte laste opp bilder til skyen for behandling, forårsaket dårlige internettforbindelser i flere klinikker også forsinkelser. Pasienter liker de umiddelbare resultatene, men internett er tregt og pasientene klager da, sa en sykepleier. De har ventet her siden klokken 06.00, og de første to timene kunne vi bare screene 10 pasienter.

Google Health-teamet jobber nå med lokalt medisinsk personell for å utforme nye arbeidsflyter. For eksempel kan sykepleiere læres opp til å bruke eget skjønn i grensetilfeller. Selve modellen kan også tilpasses for å håndtere ufullkomne bilder bedre.

Risikerer tilbakeslag

Dette er en avgjørende studie for alle som er interessert i å skitne hendene og faktisk implementere AI-løsninger i virkelige omgivelser, sier Hamid Tizhoosh ved University of Waterloo i Canada, som jobber med AI for medisinsk bildebehandling. Tizhoosh er svært kritisk til det han ser på som et hastverk med å kunngjøre nye AI-verktøy som svar på covid-19. I noen tilfeller blir verktøy utviklet og modeller utgitt av team uten helsefaglig kompetanse, sier han. Han ser på Google-studien som en betimelig påminnelse om at det å etablere nøyaktighet i et laboratorium bare er det første trinnet.

Michael Abramoff, øyelege og informatiker ved University of Iowa Hospitals and Clinics, har utviklet en AI for diagnostisering av netthinnesykdom i flere år og er administrerende direktør for en spinoff-oppstart kalt IDx Technologies, som har samarbeidet med IBM Watson. Abramoff har vært en cheerleader for AI i helsevesenet tidligere, men han advarer også mot et rush, og advarer om tilbakeslag hvis folk har dårlige erfaringer med AI. Jeg er så glad for at Google viser at de er villige til å se nærmere på den faktiske arbeidsflyten i klinikker, sier han. Det er mye mer i helsevesenet enn algoritmer.

Abramoff stiller også spørsmål ved nytten av å sammenligne AI-verktøy med menneskelige spesialister når det kommer til nøyaktighet. Selvfølgelig vil vi ikke at en AI skal ringe dårlig. Men menneskelige leger er uenige hele tiden, sier han - og det er greit. Et AI-system må passe inn i en prosess der kilder til usikkerhet diskuteres i stedet for bare å avvises.

Få det riktig og fordelene kan være store . Da det fungerte bra, så Beede og hennes kolleger hvordan AI gjorde folk som var flinke i jobben enda bedre. Det var en sykepleier som screenet 1000 pasienter på egen hånd, og med dette verktøyet er hun ustoppelig, sier hun. Pasientene brydde seg egentlig ikke om at det var en kunstig intelligens i stedet for et menneske som leste bildene deres. De brydde seg mer om hva deres opplevelse skulle bli.

Rettelse: Åpningslinjen ble endret for å gjøre det klart at ikke alle land blir overveldet.

gjemme seg