Nye standarder for kliniske studier med kunstig intelligens vil bidra til å oppdage slangeolje og hype

CT skann

Kyle McDonald / Flickr





Nyhetene: Et internasjonalt konsortium av medisinske eksperter har innført de første offisielle standardene for kliniske studier som involverer kunstig intelligens. Flyttingen kommer på et tidspunkt da hypen rundt medisinsk AI er på topp, med oppblåste og ubekreftede påstander om effektiviteten til visse verktøy som truer med å undergrave folks tillit til AI generelt.

Hva det betyr: Kunngjort i Naturmedisin , British Medical Journal og Lancet, utvider de nye standardene to sett med retningslinjer rundt hvordan kliniske studier utføres og rapporteres som allerede brukes over hele verden for utvikling av medikamenter, diagnostiske tester og andre medisinske intervensjoner. AI-forskere må nå beskrive ferdighetene som trengs for å bruke et AI-verktøy, innstillingen der AI-en evalueres, detaljer om hvordan mennesker samhandler med AI , analyse av feiltilfeller og mer.

Hvorfor det er viktig: Randomiserte kontrollerte studier er den mest pålitelige måten å demonstrere effektiviteten og sikkerheten til en behandling eller klinisk teknikk. De underbygger både medisinsk praksis og helsepolitikk. Men deres pålitelighet avhenger av om forskerne holder seg til strenge retningslinjer for hvordan forsøkene deres utføres og rapporteres. I løpet av de siste årene har mange nye AI-verktøy blitt utviklet og beskrevet i medisinske tidsskrifter, men effektiviteten deres har vært vanskelig å sammenligne og vurdere fordi kvaliteten på prøvedesignene varierer. I mars, en studie i BMJ advarte om at dårlig forskning og overdrevne påstander om hvor god AI var til å analysere medisinske bilder utgjorde en risiko for millioner av pasienter.



Topp hype: Mangel på vanlige standarder har også gjort det mulig for private selskaper å gruble om effektiviteten til deres AI uten å møte gransking som brukes på andre typer medisinsk intervensjon eller diagnose. For eksempel det britiske-baserte digitale helseselskapet Babylon helse kom under ild i 2018 for å kunngjøre at dens diagnostiske chatbot var på nivå med menneskelige leger, på grunnlag av en test som kritikere hevdet var misvisende.

Babylon Health er langt fra alene. Utviklere har hevdet at medisinske AI-er overgår eller matcher menneskelige evner i noen tid, og pandemien har sendt denne trenden i overdriv ettersom selskaper konkurrerer om å få verktøyene deres lagt merke til. I de fleste tilfeller gjøres evaluering av disse AI-ene internt og under gunstige forhold.

Fremtidsløfte: Det betyr ikke at AI ikke kan slå menneskelige leger. Faktisk var den første uavhengige evalueringen av et AI-diagnoseverktøy som overgikk mennesker når det gjaldt å oppdage kreft på mammografi. publisert først forrige måned . Studien fant at et verktøy laget av Lunit AI og brukt på enkelte sykehus i Sør-Korea, ble avsluttet midt i flokken av radiologer det ble testet mot. Det var enda mer nøyaktig når det ble koblet sammen med en menneskelig lege. Ved å skille de gode fra de dårlige, vil de nye standardene gjøre denne typen uavhengig evaluering enklere, og til slutt føre til bedre – og mer pålitelig – medisinsk AI.



gjemme seg