Million-dollar tips om hvordan maskinlæring en dag kan oppdage kreft

Maskinlæring krever ofte massive datasett for å utvikle en effektiv algoritme, men for denne konkurransen fikk teamene bare 2000 bilder.





En konkurranse rettet mot å automatisere oppdagelsen av lungekreft viser hvordan maskinlæring kan være klar til å overhale medisinsk bildebehandling.

Utfordringen ga 1 million dollar i premier for algoritmene som mest nøyaktig identifiserte tegn på lungekreft i lavdose datatomografibilder. De vinnende algoritmene vil ikke nødvendigvis bli tatt i bruk av klinikere, men de kan inspirere til algoritmiske innovasjoner som finner veien til medisinsk bildebehandling.

Lavdose CT-skanninger har vist stort potensial de siste årene for å oppdage lungekreft tidligere. De bruker mindre stråling og krever ikke kontrastfarge for å sprøytes inn i kroppen. Men diagnosen er veldig vanskelig, noe som betyr et høyt antall falske positive og for mange unødvendige medisinske prosedyrer.



En maskinlæringsteknikk kjent som dyp læring har vist seg spesielt effektiv for å finne mønstre i bilder de siste årene (se 10 Breakthrough Technologies 2013: Deep Learning ). Det er nå økende håp om at denne og andre maskinlæringsmetoder kan bidra til å forbedre standarder for diagnose i medisin ved automatisk å gjenkjenne mønstre som indikerer sykdom - inkludert de som er for subtile til at det menneskelige øyet kan fange.

Dyplæring er allerede vant til oppdage hudkreft i bilder med omtrent samme antall feil som gjort av profesjonelle hudleger. Og teknikken har vist seg effektiv for å oppdage en vanlig årsak til blindhet i netthinnebilder. Det er nå økende interesse blant leger og gründere for å bruke teknikken bredere. Når dette skjer, kan det imidlertid være nødvendig med mer innsats for å gjøre slike algoritmer forklarlige (se The Dark Secret at the Heart of AI).

Relatert historie Ingen vet egentlig hvordan de mest avanserte algoritmene gjør det de gjør. Det kan være et problem.

Keyvan Farahani, en programdirektør ved National Cancer Institute, som leverte bildedataene som ble brukt i konkurransen, sier at å redusere antallet falske lungekreftdiagnoser fra lavdose-CT-skanninger vil gjøre en reell forskjell for pasientene. Det er rundt 222 500 nye tilfeller av lungekreft i USA hvert år, ifølge American Cancer Society.



Farahani sier at eksisterende programvare for å identifisere tegn på lungekreft er upålitelig. Foreløpige resultater tyder på at [de beste algoritmene] er bedre enn det som allerede er tilgjengelig, sier han. Farahani forutser imidlertid ikke at algoritmer tar plassen til medisinske eksperter. Dyplæring vil bidra til å fordøye store mengder data, sier han. Jeg tror ikke de kommer til å erstatte leger eller radiologer.

En av hovedutfordringene i denne konkurransen var det faktum at bare 2000 bilder ble gjort tilgjengelig for teamene. Maskinlæring krever ofte svært store datasett for å utvikle en effektiv algoritme. Men andre data, som detaljer om utstyret som ble brukt, ble inkludert.

Vinnerteamet brukte et nevralt nettverk og la ekstra innsats i å kommentere bilder for å gi flere datapunkter. Den brukte også et ekstra datasett, og delte utfordringen i to deler: identifisere knuter og deretter diagnostisere kreft. Det er ennå ikke klart hvordan den beste algoritmen kan måle seg med en lege, fordi hver algoritme gir en sannsynlighet snarere enn et definitivt utfall.



Vi tror det er avgjørende å eksplisitt dele dette problemet i to stadier, noe som også ser ut til å være hva menneskelige eksperter ville gjort, sier Zhe Li, medlem av vinnerteamet og student ved Tsinghua University, et av Kinas fremste akademiske institutter.

I tillegg til å antyde potensialet for dyp læring innen medisinsk bildebehandling, fremhever lungekreftkonkurransen det voksende ryktet til kinesiske AI-forskere.

De konkurranse , holdt på datavitenskapssiden Kaggle, ble organisert av Booz Allen Hamilton, et ledelseskonsulentfirma som har arrangert flere andre store datavitenskapskonkurranser tidligere. 1 million dollar i premiepenger kom fra Laura og John Arnold Foundation .



Kaggle ble grunnlagt i 2010 og kjøpt opp tidligere i år av Google. Siden har vist seg å være en kraftig måte å crowdsourcing på utviklingen av maskinlæringsalgoritmer, og er også en populær måte å identifisere talenter.

Les Neste

Josh Sullivan , som leder datavitenskapsteamet hos Booz Allen Hamilton, sier at en motivasjon for konkurransen er talentanskaffelse, og bemerker at 238 deltakere også har søkt på jobber i selskapet. Han legger til at selskapet gjør vinneralgoritmene tilgjengelig gratis for å maksimere de potensielle fordelene for det medisinske samfunnet.

Li, fra vinnerlaget, sier det er gledelig å utvikle noe som kan redde folks liv, men den virkelige grunnen til å delta var litt mindre altruistisk. For å være ærlig er den store motivasjonen å vinne premiepengene, sier han.

gjemme seg