Googles medicinske AI var super nøjagtig i et laboratorium. Det virkelige liv var en anden historie.

fundus kamera billede af nethinden

Wikimedia Commons





Covid-19-pandemien strækker hospitalsressourcer til bristepunktet i mange lande i verden. Det er ingen overraskelse, at mange mennesker håber, at kunstig intelligens kunne fremskynde patientscreeningen og lette belastningen af ​​det kliniske personale. Men en undersøgelse fra Google Health-den først til at se på virkningen af ​​et dybt læringsværktøj i virkelige kliniske omgivelser — afslører, at selv de mest nøjagtige AI'er faktisk kan gøre tingene værre, hvis de ikke er skræddersyet til de kliniske miljøer, de vil arbejde i.

Eksisterende regler for implementering af kunstig intelligens i kliniske omgivelser, såsom standarderne for FDA-godkendelse i USA eller et CE-mærke i Europa, fokuserer primært på nøjagtighed. Der er ingen eksplicitte krav om, at en AI skal forbedre resultatet for patienter, hovedsagelig fordi sådanne forsøg endnu ikke er kørt. Men det skal ændres, siger Emma Beede, en UX-forsker hos Google Health: Vi er nødt til at forstå, hvordan AI-værktøjer kommer til at fungere for mennesker i kontekst – især i sundhedsvæsenet – før de bliver bredt udbredt.

Googles første mulighed for at teste værktøjet i rigtige omgivelser kom fra Thailand. Landets sundhedsministerium har sat et årligt mål om at screene 60 % af personer med diabetes for diabetisk retinopati, som kan forårsage blindhed, hvis den ikke fanges tidligt. Men med omkring 4,5 millioner patienter til kun 200 retinale specialister - omtrent det dobbelte af forholdet i USA - kæmper klinikker for at nå målet. Google har CE-mærkegodkendelse, som dækker Thailand, men det venter stadig på FDA-godkendelse. Så for at se, om AI kunne hjælpe, udstyrede Beede og hendes kolleger 11 klinikker over hele landet med et dybt læringssystem, der er trænet til at opdage tegn på øjensygdom hos patienter med diabetes.



I det system, Thailand havde brugt, tager sygeplejersker billeder af patienters øjne under kontrol og sender dem afsted for at blive kigget på af en specialist et andet sted – en proces, der kan tage op til 10 uger. Den kunstige intelligens, der er udviklet af Google Health, kan identificere tegn på diabetisk retinopati fra en øjenscanning med mere end 90 % nøjagtighed – som holdet kalder human specialist level – og i princippet give et resultat på mindre end 10 minutter. Systemet analyserer billeder for afslørende indikatorer for tilstanden, såsom blokerede eller utætte blodkar.

Mere om coronavirus

  • Vores vigtigste dækning af covid-19 er gratis, herunder:

    Hvad er flokimmunitet?

    Hvad er serologisk testning?



    Hvordan virker coronavirus?

    Hvad er de potentielle behandlinger?

    Hvilke lægemidler virker bedst?



    Hvad er den rigtige måde at gøre social distancering på?

    Andre ofte stillede spørgsmål om coronavirus

    ---



    Nyhedsbrev: Coronavirus Tech Report

    Zoom-show: Radio Corona

  • Se også:

    Al vores covid-19 dækning

    Covid-19 særnummeret

  • Klik venligst her for at abonnere og støtte vores non-profit journalistik.

Lyde imponerende. Men en nøjagtighedsvurdering fra et laboratorium går kun så vidt. Det siger intet om, hvordan AI'en vil præstere i kaosset i et virkeligt miljø, og det er det, Google Health-teamet ønskede at finde ud af. I løbet af flere måneder observerede de sygeplejersker, der udførte øjenscanninger og interviewede dem om deres erfaringer med det nye system. Tilbagemeldingerne var ikke helt positive.

Når det fungerede godt, fremskyndede AI tingene. Men nogle gange lykkedes det slet ikke at give et resultat. Som de fleste billedgenkendelsessystemer var deep-learning-modellen blevet trænet i højkvalitetsscanninger; for at sikre nøjagtigheden blev den designet til at afvise billeder, der faldt under en vis kvalitetstærskel. Da sygeplejersker scannede snesevis af patienter i timen og ofte tog billederne under dårlige lysforhold, blev mere end en femtedel af billederne afvist.

Patienter, hvis billeder blev smidt ud af systemet, fik at vide, at de skulle besøge en specialist på en anden klinik en anden dag. Hvis de havde svært ved at tage fri fra arbejdet eller ikke havde en bil, var det naturligvis ubelejligt. Sygeplejersker følte sig frustrerede, især når de mente, at de afviste scanninger ikke viste tegn på sygdom, og opfølgningsaftalen var unødvendige. Nogle gange spildte de tid på at prøve at gentage eller redigere et billede, som AI'en havde afvist.

En sygeplejerske betjener nethindescanneren og tager billeder af bagsiden af ​​en patients øje. (Google)

Fordi systemet skulle uploade billeder til skyen til behandling, forårsagede dårlige internetforbindelser i flere klinikker også forsinkelser. Patienter kan lide de øjeblikkelige resultater, men internettet er langsomt, og patienterne klager derefter, sagde en sygeplejerske. De har ventet her siden klokken 06.00, og i de første to timer kunne vi kun screene 10 patienter.

Google Health-teamet arbejder nu sammen med lokalt medicinsk personale om at designe nye arbejdsgange. For eksempel kunne sygeplejersker uddannes til at bruge deres egen dømmekraft i grænsetilfælde. Selve modellen kunne også justeres til at håndtere ufuldkomne billeder bedre.

Risikerer modreaktioner

Dette er et afgørende studie for enhver, der er interesseret i at få deres hænder til at snavsede og faktisk implementere AI-løsninger i den virkelige verden, siger Hamid Tizhoosh ved University of Waterloo i Canada, som arbejder på AI til medicinsk billeddannelse. Tizhoosh er meget kritisk over for, hvad han ser som et hastværk med at annoncere nye AI-værktøjer som reaktion på covid-19. I nogle tilfælde udvikles værktøjer og modeller frigives af teams uden sundhedsfaglig ekspertise, siger han. Han ser Google-undersøgelsen som en rettidig påmindelse om, at etablering af nøjagtighed i et laboratorium kun er det første skridt.

Michael Abramoff, øjenlæge og datalog ved University of Iowa Hospitals and Clinics, har udviklet en AI til diagnosticering af nethindesygdom i flere år og er administrerende direktør for en spinoff-startup kaldet IDx Technologies, som har samarbejdet med IBM Watson. Abramoff har tidligere været en cheerleader for AI i sundhedssektoren, men han advarer også mod et hastværk og advarer om et modreaktion, hvis folk har dårlige erfaringer med AI. Jeg er så glad for, at Google viser, at de er villige til at undersøge den faktiske arbejdsgang i klinikker, siger han. Der er meget mere i sundhedsvæsenet end algoritmer.

Abramoff stiller også spørgsmålstegn ved nytten af ​​at sammenligne AI-værktøjer med menneskelige specialister, når det kommer til nøjagtighed. Selvfølgelig ønsker vi ikke, at en AI laver et dårligt opkald. Men menneskelige læger er uenige hele tiden, siger han - og det er fint. Et AI-system skal passe ind i en proces, hvor kilder til usikkerhed diskuteres frem for blot at afvise.

Få det rigtigt og fordelene kan være enorme . Da det fungerede godt, så Beede og hendes kolleger, hvordan AI gjorde folk, der var gode til deres job, endnu bedre. Der var en sygeplejerske, der screenede 1.000 patienter på egen hånd, og med dette værktøj er hun ustoppelig, siger hun. Patienterne var ligeglade med, at det var en kunstig intelligens i stedet for et menneske, der læste deres billeder. De bekymrede sig mere om, hvad deres oplevelse skulle være.

Rettelse: Indledningen blev ændret for at gøre det klart, at ikke alle lande bliver overvældet.

skjule