Nye standarder for kliniske forsøg med kunstig intelligens vil hjælpe med at få øje på slangeolie og hype

CT-scanning

Kyle McDonald / Flickr





Nyhederne: Et internationalt konsortium af medicinske eksperter har indført de første officielle standarder for kliniske forsøg, der involverer kunstig intelligens. Bevægelsen kommer på et tidspunkt, hvor hypen omkring medicinsk AI er på sit højeste, med oppustede og ubekræftede påstande om effektiviteten af ​​visse værktøjer, der truer med at underminere folks tillid til AI generelt.

Hvad det betyder: Meddelt i Naturmedicin , British Medical Journal og Lancet, udvider de nye standarder to sæt retningslinjer omkring, hvordan kliniske forsøg udføres og rapporteres, som allerede bruges rundt om i verden til udvikling af lægemidler, diagnostiske tests og andre medicinske indgreb. AI-forskere skal nu beskrive de færdigheder, der er nødvendige for at bruge et AI-værktøj, de omgivelser, hvori AI'en evalueres, detaljer om hvordan mennesker interagerer med AI , analyse af fejltilfælde og meget mere.

Hvorfor det er vigtigt: Randomiserede kontrollerede forsøg er den mest troværdige måde at demonstrere effektiviteten og sikkerheden af ​​en behandling eller klinisk teknik. De understøtter både lægepraksis og sundhedspolitik. Men deres troværdighed afhænger af, om forskerne holder sig til strenge retningslinjer for, hvordan deres forsøg udføres og rapporteres. I de sidste par år er mange nye AI-værktøjer blevet udviklet og beskrevet i medicinske tidsskrifter, men deres effektivitet har været svær at sammenligne og vurdere, fordi kvaliteten af ​​forsøgsdesign varierer. I marts, en undersøgelse i BMJ advarede om, at dårlig forskning og overdrevne påstande om, hvor god AI var til at analysere medicinske billeder, udgør en risiko for millioner af patienter.



Højeste hype: Mangel på fælles standarder har også gjort det muligt for private virksomheder at græde om effektiviteten af ​​deres AI uden at stå over for den kontrol, der anvendes på andre typer medicinsk intervention eller diagnose. For eksempel den britiske-baserede digitale sundhedsvirksomhed Babylon sundhed kom under beskydning i 2018 for at annoncere, at dens diagnostiske chatbot var på niveau med menneskelige læger, på baggrund af en test som kritikere hævdede var vildledende.

Babylon Health er langt fra alene. Udviklere har i nogen tid hævdet, at medicinske AI'er udkonkurrerer eller matcher menneskelige evner, og pandemien har sendt denne tendens i overdrev, da virksomheder konkurrerer om at få deres værktøjer bemærket. I de fleste tilfælde sker evaluering af disse AI'er internt og under gunstige forhold.

Fremtidsløfte: Det betyder ikke, at AI ikke kan slå menneskelige læger. Faktisk var den første uafhængige evaluering af et AI-diagnostisk værktøj, der overgik mennesker med at spotte kræft på mammografi. kun offentliggjort i sidste måned . Undersøgelsen viste, at et værktøj lavet af Lunit AI og brugt på visse hospitaler i Sydkorea sluttede midt i flokken af ​​radiologer, det blev testet mod. Det var endnu mere nøjagtigt, når det blev parret med en menneskelig læge. Ved at adskille de gode fra de dårlige vil de nye standarder gøre denne form for uafhængig evaluering lettere, hvilket i sidste ende fører til bedre – og mere troværdig – medicinsk AI.



skjule