AI slår ikke traditionelle metoder i medicinsk rådgivning – ny undersøgelse punkterer hypen
En ny undersøgelse fra Oxford University kaster koldt vand på forestillingen om, at kunstig intelligens er klar til at revolutionere, hvordan patienter søger medicinsk hjælp. Faktisk klarer almindelige mennesker sig ikke bedre med AI end med gammeldags Google-søgninger eller NHS’ hjemmeside.
Undersøgelsen, publiceret i det prestigefyldte tidsskrift Nature Medicine, testede tre af de mest avancerede AI-modeller på markedet: OpenAI’s ChatGPT-4o, Meta’s Llama 3 og Cohere’s Command R+. Resultaterne er både fascinerende og bekymrende.
Når AI møder virkeligheden
I laboratoriet var AI’en imponerende. Uden menneskelig involvering identificerede modellerne korrekt medicinske tilstande i hele 94,9% af tilfældene – fra simple forkølelser til livstruende hjerneblødninger. Men så kom virkeligheden på banen.
Da forskerne bad 1.298 britiske deltagere om at bruge AI til at undersøge de samme symptomer, styrtdykkede succesraten. Deltagerne identificerede kun den korrekte tilstand i under 34,5% af tilfældene og valgte den rigtige handling i under 44,2% – ikke bedre end kontrolgruppen, der bare brugte internettet eller deres egen erfaring.
Hvorfor går det galt?
Forskerne dykkede ned i omkring 30 interaktioner for at finde ud af, hvad der gik galt. Svaret var todelt: Mennesker er dårlige til at beskrive deres symptomer fuldstændigt, og AI’en genererer sommetider vildledende eller direkte forkerte svar.
Et slående eksempel: En patient med symptomer på subaraknoidalblødning – en livstruende tilstand – beskrev “den værste hovedpine nogensinde” og fik korrekt besked om at tage på hospitalet. En anden patient med præcis de samme symptomer, men som beskrev det som en “forfærdelig” hovedpine, fik besked om at lægge sig ned i et mørkt rum. Forskellen mellem liv og død kunne altså ligge i ordvalget.
“En kæmpe kløft mellem potentiale og virkelighed”
Adam Mahdi, medforfatter og lektor ved Oxford, opsummerer det brutalt ærligt: “Der er en kæmpe kløft mellem AI’s potentiale og faldgruberne, når den bruges af mennesker. Viden kan være i disse bots, men denne viden oversættes ikke altid, når de interagerer med mennesker.”
Dr. Rebecca Payne fra Bangor University, der var hovedansvarlig læge på undersøgelsen, advarer skarpt: AI er ikke klar til at erstatte læger. Risikoen for forkerte diagnoser og oversete akutte behov er simpelthen for stor.
Hvad nu?
Forskerne planlægger nu lignende undersøgelser i forskellige lande og på forskellige sprog for at teste, om det påvirker AI’s præstation. Undersøgelsen blev støttet af datavirksomheden Prolific, den tyske nonprofitorganisation Dieter Schwarz Stiftung samt de britiske og amerikanske regeringer.
Selvom AI viser lovende resultater i kontrollerede medicinske miljøer – som diagnostik, billedanalyse og lægemiddeludvikling – afslører denne undersøgelse en ubehagelig sandhed: Når almindelige mennesker skal bruge AI til at træffe beslutninger om deres sundhed, er teknologien endnu ikke bedre end de værktøjer, vi allerede har.
Måske er det på tide at tage en dyb indånding, før vi overlader vores helbred til chatbots. I hvert fald indtil AI lærer at stille de rigtige spørgsmål – og vi lærer at give de rigtige svar.




