Så läser du sensitivitet och specificitet i studier om vård-AI
Två mått med olika uppgifter
Sensitivitet är andelen personer med sjukdom som testet hittar. Hög sensitivitet innebär få missade fall, men säger inget om hur många friska som får ett falskt larm.
Specificitet är andelen friska som testet korrekt lämnar utan positivt fynd. Hög specificitet innebär färre falska positiva svar.
Tröskeln mellan måtten är ett medicinskt val. Vid allvarlig sjukdom kan det vara viktigare att missa få fall, även om fler personer behöver utredas i onödan.
Basfrekvensen ändrar betydelsen av ett positivt svar
Anta att 10 000 personer testas för ett tillstånd som finns hos 2 procent. Då är 200 personer sjuka och 9 800 friska.
Med 90 procents sensitivitet upptäcks 180 sjuka och 20 missas. Med 90 procents specificitet får samtidigt 980 friska ett falskt positivt svar.
Totalt får 1 160 personer ett positivt svar, men bara 180 är sjuka. Det positiva prediktiva värdet blir cirka 16 procent.
Exemplet visar varför ett positivt AI-fynd inte är samma sak som en diagnos. Resultatet måste tolkas utifrån hur vanlig sjukdomen är i den undersökta gruppen.
Vad jämförelser mellan AI och kliniker visar
En översikt i The Lancet Digital Health från 2019 jämförde AI med vårdpersonal vid bilddiagnostik. Den sammanvägda sensitiviteten och specificiteten låg nära varandra.
Underlaget hade tydliga begränsningar. Få studier gav klinikerna samma information som i verklig vård, och nästan inga följde patientutfall efter AI-stödda beslut.
Resultatet visar att vissa modeller kan prestera väl på avgränsade testuppgifter. Det visar inte att AI generellt är mer träffsäkert än läkare.
Ett resultat gäller ett verktyg och en population
En Nature-studie från 2020 prövade ett system för mammografibilder i brittiska och amerikanska datamaterial. Resultaten skilde sig mellan länderna.
Skillnaden kan bero på patientgrupper, granskningsrutiner och bildkvalitet. Studien var dessutom retrospektiv, vilket begränsar vad den säger om löpande klinisk användning.
Siffror från en modell kan därför inte flyttas till en annan diagnos eller klinik. Varje verktyg behöver valideras för sitt syfte, sin population och sitt arbetsflöde.
Träffsäkerhet är bara en del av säkerheten
Ett verktyg kan ha god testprestanda och ändå fungera dåligt i vården. Försenad granskning, otydliga larm eller snedfördelade träningsdata kan skapa nya risker.
Uppföljningen bör därför omfatta mer än sensitivitet och specificitet. Man behöver också mäta falska larm, missade fall, tidsåtgång, patientutfall och skillnader mellan grupper.
Det ska vara bestämt vem som granskar ett fynd, inom vilken tid och vad som händer när klinikern och verktyget gör olika bedömningar.
Vad siffrorna får användas till
Sensitivitet och specificitet hjälper till att jämföra ett verktyg med en definierad referens. De är inte ett allmänt kvalitetsbetyg för AI.
För patienter betyder ett positivt AI-fynd vanligen att något behöver granskas närmare. För vårdgivare är det ett underlag för validering, inköp och uppföljning.
Curevo redovisar inga egna prestandasiffror i den här artikeln. Sådana påståenden kräver oberoende underlag för det specifika verktyget och användningsområdet.
Källor
- A comparison of deep learning performance against health-care professionals in detecting diseases from medical imaging: a systematic review and meta-analysis · The Lancet Digital Health (Liu et al., 2019)
- International evaluation of an AI system for breast cancer screening · Nature (McKinney et al., 2020)
- Digitala vårdtjänster och artificiell intelligens i hälso- och sjukvården · Socialstyrelsen, 2019