Ny metode finder huller i AI-notater og mindsker fejl i journaler
Sprogmodeller har svært ved at finde huller i tekster, men præcisionen stiger, hvis de først lister fakta fra samtalen
Læs i dit tempo
Kort
Test viser, at AI-modeller har svært ved at opdage manglende information i kliniske noter. Det er vigtigt, da kritiske detaljer fra lægesamtaler ellers kan blive glemt i journalen. En ny metode, der tjekker fakta enkeltvis, kan nu finde disse huller mere præcist.
Begynder
Kan en computer se, hvad der mangler i en tekst? En undersøgelse med 500 eksempler viser, at store sprogmodeller – altså kunstig intelligens, der kan forstå og skrive menneskesprog – har svært ved at finde manglende oplysninger i lægers journalnotater. Det er lidt som at tjekke en indkøbsliste; det er nemt at se, hvis der står »bananer« i stedet for »æbler«, men sværere at opdage, at man helt har glemt at skrive mælken på. Modellerne fik kun en score mellem 0,50 og 0,63, når de skulle finde udeladelser. Til sammenligning scorede de mellem 0,79 og 0,94, når de skulle finde direkte fejl eller ting, der var tilføjet forkert. Problemet skyldes, at AI-sekretærer ofte glemmer at skrive vigtige ting fra samtalen ned i noterne.
Normalt bruger man en anden sprogmodel som dommer. Denne dommer sammenligner journalnotatet med en transskription, som er en skreven udgave af samtalen mellem læge og patient. Men denne metode fejler ofte, når noget helt mangler. En ny måde at gøre det på er at bede modellen lave en liste over alle fakta fra samtalen først. Derefter tjekker den, om hver enkelt ting findes i notatet. Det fungerer som en grundig tjekliste.
Der findes to forskellige løsninger på dette. Den ene er en proces i flere trin, hvor hvert faktum tjekkes separat. Denne løsning har kun 2,7 % falske alarmer og er ifølge en læge den mest præcise. Den anden metode kræver kun ét enkelt kald til computeren. Den er ti gange billigere og finder flere fejl, men har en højere fejlrate på 6,2 %.
Begge metoder har dog stadig en svaghed. De fejler, hvis den manglende information er blevet skrevet om med andre ord et andet sted i noten. For at hjælpe andre har forskerne delt deres benchmark, som er en standardtest til at måle præstation, deres prompts, som er de instruktioner man giver computeren, samt deres bedømmelser.
Vil du have mig til at uddybe forskellen mellem de to løsninger, så det er lettere at se for- og ulemperne?

500 testeksempler viser, at LLM-dommere har svært ved at finde manglende oplysninger i kliniske noter. Modellerne scorede kun mellem 0,50 og 0,63 i at finde udeladelser. Til sammenligning scorede de mellem 0,79 og 0,94, når de skulle finde fejl eller tilføjelser i teksten.
Problemet opstår, fordi AI-sekretærer ofte glemmer at skrive vigtig information fra konsultationen ned i noterne. Standardmetoden er at bruge en anden sprogmodel som dommer, der sammenligner noten med en transskription af samtalen. Denne metode fejler dog ofte, når information helt mangler.
En ændring i arbejdsgangen gør det muligt at finde de manglende fakta. Modellen skal først lave en liste over alle fakta i transskriptionen og derefter tjekke, om hver enkelt ting findes i noten.
To forskellige løsninger giver forskellige resultater. En pipeline-løsning, der tjekker hvert faktum separat, har kun 2,7 % falske alarmer og er mest præcis ifølge en læge. En metode med et enkelt kald er ti gange billigere og finder flere fejl, men har en højere fejlrate på 6,2 %.
Begge metoder fejler stadig, hvis den manglende information er blevet omskrevet et andet sted i noten. Forskerne har frigivet deres benchmark, prompts og bedømmelser.
Kilder
- LLM Judges Verify Presence, Not Absence: Omission Blindness in AI Clinical Notes arxiv.org
- LLM Judges Verify Presence, Not Absence: Omission Blindness in AI Clinical Notes https:// arxiv.org/abs/2608.31016 # ai… mastodon.social
- LLM Judges Verify Presence, Not Absence: Omission Blindness in AI Clinical Notes https:// arxiv.org/abs/2608.31016… mastodon.social
Produktionshistorie
- Radar Signal ? af 100 · spredning 2 kilder
- Skrevet Model: mimo-v2.5-free · temperatur 0.4
- Overskrift 5 kandidater, valgt af chat.dk
- Korrektur 1 zen · 1 rettelser
- Vedtagelse ainews-auto-v3 · score 0.9679