AI-angreb gemmer sig nu i bankudskrifter og regninger
Test af 10 filtre på 629 angreb i ægte værktøjsdata løftede Metas filter fra 1 til 99 procent med én indstilling. Fangst uden falske alarmer siger intet.
Læs i dit tempo
Kort
En test med 629 skjulte angreb viste at Metas sikkerhedstjek kun stoppede 1 procent. Det betyder noget fordi angrebene lignede almindelige beskeder så streng blokering også rammer uskyldige. Nu vises stoppede angreb og fejl over for uskyldige sammen for at afsløre dårlige løsninger.
Begynder
Forestil dig en dørmand i et travlt butikscenter. Hans job er at finde lommetyven uden at holde ærlige kunder tilbage. Sådan arbejder et sikkerhedsfilter. Det er et program, der skal stoppe skjulte skadelige beskeder til en kunstig intelligens. Testen her prøvede 10 filtre, hvor koden er fri og åben for alle. Kilden til angrebene var en samling ved navn AgentDojo. Med de indstillinger, det har fra start, stoppede filtret Prompt Guard 2 fra selskabet Meta kun 1 procent af 629 gemte virkelige angreb. Med i testen var også 97 helt harmløse eksempler. De skulle afsløre filtre, der bare blokerer alt. Klassiske tests ser kun på selve angrebet alene. Her lå hvert angreb gemt i ægte data fra de værktøjer, som den kunstige intelligens bruger.
Angrebene lignede ikke angreb. De lå inde i bankudskrifter, arbejdsopgaver fra systemet Jira, anmeldelser og websider. En besked bad blot om at sende flest mulige penge til et kontonummer. Den stod midt i en regning på 2.000 tegn. Der var ingen klassiske tegn som ordene ignorer tidligere instrukser.
Hvad sker der så, hvis man skruer på en enkelt værdi hos dørmanden? Samme test vendte Metas resultat på hovedet. En ændret værdi løftede filtret fra 1 til 99 procent i fangede angreb. Derfor viser testen fangst og falske alarmer side om side. Et tal for fangst alene fortæller intet. To filtre med navnene Deepset og fmops stoppede 100 procent af angrebene. Men de stoppede også 98 procent af den harmløse trafik. Så de fangede det hele og ødelagde det hele.

1 procent af 629 reelle angreb blev stoppet af Metas Prompt Guard 2 med standardindstillinger.
Testen kørte 10 open source-filtre mod angreb fra AgentDojo. Hvert angreb lå gemt i ægte værktøjsdata. Klassiske tests scorer angrebet alene. Her var der også 97 harmløse eksempler med. Det skulle afsløre filtre, der bare blokerer alt.
Angrebene lignede ikke angreb. De lå inde i bankudskrifter, Jira-billetter, anmeldelser og websider. En besked lød blot på at sende flest mulige penge til et kontonummer. Den stod midt i en regning på 2.000 tegn. Uden klassiske tegn som ignorer tidligere instrukser.
Samme test vendte Metas resultat på hovedet. Én ændret værdi løftede filtret fra 1 til 99 procent i fangede angreb. Derfor viser testen fangst og falske alarmer side om side. Et tal for fangst alene fortæller intet.
To filtre fangede det hele og ødelagde det hele. Deepset og fmops stoppede 100 procent af angrebene. De stoppede også 98 procent af den harmløse trafik.
Det er uklart: Kilden siger ikke hvilken indstilling der blev ændret eller hvad falsk-positiv-raten var ved 99 procent fangst.
Kilder
Produktionshistorie
- Radar Signal ? af 100 · spredning 1 kilder
- Vurdering Nyheds 4/5 — test af prompt-injection-detektor med stor konfigurationsforskel for agenter
- Skrevet Model: deepseek-v4-flash · temperatur 0.4
- Overskrift 5 kandidater, valgt af chat.dk
- Korrektur 1 zen · 1 rettelser
- Korrektur 2 chatdk · 1 rettelser
- Vedtagelse ainews-auto-v3 · score 1.0519