Jailbrokenne AI-modeller afslører dine API-nøgler og adgangskoder
En ny metode til at dekode krypterede ræsonnementsblokke har afsløret over 700 følsomme oplysninger, herunder adgangskoder og API-nøgler.
Læs i dit tempo
Kort
Forskere har fundet en metode til at udtrække 704 følsomme oplysninger fra skjulte ræsonnementsblokke, som er AI-modellens interne tanker. Det er et sikkerhedsbrud, fordi private data som adgangskoder kan stjæles ved hjælp af andre modeller fra samme udbyder. Opdagelsen afslører, at krypterede data i disse systemer ikke er tilstrækkeligt beskyttede mod misbrug.
Begynder
Forskere har fundet en måde at se de »hemmelige tanker« hos store AI-modeller fra OpenAI, Anthropic og Google. Modellerne kommunikerer via en Application Programming Interface (API), som er et digitalt bindeled, der gør det muligt for forskellige programmer at tale sammen. Sammen med svarene sender de krypterede blokke. Man kan forestille sig disse blokke som låste kufferter, der indeholder AI'ens interne ræsonnementer. Ved at bruge en såkaldt »jailbroken« model, hvor sikkerhedslåsene er fjernet, kan man få disse kufferter til at åbne sig og afsløre den rå tekst ordret.
Forskerne ledte i 6.708 agenttrajektorier, som er digitale spor af en AI-agents handlinger, på hjemmesiderne GitHub og Hugging Face. Her lykkedes det dem at rekonstruere 315.320 ræsonnementsblokke. Den tekst, de fik ud, passede præcis med antallet af skjulte tokens, som er de små byggeklodser af ord, AI'en bruger til at behandle sprog. Det viser, at man kan genskabe næsten alt, hvad modellen har tænkt undervejs i processen.
Det er problematisk, fordi 704 følsomme oplysninger blev fundet i disse tanker. For 64 af disse fund dukkede informationen slet ikke op i det endelige svar, som brugeren så. Blandt de lækkede data var der 62 API-nøgler, som fungerer som digitale adgangskort, 33 adgangskoder, 24 adgangstokens og 30 private e-mailadresser. Der blev også fundet navne, fysiske adresser og interne oplysninger.
Hvorfor sker det egentlig? Det skyldes, at de låste kufferter med data kan flyttes fra én sammenhæng til en anden. Selvom oplysningerne er skjulte i det program, vi normalt bruger, kan dataene hentes ud. Det sker, hvis man har adgang til en anden model fra samme udbyder, som man kan tvinge til at læse indholdet af blokkene.
Vil du have, at jeg forklarer nærmere, hvordan en »jailbroken« model fungerer i denne sammenhæng?

704 følsomme oplysninger er fundet i skjulte ræsonnementer fra frontmodeller. Forskere har vist, at det er muligt at udtrække rå ræsonnementer fra API'er hos OpenAI, Anthropic og Google.
Metoden bruger krypterede blokke, som modeludbydere sender til klienten som en del af processen. Disse blokke er portable og kan genafspilles uden for deres oprindelige kontekst. Ved at indsætte en blok i en svagere, jailbroken model fra samme udbyder, kan man få den rå tekst udleveret ordret.
315.320 ræsonnementsblokke er blevet rekonstrueret gennem denne proces. Forskerne har indsamlet 6.708 offentligt tilgængelige agenttrajektorier fra GitHub og Hugging Face, som stadig indeholdt krypterede blokke. Den dekodede tekst følger tæt det antal skjulte tokens, som API'en rapporterer for hver forespørgsel.
64 af de fundne følsomme oplysninger findes kun i ræsonnementerne og optræder ikke i den synlige tekst. Blandt de 704 fundne artefakter er der 62 API-nøgler, 33 adgangskoder, 24 adgangstokens og 30 personlige e-mailadresser. Der er desuden fundet navne, postadresser og interne oplysninger.
Sikkerhedsbruddet sker, fordi de krypterede blokke kan flyttes. Selvom indholdet er skjult for brugeren i den normale brugerflade, kan dataene hentes ud, hvis man har adgang til en anden model fra samme udbyder, der kan tvinges til at læse dem.
Kilder
Produktionshistorie
- Radar Signal ? af 100 · spredning 2 kilder
- Vurdering Nyheds 5/5 — Sikkerhedsbrud: Udtrækning af reasoning traces fra API'er
- Skrevet Model: mimo-v2.5-free · temperatur 0.4
- Overskrift 5 kandidater, valgt af chat.dk
- Korrektur 1 zen · 4 rettelser
- Korrektur 2 chatdk · 1 rettelser
- Vedtagelse ainews-auto-v3 · score 0.8967