AI'ens forklaringer er upålidelige – men vi stoler på dem
James Mickens' nye papir viser, at modellens sprog ikke afslører dens beregninger – og at sikkerhed derfor må bygge på isolation, ikke på modellens selvrapportering.
Læs i dit tempo
Kort
Et nyt papir af James Mickens konkluderer, at sprogmodellers sproglige output ikke afslører, hvordan de faktisk regner. Det betyder, at sikkerhedsmetoder, der stoler på modellens egne forklaringer eller sprog, aldrig kan blive fuldt pålidelige. Fremover skal sikkerheden i stedet bygge på isolation og sporing af data, som ikke kræver at læse modellens sprog.
Begynder
En sprogmodel kan skrive et svar, uden at sproget afslører, hvordan den faktisk regner. Det konkluderer James Mickens i et nyt videnskabeligt papir, udgivet på arXiv — et online arkiv, hvor forskere deler deres arbejde. Han kalder fænomenet ’sproglig ulæselighed’ (linguistic illegibility). En sprogmodel er et computerprogram, der har lært at skrive naturligt sprog ved at læse enorme mængder tekst. Men når modellen regner, sker det ikke i ord. Det foregår som matematik i et stort indre rum af tal, kaldet aktiveringsrummet. Når modellen oversætter sine beregninger til sætninger, går der information tabt — lidt som når man komprimerer et billede og mister detaljer. Derfor er sproget en upålidelig kilde, hvis man vil forstå modellens faktiske ræsonnement.
Det rammer sikkerhedsmekanismer, der stoler på, at modellen selv beskriver sin tankeproces. Nogle systemer beder modellen om at skrive sine ræsonnementer ned, trin for trin, og læser dem bagefter — det kaldes chain-of-thought-monitorering. Andre lader modellen vurdere sine egne svar ud fra et sæt regler, en teknik kaldet constitutional self-critique. Og activation probing forsøger at finde sprogligt definerede træk i modellens indre tilstande. Alle tre bygger på, at sproget afspejler beregningerne. Ifølge Mickens kan de aldrig blive fuldt forsvarlige.
I stedet skal sikkerheden bygges på isolation — at modellen holdes adskilt fra de dele af systemet, den ikke må påvirke. Mickens peger på taint tracking som en lovende metode. Her markerer man på forhånd de data, modellen producerer, og følger dem gennem systemet, som var de pakker med et sporingsnummer. Hvis de markerede data forsøger at nå et sted, de ikke må, slår systemet alarm. Det virker, uanset hvad modellen siger om sig selv. Derudover nævner han robust virtualisering — at køre modellen i et lukket miljø, en såkaldt sandkasse, hvor den ikke kan slippe ud — og at få uafhængige tredjeparter til at kontrollere, at sandkassen er korrekt sat op. Sådanne mekanismer ville ifølge papiret have afbødet flere af de seneste angreb, hvor de mest avancerede sprogmodeller er blevet brugt til at bryde ud af deres sandkasser.

Sprogmodellers sproglige output afslører ikke, hvordan de faktisk regner. Det konkluderer James Mickens i et nyt papir på arXiv, der introducerer begrebet 'sproglig ulæselighed' (linguistic illegibility).
Årsagen er, at LLM'er ikke regner i sprog. De er trænet til at generere naturligt sprog, men deres interne beregninger foregår som matematik over aktiveringsrum. Oversættelsen mellem aktiveringsrum og naturligt sprog er tabsgivende, så sproget er en upålidelig kilde til at forstå modellens faktiske ræsonnement.
Det rammer sikkerhedsmekanismer, der stoler på modellens sproglige selvrapportering. Chain-of-thought-monitorering læser modellens ræsonnement. Constitutional self-critique lader modellen vurdere sine egne svar. Activation probing forsøger at finde sprogligt definerede træk i modellens indre tilstande. Alle tre bygger på, at sproget afspejler beregningerne. Ifølge Mickens kan de aldrig blive fuldt forsvarlige.
I stedet skal sikkerheden bygge på isolation, der ikke kræver, at man læser modellens sprog. Mickens peger på taint tracking som en lovende tilgang. Man definerer på forhånd, hvilke dele af systemet der aldrig må påvirkes af modelproducerede data, og sporer derefter dataene gennem systemet. Det virker, uanset hvad modellen siger om sig selv.
Derudover nævner han robust virtualisering og tredjeparts-audit af sandbox-konfigurationer. Sådanne mekanismer ville ifølge papiret have afbødet flere af de seneste sandbox-exploits, som frontmodeller har været involveret i.
Det er uklart: Abstractet nævner konkrete sandbox-exploits, men specificerer dem ikke.
Kilder
Produktionshistorie
- Radar Signal ? af 100 · spredning 1 kilder
- Vurdering Nyheds 3/5 — Relevant analyse af LLM-sikkerhed, men ikke en konkret begivenhed.
- Skrevet Model: deepseek-v4-flash · temperatur 0.4
- Overskrift 5 kandidater, valgt af deepseek-v4-flash
- Korrektur 1 zen · 2 rettelser
- Vedtagelse ainews-auto-v3 · score 0.6343