Brugeren kan nu afsløre AI'ens kildevalg
Ved at holde musen over genererede token kan man se, hvilke tidligere token der har påvirket ordvalget i en sprogmodel.
Læs i dit tempo
Kort
En ny visualisering viser, hvilke tidligere ord en sprogmodel fokuserer på, når den genererer et nyt ord.
Det forklarer, hvorfor modeller er gode til at kopiere, fordi de trækker på alle tidligere ord i kildeteksten.
Nu viser eksempler, at modellen stadig har brug for menneskelig hjælp til at finde fejl, som da den gengav et computerprogram, men ikke opdagede ændringen.
Begynder
Har du nogensinde undret dig over, hvordan en sprogmodel vælger sine ord? En sprogmodel er et computerprogram, der er trænet til at forudsige det næste stykke tekst. Den arbejder med små bidder af tekst, som kaldes tokens. Et token kan for eksempel være et ord eller en del af et ord. Nu findes der en visualisering, der gør modellens opmærksomhed synlig. Opmærksomhed afgør, hvor meget hvert tidligere token betyder for det næste valg. Du kan trykke på eller holde musen over et token, som modellen selv har skrevet, og se, hvilke tidligere tokens der har påvirket valget. Det er lidt som at se, hvilke ord en læser kigger ekstra længe på i en tekst.
Visualiseringen er stærkt forenklet. For hvert tidligere token regner den ét tal ud. Tallet er opmærksomhedsvægten ganget med størrelsen af værdivektoren. Opmærksomhedsvægten siger, hvor meget modellen lægger vægt på tokenet. Værdivektoren er den information, tokenet bidrager med. Til sidst lægges tallene sammen på tværs af alle opmærksomhedshoveder og alle lag. Opmærksomhedshoveder er forskellige måder at se på teksten på. Lag er de trin, teksten gennemgår i modellen. Tallet styrer, hvor tydeligt det tidligere token vises. De største værdier får fuld synlighed. Resten får en synlighed mellem fuld og lav. Forfatteren kastede meget information væk for at få ét tal for hvert token. Det er lidt som at lave et resumé af en lang samtale, hvor man kun beholder de vigtigste pointer. Han regnede med, at det kunne blive uforståeligt. Men mønstrene viser tydeligt, hvordan modellen trækker på kilden. I et eksempel med en opsummering af et kontorflyt kan man holde musen over kopierede adresser og datoer. De oprindelige data lyser op. Det skyldes, at de genererede tokens tager meget af informationen fra kilden.
Det forklarer også, hvorfor modeller kan være gode til at kopiere. De forudsiger ikke hele teksten ud fra en begrænset opsummering af det, de allerede har skrevet. De har adgang til alle tidligere tokens og kan vælge, hvilke de skal trække på. Sandsynligheden for fejl kan blive lav. I et andet eksempel kan en model med 600 millioner parametre genskabe en JavaScript-funktion, bortset fra den ønskede ændring. Parametre er de tal, modellen lærer under træningen. JavaScript er et programmeringssprog. En funktion er et lille stykke programkode. Modellen fandt ikke selv fejlen, men skulle have hjælp.

En visualisering gør opmærksomhed (attention) i transformer-baserede sprogmodeller synlig. Brugeren kan trykke på eller holde musen over et genereret token og se, hvilke tidligere token der har påvirket valget.
Visualiseringen er stærkt forenklet. Den beregner opmærksomhedsvægt, ganget med størrelsen af værdivektoren, samlet på tværs af alle opmærksomhedshoveder og summeret på tværs af alle lag. Tallet styrer, hvor tydeligt de tidligere token vises. De største værdier får fuld synlighed, mens resten bliver fordelt mellem fuld og lav synlighed.
Forfatteren kastede meget information væk for at få ét tal for hvert tidligere token. Forfatteren regnede med, at det kunne blive uforståeligt, men mønstrene viser, hvordan modellen trækker på kilden. I et eksempel med en opsummering af et kontorflyt kan man holde musen over kopierede adresser og datoer. De oprindelige data lyser op, fordi de genererede token tager meget af informationen fra kilden.
Det forklarer også, hvorfor modeller kan være gode til at kopiere. De forudsiger ikke hele sekvensen fra et begrænset indre stadie. De har adgang til alle tidligere token og kan vælge, hvilke de skal trække på. Sandsynligheden for fejl kan blive lav.
I et andet eksempel kan en model med 600 millioner parametre reproducere en JavaScript-funktion, bortset fra den ønskede ændring. Modellen fandt ikke selv fejlen, men skulle have hjælp.
Det er uklart: Kilden er afklippet i slutningen, så det sidste eksempel med ordet 'remain' kan ikke gengives fuldt.
Kilder
- LLM Attention Visualization ishamf.dev
- LLM Attention Visualization ishamf.dev
Produktionshistorie
- Radar Signal ? af 100 · spredning 1 kilder
- Vurdering Nyheds 3/5 — Visualisering af attention giver teknisk indsigt, nyttig for LLM-udviklere.
- Skrevet Model: deepseek-v4-flash · temperatur 0.4
- Overskrift 5 kandidater, valgt af chat.dk
- Billede Genereret af gemini-2.5-flash-image
- Vedtagelse ainews-auto-v3 · score 0.7106