Kun 6 mia. parametre arbejder per token i netværk på 125 mia
En router udvælger specifikke grupper af parametre til hver token, så modellen ikke behøver at køre hele sit netværk for hver beregning.
Læs i dit tempo
Kort
Store sprogmodeller bruger kun en lille del af deres parametre, eller matematiske værdier, per tekstbid. Det betyder, at hele netværket ikke behøver at køre, hvilket gør processen mere effektiv. En router styrer nu forløbet ved kun at aktivere de mest relevante grupper af parametre.
Begynder
Har du nogensinde tænkt over, hvordan en sprogmodel egentlig behandler information? Den ser ikke ord, som vi gør, men bruger i stedet »tokens«. Det er små bidder af tekst, som modellen arbejder med. Når modellen møder computerkode, skaber det nogle helt særlige mønstre af disse tokens, som den skal navigere i. Modellens viden består af »parametre«, som er matematiske værdier, den har lært under sin træning. Her er viden ikke gemt som enkelte, isolerede fakta, men er i stedet fordelt ud over hele netværket.
Selvom en model kan have 125 milliarder af disse parametre, bruger den ikke alt på én gang. For hver lille bid tekst, den skaber, aktiverer den kun omkring 6 milliarder parametre. En såkaldt »router« styrer nemlig, hvilke dele af modellen der skal bruges. Routeren fungerer som en vejviser, der aktiverer udvalgte grupper af parametre til den specifikke beregning. Det handler ikke om, hvorvidt et spørgsmål er svært eller let, men er blot en konsekvens af, hvordan modellen er bygget.
Man kan sammenligne det med et hospital med 125 læger. Hvis en patient kommer ind med et problem med øjnene, behøver hospitalet ikke kalde samtlige 125 læger til stuegang. I stedet tilkalder man kun et lille antal specialister, der ved noget om øjne, mens resten af personalet ikke inddrages i arbejdet. På samme måde behøver sprogmodellen ikke at køre hele sit netværk for at producere et svar.
Vil du have, at jeg giver et konkret eksempel på, hvordan et ord bliver delt op i tokens?

Sprogmodeller med 125 milliarder parametre aktiverer kun omkring 6 milliarder parametre for hver token, de genererer. Det betyder, at modellen ikke behøver at køre hele sit netværk for at producere et svar.
Modeller behandler tekst som tokens i stedet for hele ord. Teksten konverteres først til mindre bidder, før modellen behandler den. Kode kan for eksempel skabe specifikke mønstre af tokens, som modellen skal navigere i.
Parametrene i netværket er matematiske værdier, som modellen har lært under træning. Modellen justerer milliarder af disse tal for at lære mønstre. Viden er her fordelt ud over hele netværket i stedet for at være lagret som enkelte, isolerede fakta.
En router styrer, hvilke dele af modellen der skal bruges. Modellen består af flere grupper af parametre, og routeren aktiverer kun udvalgte grupper til den specifikke beregning af en token. Det er ikke et spørgsmål om, at modellen vurderer, om et spørgsmål er let eller svært, men derimod en konsekvens af arkitekturen.
Processen minder om et hospital med 125 læger. Hvis en patient ankommer med et øjenproblem, tilkalder hospitalet ikke samtlige 125 læger. Kun et lille antal specialister arbejder på det konkrete tilfælde, mens resten af personalet ikke inddrages i beregningen.
Kilder
Produktionshistorie
- Radar Signal ? af 100 · spredning 1 kilder
- Vurdering Nyheds 4/5 — Teknisk forklaring af modelarkitektur (MoE), som er vigtig for buildere.
- Skrevet Model: mimo-v2.5-free · temperatur 0.4
- Overskrift 5 kandidater, valgt af chat.dk
- Billede Genereret af gemini-3.6-flash-medium
- Vedtagelse Godkendt af Lars Louvre