Spring til indhold
AiNews.dkDanske nyheder om Kunstig Intelligens

Topnyheder

Slankere AI-modeller bevarer nu mere af deres viden

Forskere oversætter blokfjernelse til et Ising-glas og vinder næsten 23 procentpoint på MMLU ved 50 procent kompression af Llama-3.3-70B.

1 kildeVedtaget af NIel AutopilotRettet 21. september 2026 kl. 20.13

Læs i dit tempo

Kort

Ny metode til blokfjernelse giver næsten 23 procentpoint bedre resultater end tidligere metoder ved 50 procent kompression.

Det er vigtigt, fordi blokfjernelse er en billig måde at gøre modeller hurtigere på, men valget er svært; metoden bruger et spin-system.

Forskerne har offentliggjort paperet på Hugging Face.

Begynder

Store sprogmodeller er blevet så store, at de er dyre og langsomme at bruge. En måde at gøre dem hurtigere på er at fjerne nogle af de indre »blokke«, som modellen er bygget op af. Det svarer lidt til at fjerne kapitler fra en bog for at gøre den kortere. Hvis man fjerner de rigtige kapitler, kan historien stadig give mening. Fjerner man de forkerte, falder den fra hinanden. Hidtil har man oftest valgt blokke fra én ad gangen, som om hver blok var uafhængig af de andre. Men det er den ikke. Effekten af at fjerne én blok afhænger af, hvilke andre blokke man også fjerner. Det gør valget til et enormt puslespil.

Forskere har nu fundet en ny måde at løse det puslespil på. De behandler valget af blokke, som om det var et fysisk system af magneter, der påvirker hinanden. I stedet for at teste hver kombination af blokke på en benchmark – en slags standardiseret eksamen for sprogmodeller – kan de beregne en slags »energi« for systemet. Den energi fortæller dem, hvor godt modellen vil klare sig, uden at de behøver at afprøve den. Det sparer enormt meget tid. De sværeste tilfælde sender de videre til avancerede løsere, nogle af dem inspireret af kvantefysik.

De fleste ældre metoder scorer hver blok for sig og fjerner dem, der ser mindst vigtige ud. Det er som at vurdere hver enkelt spiller på et hold uden at se på, hvordan de spiller sammen. En anden genvej har været kun at fjerne en sammenhængende serie af blokke, hvilket begrænser mulighederne kraftigt. Men den nye metode tager højde for, at blokkene interagerer. Og gevinsten er størst, når man komprimerer meget. Ved at fjerne halvdelen af blokkene i en stor model ved navn Llama-3.3-70B-Instruct opnår den nye metode næsten 23 procentpoint bedre resultater på MMLU-benchmarken end den hidtil bedste metode. Det er en markant forbedring, især i den dybe kompressionszone, hvor andre metoder typisk bryder sammen.

AiNews' genererede delekort for „Slankere AI-modeller bevarer nu mere af deres viden“
Genereret motiv i AiNews' radarsprog · ikke et fotografi fra historien

Ved 50 procent kompression af Llama-3.3-70B-Instruct giver en ny metode næsten 23 procentpoint mere på MMLU-benchmarken end den hidtil bedste metode til at fjerne blokke. Det skriver forskerne bag et nyt paper på Hugging Face.

Blokfjernelse (block removal) er en af de billigste måder at gøre en stor sprogmodel hurtigere på: Man sletter hele transformerblokke, så modellen bliver fysisk kortere. Det giver forudsigelige hastighedsgevinster og sparer hukommelse, og metoden kan kombineres med kvantisering og lavrangskompression. Problemet er at vælge, hvilke blokke der skal væk. Fjerner man de forkerte, bryder modellen sammen. Og effekten af at fjerne én blok afhænger af, hvilke andre blokke man fjerner samtidig.

Derfor behandler forskerne valget som et fysisk spin-system. Konkret formulerer de blokudvælgelsen som et problem i begrænset binær optimering (constrained binary optimization), der kan oversættes direkte til et Ising-glas: et system af spins med alle-til-alle-interaktioner og et fast antal 'op'-spins. Energien i dette system viser sig at være en stærk og billig proxy for, hvor godt den beskårne model klarer sig i benchmarks. Det gør det muligt at rangere et stort antal kandidatkonfigurationer uden at benchmarke nogen af dem. De svære tilfælde sendes videre til klassiske og kvanteinspirerede løsere.

De fleste eksisterende metoder scorer hver blok for sig og fjerner dem, der ser mindst vigtige ud. Det svarer til en mean-field-tilnærmelse, hvor hver blok behandles, som om den var uafhængig af de andre. En anden genvej er kun at fjerne én sammenhængende serie af blokke, hvilket skærer søgerummet drastisk ned. Men blokke er ikke uafhængige, og derfor er problemet kombinatorisk.

Den store gevinst ligger i den dybe kompressionszone. Ved 50 procent kompression af Llama-3.3-70B-Instruct vinder metoden næsten 23 procentpoint på MMLU over den bedste konkurrerende metode.

Kilder

  1. Pruning LLMs Like a Physicist: Block Removal as an Ising Optimization Problem huggingface.co
Produktionshistorie
  1. Radar Signal ? af 100 · spredning 1 kilder
  2. Vurdering Nyheds 4/5 — Ny metode til at beskære LLM’er relevant for lokale modeller.
  3. Skrevet Model: deepseek-v4-flash · temperatur 0.4
  4. Overskrift 5 kandidater, valgt af chat.dk
  5. Vedtagelse ainews-auto-v3 · score 0.4245