ExANS komprimerer KV-cache og gør AI-svar hurtigere på H100 GPU
ExANS reducerer flaskehalse i båndbredden ved at komprimere BF16-tensorer, hvilket mindsker tiden for den første genererede token.
Læs i dit tempo
Kort
Der er udviklet ExANS, en ny metode til at komprimere AI-modellens midlertidige hukommelse uden tab.
Dette fjerner flaskehalse i dataoverførslen, hvilket gør systemerne mere effektive.
Resultatet er, at AI-modeller kan begynde at generere svar hurtigere.
Begynder
ExANS er et spændende nyt værktøj til grafikprocessorer (GPU'er). Det kan gøre data mindre uden at miste information. Værktøjet arbejder med en Key-Value cache (KV-cache). Det er en slags korttidshukommelse for kunstig intelligens. Normalt er det svært at komprimere tal i formatet Bfloat16 (BF16). De er nemlig ofte meget uforudsigelige. ExANS løser dette ved at dele hvert tal i to strømme. Den ene er til størrelsen (eksponenten). Den anden er til præcisionen (fortegnet og mantissen). Det svarer til at opdele en pris i »tusinder« og »øre«. Tusindtallene gentager sig ofte, og derfor er de lettere at pakke sammen.
Værktøjet behandler data i små grupper, som kaldes fysiske blokke. Hver blok har én K-gruppe og én V-gruppe for hvert lag. ExANS finder et midtpunkt for størrelsen i disse grupper. Derefter bruger systemet en teknik kaldet Asymmetric Numeral System (ANS). Det er en smart metode til at komprimere data effektivt.
På en kraftig H100-grafikprocessor er hastigheden imponerende. Den kan udpakke data med 622 gigabyte i sekundet. Komprimeringsgraden er på 1,51. I store systemer er »motorvejen« mellem hardwaren ofte den største flaskehals. Det gælder især Peripheral Component Interconnect Express (PCIe)-forbindelsen og netværket. ExANS udpakker data hurtigere, end motorvejen kan levere dem. Det betyder, at hukommelsen ankommer hurtigere. Det reducerer tiden, før det første ord bliver genereret. Dette kaldes Time To First Token (TTFT).
Vil du have, at jeg uddyber, hvordan denne hurtigere udpakning konkret påvirker brugeroplevelsen, når man chatter med en AI?

ExANS er en ny codec til GPU'er, der komprimerer BF16 KV-cache uden tab. Den er udviklet til strukturerede BF16-tensorer og finder gentagelser i eksponent-feltet.
Det er normalt svært at komprimere BF16, fordi dataene har høj entropi og sjældent har gentagne bytes. ExANS løser dette ved at dele hvert BF16-tal i to strømme: én til eksponenten og én til fortegn og mantisse. Da eksponenter i en KV-cache ofte gentager sig, er denne del lettere at komprimere.
En fysisk KV-blok består af flere BF16-værdier organiseret i grupper, hvor der er én K-gruppe og én V-gruppe for hvert lag. ExANS behandler hver fysisk blok uafhængigt og beregner et center for eksponenterne i hver af disse grupper. Derefter bruges en modificeret ANS-kodning (Asymmetric Numeral System) til at komprimere dataene.
På en H100 GPU opnår ExANS en dekodningshastighed på 622 GB/s med en komprimeringsgrad på 1,51x.
I systemer til inferens er PCIe- og netværksbåndbredde ofte den største flaskehals. En codec, der dekoder hurtigere end linket leverer data, flytter denne grænse. Det betyder, at cached KV-blokke ankommer hurtigere, hvilket reducerer tiden, før den første token genereres (TTFT).
Kilder
- ExANS – Lossless KV cache compression at 622 GB/s on H100 theopenlake.com
- ExANS – Lossless KV cache compression at 622 GB/s on H100 theopenlake.com
Produktionshistorie
- Radar Signal ? af 100 · spredning 1 kilder
- Vurdering Nyheds 5/5 — Teknisk optimering af hardware-performance (H100) til LLM'er.
- Skrevet Model: mimo-v2.5-free · temperatur 0.4
- Overskrift 5 kandidater, valgt af chat.dk
- Korrektur 1 zen · 2 rettelser
- Billede Genereret af gemini-3.6-flash-medium
- Vedtagelse ainews-auto-v3 · score 0.9575