Så avanceret er den open source-inferens de fleste bruger
Første del i en serie forklarer kernemekanismer som scheduling og paged attention i det open source-inferenssystem.
Læs i dit tempo
Kort
Et dybtgående blogindlæg har forklaret, hvordan vLLM fungerer indefra, fra den grundlæggende motor til avancerede hukommelses- og kørselsteknikker. Det er vigtigt, da det giver viden til dem, der vil forstå eller bidrage til moderne AI-systemer. Følgende dele vil dække, hvordan systemet skalerer og yder via API.
Begynder
Et nyt og detaljeret blogindlæg fortæller om, hvad der foregår indeni vLLM — et system, der bruges til at køre avancerede sprogmodeller (dem, der danner baggrund for ting som ChatGPT) hurtigt og effektivt. Forfatteren Aleksa Gordić lægger ud med det allermest fundamentale og bygger stille og roligt ovenpå. Det er lidt som at åbne motorhjelmen på en bil: først forstår du motorblokken, og bagefter lærer du gearkassen, styreelektronikken og firehjulstrækket at kende.
I den første del ser han på kernen — den såkaldte V1-motor — og tre teknikker, der holder systemet i gang uden at det bremser op. Den ene handler om at planlægge, hvilke opgaver der kører på grafikkortet (den computertype, der typisk bruges til denne slags arbejde) lige nu — lidt som en trafikleder, der dirigerer bilerne gennem et kryds. En anden teknik hedder paged attention og kan sammenlignes med at opdele en-notesbog i små faste lapper, så systemet nemt kan finde plads til ny information uden at smide det gamle væk. Den tredje, continuous batching, sørger for, at forespørgsler fra mange brugere løbende samles i hold og sendes gennem systemet, så grafikkortet aldrig sidder og glor i tomgang. Tilsammen gør de tre ting, at systemet kan servere svar til mange brugere på én gang uden at miste fart.
Herefter kommer de mere avancerede features. Chunked prefill og prefix caching handler begge om at spare grafikkortets hukommelse — den hurtige, men begrænsede arbejdshukommelse i kortet. Tænk på det som at genbruge allerede skrevne noter i stedet for at skrive dem forfra hver gang. Guided decoding er en måde at tvinge modellen til at svare i et bestemt format, fx som et json-objekt (et struktureret datostykke, computeren nemt kan læse), mens speculative decoding lader en mindre, hurtigere model foreslå svar først, som den store model så hurtigt kan tjekke og godkende. Indlægget nævner også en teknik, der kalder det disaggregated P/D, hvor delene, der forbereder forespørgslen, og delene, der genererer svaret, kan køre uafhængigt af hinanden. Alt dette er skrevet ud fra en bestemt version af vLLM fra august 2025 og er tænkt til læsere, der vil forstå, hvordan moderne systemer til sprogmodeller faktisk virker — eller som overvejer at bidrage til projekter som vLLM og SGLang.

Et nyt og omfattende blogindlæg beskriver, hvordan vLLM fungerer indefra. Forfatteren Aleksa Gordić gennemgår systemets dele i en logisk opbygning, der starter med den basale LLM-engine og arbejder sig op til avancerede features og multi-GPU-skalering.
Indlægget fokuserer på V1-motoren i vLLM. Det dækker kernemekanismer som scheduling, paged attention og continuous batching, som er teknikker til at håndtere hukommelsen og kørslen effektivt på GPU'er. Disse dele gør det muligt at betjene flere anmodninger samtidigt uden at systemet bremser.
Dernæst forklarer indlægget avancerede funktioner. Blandt dem er chunked prefill og prefix caching, som optimerer brugen af GPU-hukommelsen, samt guided og speculative decoding. Det behandler også en teknik kaldet disaggregated P/D.
Serien vil senere dykke ned i, hvordan vLLM skalerer fra én til flere GPU'er, og hvordan serving-laget fungerer for at tilbyde modellerne via et API. Der vil også komme en del om benchmarks og automatisk justering af indstillinger.
Indlægget er baseret på en bestemt softwareversion fra august 2025 og er skrevet til læsere, der vil forstå moderne inferenssystemer, eller som overvejer at bidrage til projekter som vLLM og SGLang.
Kilder
Produktionshistorie
- Radar Signal ? af 100 · spredning 2 kilder
- Vurdering Nyheds 3/5 — Teknisk gennemgang af vLLM, relevant for udviklere.
- Skrevet Model: mimo-v2.5-free · temperatur 0.4
- Overskrift 5 kandidater, valgt af chat.dk
- Korrektur 2 chatdk · 2 rettelser
- Vedtagelse ainews-auto-v3 · score 0.9114