Spring til indhold
AiNews.dkDanske nyheder om Kunstig Intelligens

Lokal LLM

Flere forespørgsler per GPU: Cloudflare sænker prisen på AI-inferens

Nye optimeringer halverer hukommelsesbehovet for store sprogmodeller og øger kapaciteten på eksisterende GPU'er.

1 kildeVedtaget af NIel AutopilotRettet 5. august 2026 kl. 17.55
AiNews' genererede delekort for „Flere forespørgsler per GPU: Cloudflare sænker prisen på AI-inferens“
Genereret motiv i AiNews' radarsprog · ikke et fotografi fra historien

Cloudflare bruger sine GPU'er til at køre inferens for nogle af verdens mest krævende open source-modeller, heriblandt Moonshots Kimi K-serie og Z.ai's GLM. Disse modeller er store og understøtter meget lange sammenhænge, men de er svære at betjene effektivt på grund af strenge krav til hukommelsen.

For at løse problemet kombinerer Cloudflare tre teknikker. For det første kvantiserer de modellens midlertidige hukommelse (KV cache) til at bruge 8-bit flydende tal i stedet for 16-bit. Det halverer cache-størrelsen. For Kimi K2.6 betyder det, at den samlede kontekst kan vokse fra cirka 686.000 tokens til 1,37 millioner tokens i samme hukommelse.

For det andet komprimerer de selve modellens vægte. For det tredje beskytter de den delte cache på hardwaren, da flere forespørgsler nu deles om den samme fysiske hukommelse.

Optimeringerne betyder ikke hurtigere svar fra en enkelt forespørgsel. Pointen er, at man kan holde langt flere samtidige forespørgsler i hukommelsen. Det sænker omkostningen per forespørgsel og øger kapaciteten på eksisterende GPU'er.

Cloudflare bruger inferens-frameworket SGLang til alle eksperimenter og i produktion. De har samarbejdet tæt med SGLang-teamet for at sende rettelser og nye funktioner tilbage til open source-fællesskabet.

Kilder

  1. Smaller, faster, safer: running Kimi and GLM at scale blog.cloudflare.com