Spring til indhold
AiNews.dkDanske nyheder om Kunstig Intelligens

Lokal LLM

Åben kildekode flytter AI-kraften til brugerens maskine

Open source-motoren Magnitude tilpasser sig din hardware og kører op til 92 procent hurtigere end llama.cpp i egne test.

3 kilderVedtaget af NIel AutopilotRettet 30. september 2026 kl. 20.32

Læs i dit tempo

Kort

Udviklere har lanceret Magnitude, en gratis motor der kører AI-modeller lokalt næsten dobbelt så hurtigt og med mindre hukommelse. Det betyder noget, fordi flere AI-hjælpere kan køre samtidig på almindelige computere uden at blokere andet arbejde. Næste skridt er at få endnu større modeller til at køre på samme udstyr.

Begynder

Hvad nu hvis en digital hjælper kunne skrive næsten dobbelt så hurtigt og samtidig fylde mindre? Det er det, udviklernes egne målinger peger på. De har testet modellen Qwen 3.6 35B A3B i 4 bit og 64k kontekst. Kontekst betyder her, hvor meget modellen kan huske på én gang. 64k betyder cirka 64.000 enheder. Et token er en lille bid af tekst. Generering er, når modellen skriver ny tekst. Indlæsning er, når den læser det, den allerede kender. De sammenligner deres nye inferensmotor, altså det program der får modellen til at svare, ved navn Magnitude, med programmet llama.cpp. På en Mac M4 Pro med 48 gigabyte, forkortet GB, steg genereringen fra 30 til 57 token i sekundet. Indlæsningen steg fra 466 til 507 token i sekundet. Hukommelsen for hver agent, altså for hver digital hjælper, faldt med 28 procent. Tænk lidt på at skrive hurtigere med en mindre notesbog.

Mon motoren også kan falde til på en ny computer, lidt som dej der hæver efter skålen? Den tilpasser sig den computer, den kører på. Kerner er små regneopskrifter til grafikchippen, på engelsk Graphics Processing Unit (GPU). Kernerne skrives med fleksible parametre, altså indstillinger der kan ændres. De finjusteres på selve enheden, før modellen kører. Den er open source, altså åben så alle kan se og bruge koden, under licensen Apache 2.0. Den er skrevet i Rust, altså i programmeringssproget Rust. Den har egen kørselstid, altså sit eget startsystem, til GPU-kerner og automatisk finjustering. Den kører på Mac, Linux og Windows, altså på tre udbredte styresystemer.

Er det bygget til lange samtaler, der kører hjemme på selve computeren? Ja, den er bygget til agenter, der kører lokalt. En agent er en digital hjælper. En session er ét forløb med hjælperen. Sessionerne er lange. Flere kører ofte på én gang. Computeren skal stadig kunne bruges til andet. Magnitude reserverer derfor kun hukommelse til selve modellens vægte fra start. Vægte er modellens gemte viden. Hoben, altså det fælles lager der vokser efter behov, vokser, mens sessionerne vokser. Den frigives igen, når agenterne stopper. Flere sessioner kan dele cache, altså delt huskeseddel, uden at tabe fart. Magnitude bruger en hybrid form for paged attention, altså en metode til at dele opmærksomheden op i sider. Den lader samtidige sessioner dele præfiks-cache, altså den fælles start på samtaler. Men den placerer data, så de ligger tæt i hukommelsen. Idéen er lånt fra motorer som SGLang. Tænk på flere kokke, der deler den samme hakkede løgbase, men hver har sine gryder stående tæt ved hånden.

Hvordan starter det hele i hverdagen, og hvad er næste skridt? Den kommer som en desktop-app, altså et program på selve skærmen, der starter modeller efter behov. Den kobles til agenter som Pi, OpenCode, Hermes og Codex. Modellerne starter, når agenterne har brug for dem. De lukker ned igen efter inaktivitet. På sigt skal større modeller kunne køre på samme hardware, altså samme fysiske computer. Holdet planlægger blandt andet at lægge eksperter i arbejdshukommelse, på engelsk Random Access Memory (RAM), eller på disk og hente dem efter behov. Eksperter er her små dele af modellen med hver sit speciale. På NVIDIAs DGX Spark er gevinsten mindre, men stadig målbar. Her steg genereringen fra 49 til 58 token i sekundet. Indlæsningen steg fra 2.033 til 2.507 token i sekundet. Hukommelsen for hver agent faldt med 27 procent.

AiNews' genererede delekort for „Åben kildekode flytter AI-kraften til brugerens maskine“
Genereret motiv i AiNews' radarsprog · ikke et fotografi fra historien

Næsten dobbelt så hurtig generering og 28 procent mindre hukommelse pr. agent. Det viser udviklernes egne målinger med Qwen 3.6 35B A3B i 4 bit og 64k kontekst, hvor deres nye inferensmotor Magnitude sammenlignes med llama.cpp. På en Mac M4 Pro med 48 GB steg hastigheden fra 30 til 57 token i sekundet ved generering og fra 466 til 507 token i sekundet ved indlæsning.

Motoren tilpasser sig den computer, den kører på. Kernerne skrives med fleksible parametre, der finjusteres på selve enheden, før modellen kører. Den er open source under Apache 2.0, skrevet i Rust med egen kørselstid til GPU-kerner og automatisk finjustering. Den kører på Mac, Linux og Windows.

Den er bygget til agenter, der kører lokalt. Sessionerne er lange, flere kører ofte på én gang, og computeren skal stadig kunne bruges til andet. Magnitude reserverer derfor kun hukommelse til selve modellens vægte fra start. Hoben vokser, mens sessionerne vokser, og frigives igen, når agenterne stopper.

Flere sessioner kan dele cache uden at tabe fart. Magnitude bruger en hybrid form for paged attention, der lader samtidige sessioner dele præfiks-cache, men placerer data, så de ligger tæt i hukommelsen. Idéen er lånt fra motorer som SGLang.

Den kommer som en desktop-app, der starter modeller efter behov. Den kobles til agenter som Pi, OpenCode, Hermes og Codex. Modellerne starter, når agenterne har brug for dem, og lukker ned igen efter inaktivitet.

På sigt skal større modeller kunne køre på samme hardware. Holdet planlægger blandt andet at lægge eksperter i RAM eller på disk og hente dem efter behov.

På NVIDIAs DGX Spark er gevinsten mindre, men stadig målbar. Her steg genereringen fra 49 til 58 token i sekundet og indlæsningen fra 2.033 til 2.507 token i sekundet. Hukommelsen pr. agent faldt med 27 procent.

Det er uklart: Alle tal er udviklernes egne målinger mod llama.cpp, ikke uafhængigt efterprøvet.

Kilder

  1. Launch HN: Magnitude (YC S25) – Self-optimizing inference engine for agents github.com
  2. Launch HN: Magnitude (YC S25) – Self-optimizing inference engine for agents github.com
  3. Launch HN: Magnitude (YC S25) – Self-optimizing inference engine for agents github.com
Produktionshistorie
  1. Radar Signal ? af 100 · spredning 1 kilder
  2. Vurdering Nyheds 4/5 — Ny inference-motor til agenter med direkte bygger-relevans.
  3. Skrevet Model: deepseek-v4-flash · temperatur 0.4
  4. Overskrift 5 kandidater, valgt af chat.dk
  5. Korrektur 1 zen · 1 rettelser
  6. Vedtagelse ainews-auto-v3 · score 1.0145