Spring til indhold
AiNews.dkDanske nyheder om Kunstig Intelligens

Lokal LLM

Cua-lag får llama.cpp til at køre 16 gange hurtigere i macOS-VM

Et lille lag som ændrer svar om GPU-muligheder får llama.cpp til at vælge hurtigere Metal-kerner. Resultatet kommer op på 98 procent af ydelsen direkte på hardwaren.

3 kilderVedtaget af NIel AutopilotRettet 12. august 2026 kl. 06.19

Læs i dit tempo

Kort

Et lille kompatibilitetslag fra Cua-teamet ændrer svar om GPU-muligheder i en macOS-virtualisering, så AI-modeller som llama.cpp kan bruge hurtigere Metal-kerner. Det gør en stor forskel: TinyLlama kører over 10 gange hurtigere, og store modeller når næsten samme ydelse som direkte på hardwaren. Projektet er udgivet som open source, så andre kan teste og forbedre det.

Begynder

Forestil dig, at du har en computer indeni en computer – et lille, lukket system (et såkaldt gæstesystem) som kører oven på dit normale styresystem, macOS. Det er en teknik, der minder om at have et ekstra værelse bag en dør, hvor man kan køre programmer uden at forstyrre resten af huset. For at billedet skal fungere, skal værelset have sine egne redskaber – blandt andet sin egen grafikprocessor (GPU), altså den del af computeren, der er specialiseret i billedberegninger. Apples Virtualization.framework bygger sådan et virtuelt redskab ved hjælp af den fysiske GPU, du allerede har i din Mac. Problemet er bare, at dette virtuelle redskab kun fortæller programmerne om en beskeden samling af evner – som en handyman, der siger, at han kun kan bruge en skruetrækker, selvom han rent faktisk har hele bæltet med sig. Resultatet er, at programmer som llama.cpp, der bruger grafikkortet til at accelerere kunstig intelligens, vælger den langsomme rute.

Teamet bag cua fandt en løsning på det. De byggede et lille kompatibilitetslag – tænk på det som en hurtig seddel, man klistrer på døren ind til værelset, som fortæller gæsteprogrammet: »Her er faktisk bedre redskaber tilgængelige, end du tror.« Når laget ændrer svarene om GPU-ens evner for én bestemt proces, vælger llama.cpp pludselig nyere og hurtigere beregningsmetoder (såkaldte Metal-kerner, named after Apple's Metal-teknologi til grafik). Og forskellen er markant.

På en M1 Ultra-chip gik TinyLlama 1.1B fra at sløse med tiden til at behandle sine input (såkaldte prompts, altså spørgsmålene man stiller modellen) hele 11 gange hurtigere og generere svar-ord hele 16 gange hurtigere sammenlignet med den uændrede virtuelle maskine. Promptbehandlingen nåede 98 procent af den ydelse, man ville få ved at køre direkte på maskinens eget hardware. Med en større model, Google Gemma 4 12B på knap syv gigabyte, blev prompthastigheden 7,2 gange hurtigere og token-genereringen (tokens er de små bider af tekst, modellen bygger svarerne af) hele 14,5 gange hurtigere – nu med 99,59 procent af direkte-hardware-ydelsen. Endelig testede de Meta Muse Glimmer 30B Q4_K-M GGUF, en endnu tungere model, i en virtuel maskine med 64 gigabyte hukommelse. Her gav låsningen af den virtuelle maskine 7,55 gange hurtigere promptbehandling og 8 gange hurtigere token-generering.

Projektet er open source – altså frit tilgængeligt og gennemsigtigt for alle – under samme licens som Lume og Cua. Koden indeholder kildekode, byggeskripter, et lille testværktøj til at måle evner (en såkaldt evningsprobe) og rå benchmark-logfiler, så enhver kan gengive resultaterne og udforske, hvilke Apple Silicon-chips, macOS-versioner og Metal-arbejdsbyrder der faktisk nyder godt af forbedringen.

AiNews' genererede delekort for „Cua-lag får llama.cpp til at køre 16 gange hurtigere i macOS-VM“
Genereret motiv i AiNews' radarsprog · ikke et fotografi fra historien

Et macOS-gæstesystem kører gennem Apples Virtualization.framework og får en virtuel GPU som bygger på værtens Apple GPU. Standardprofilen rapporterer konservative Metal-muligheder, og det får llama.cpp til at vælge langsommere GPU-koder.

Cua-teamet har bygget et lille kompatibilitetslag som ændrer udvalgte svar om GPU-muligheder for én gæstproces. Laget får llama.cpp til at vælge nyere Metal-kerner, og det gør en stor forskel.

På en M1 Ultra behandlede TinyLlama 1.1B prompter 11,08 gange hurtigere og genererede tokens 16,36 gange hurtigere sammenlignet med den samme workload i den uændrede VM. Promptbehandlingen nåede 98 procent af ydelsen direkte på hardwaren.

Med Google Gemma 4 12B (en model på 6,98 GB) gav laget 7,20 gange hurtigere promptbehandling og 14,54 gange hurtigere token-generering. Prompthastigheden nåede 99,59 procent af direkte-hardware-resultatet.

Teamet testede også Meta Muse Glimmer 30B Q4_K-M GGUF i en 64 GiB-gæst. Her behandlede den låste VM en 512-token-prompt 7,55 gange hurtigere og genererede 128 tokens 8 gange hurtigere.

Projektet er udgivet som open source under samme licens som Lume og Cua. Koden inkluderer kilde, build-scripts, evningsprobe og rå benchmark-logfiler, så andre kan gengive resultaterne og kortlægge hvilke Apple Silicon-chips, macOS-versioner og Metal-arbejdsbyrder som nyder godt af det.

Det er uklart: Materialet afbrydes midt i Muse Glimmer-resultatet. De eksakte tal for denne model i den låste VM er ikke tilgængelige, kun prompt- og token-forbedringer. Øvrige benchmarks og modeltest er fuldt dækket.

Kilder

  1. Apple Silicon and macOS VMs: 11–16× Faster LLM Inference with Llama.cpp github.com
  2. Apple Silicon and macOS VMs: 11–16× Faster LLM Inference with Llama.cpp https:// github.com/trycua/cua/blob/mai… mastodon.social
  3. 📜 Latest Top Story on # HackerNews : Apple Silicon and macOS VMs: 11–16× Faster LLM Inference with Llama.cpp 🔍… mastodon.social
Produktionshistorie
  1. Radar Signal ? af 100 · spredning 2 kilder
  2. Vurdering Nyheds 4/5 — Betydelig performance-forbedring for lokale LLM'er på Mac
  3. Skrevet Model: mimo-v2.5-free · temperatur 0.4
  4. Overskrift 5 kandidater, valgt af chat.dk
  5. Vedtagelse ainews-auto-v3 · score 0.8823