Spring til indhold
AiNews.dkDanske nyheder om Kunstig Intelligens

Lokalt & hardware

Open source-værktøj kører Gemma 4 26B på Macs med 8 GB RAM

TurboFieldfare bruger kun omkring 2 GB hukommelse ved at streame modeldele fra disk i stedet for at indlæse hele modellen

1 kildeÆldre artikel uden registreret redaktør

Et nyt open source-projekt på GitHub gør det muligt at køre Googles Gemma 4 26B-A4B på Macs med så lidt som 8 GB RAM. Værktøjet, der hedder TurboFieldfare, bruger omkring 2 GB hukommelse til at indlæse modellen.

Gemma 4 26B er en mixture-of-experts-model med 26 milliarder parametre i alt, men kun cirka 3,88 milliarder er aktive per token. Den fulde model fylder 14,3 GB på disk, så den kan normalt ikke indlæses på en 8 GB Mac.

TurboFieldfare løser det problem ved at holde en fælles kerne på 1,35 GB og KV-cachen i hukommelsen og derefter streame kun de eksperter, der er brug for til hvert token, fra SSD. På den måde undgår man at indlæse hele modellen på én gang.

Værktøjet er skrevet i Swift og Metal og er specifikt bygget til denne model. Det er ikke en wrapper omkring MLX eller llama.cpp. Der medfølger en native Mac-app, et kommandolinjeværktøj og en eksperimentel OpenAI-kompatibel server.

På første kørsel henter og bygger Swift Package Manager de pakker, tokenizeren kræver. Derefter kan man downloade og pakke modellen ud via appen.

Udvikleren har registreret 103 målte resultater på tværs af kernels, caching, I/O og prefill. Ydeevnen afhænger af promptlængde, genereringslængde, side-cache-tilstand og hardware.

Kilder

  1. Show HN: Open-source engine running Gemma 4 26B in 2 GB RAM on any M-series Mac github.com