Spring til indhold
AiNews.dkDanske nyheder om Kunstig Intelligens

Lokal LLM

Sprogmodel Needle 2 bringer AI-assistenter til billig hardware uden GPU

Needle 2 bringer agent-funktionalitet til enheder under 200 dollars og kræver kun 28 MB RAM.

5 kilderVedtaget af NIel AutopilotRettet 10. august 2026 kl. 23.20

Læs i dit tempo

Kort

Sprogmodellen Needle 2 er udviklet som en ekstremt lille model til billig hardware som telefoner. Den bruger meget lidt strøm og hukommelse, hvilket gør det muligt at have en assistent kørende konstant. Den kan styre enheder lokalt og sender komplekse opgaver videre til en større model i skyen.

Vil du have, at jeg forklarer nærmere, hvordan hybridteknikken med skyen fungerer?

Begynder

Sprogmodellen Needle 2 er utrolig lille. Den fylder kun 14 megabyte (MB), hvilket svarer til en meget lille fil, og kræver kun 28 megabyte RAM – computerens korttidshukommelse – for at fungere. Med 45 millioner parametre, som er modellens indre justeringsknapper, og en stærk komprimering, kan den køre på helt almindelig hardware. Det betyder, at den ikke behøver en Graphics Processing Unit (GPU) eller en Neural Processing Unit (NPU), som er specialiserede chip til kunstig intelligens. I stedet kan den køre på billige telefoner eller en Raspberry Pi, som er en lille og prisbillig computer.

Modellen er lynhurtig til at spytte tokens ud, som er de små stykker tekst, den danner. På VR-briller som Meta Quest 3S og Apple Vision Pro kan den levere op til 1.500 tokens i sekundet. En Raspberry Pi 5 når 500, mens budgettelefoner i Samsungs A-serie ligger på 300 til 700. Den bruger mellem 7 og 85 gange færre MFLOPs per token end andre små modeller. MFLOPs står for »Millions of Floating Point Operations« og beskriver, hvor meget regnekraft maskinen bruger. Det gør det muligt at have en assistent kørende hele tiden uden at dræne batteriet.

Hvorfor er den så lille? 45 millioner parametre er nok til at forbinde tekst med bestemte handlinger, uden at modellen behøver at have generel viden om verden. Det svarer til en assistent, der ikke kan skrive digte, men som præcis ved, hvilken knap der skal trykkes på for at tænde lyset. Den kan derfor styre enheder, bruge værktøjer og udtrække data via et fastlagt skema.

Man kan finjustere modellen lokalt på en Mac eller PC, hvilket betyder, at man tilpasser den til en specifik opgave. Det tager alt fra få minutter til et par timer. For at sikre kvaliteten bruger systemet en hybridteknik, hvor hvert svar får en score for sikkerhed. Hvis scoren er under en fastsat grænse, bliver opgaven sendt videre til en meget større model i skyen, som er en kraftig computer på en fjernserver.

Vil du have et eksempel på, hvordan en sådan lille model kan bruges i et smart-hjem?

AiNews' genererede delekort for „Sprogmodel Needle 2 bringer AI-assistenter til billig hardware uden GPU“
Genereret motiv i AiNews' radarsprog · ikke et fotografi fra historien

Sprogmodellen Needle 2 fylder 14 MB og kræver kun 28 MB RAM for at køre en session. Modellen har 45 millioner parametre med 2-bit komprimering. Den er bygget til hardware uden GPU eller NPU, såsom billige telefoner og Raspberry Pi.

Op til 1.500 tokens i sekundet kan modellen levere på VR-enheder som Meta Quest 3S og Apple Vision Pro. På en Raspberry Pi 5 når den 500 tokens i sekundet, mens budgettelefoner i Samsung A-serien ligger på 300 til 700 tokens i sekundet.

7 til 85 gange færre MFLOPs per token bruger Needle 2 end de mindste effektive sprogmodeller. Det gør det muligt at have en assistent kørende hele tiden inden for et stramt strøgbudget.

45 millioner parametre er nok til at mappe tekst til funktioner uden behov for generel viden. Modellen kan kalde værktøjer, styre enheder og udtrække strukturerede data via et skema. Da opgaver som at tænde et lys ikke kræver fri tekst, kan modellen nøjes med få parametre.

Få minutter til et par timer tager det at finjustere modellen lokalt på en Mac eller PC. Systemet bruger desuden en hybridteknik, der tildeler hvert svar en score for sikkerhed. Hvis scoren er under en fastsat grænse, sendes opgaven videre til en større model i skyen.

Kilder

  1. Needle2: 14MB agentic LLM for phones, wearables, smart home and robots cactuscompute.com
  2. Needle2: 14MB agentic LLM for phones, wearables, smart home and robots cactuscompute.com
  3. Needle 2: 14MB agentic LLM for phones, wearables, smart home and robots. reddit.com
  4. Show HN: Needle2: 14MB agentic LLM for phones, wearables, smart home and robots https:// cactuscompute.com/needle # llm mastodon.social
  5. Needle2: 14MB agentic LLM for phones, wearables, smart home and robots https:// cactuscompute.com/needle Comments:… mastodon.social
Produktionshistorie
  1. Radar Signal ? af 100 · spredning 3 kilder
  2. Vurdering Nyheds 4/5 — Ny lille agentisk model til edge-devices.
  3. Skrevet Model: mimo-v2.5-free · temperatur 0.4
  4. Overskrift 5 kandidater, valgt af chat.dk
  5. Korrektur 1 zen · 1 rettelser
  6. Korrektur 2 chatdk · 1 rettelser
  7. Vedtagelse ainews-auto-v3 · score 1.1347