Spring til indhold
AiNews.dkDanske nyheder om Kunstig Intelligens

Topnyheder

Billig hardware flytter AI-magten væk fra skyen

Én ESP32-S3 styrer ordopdeling og indlejring, mens seks regner på transformer-lag. De er koblet i SPI-kæde med 1,58-bit kvantisering.

3 kilderVedtaget af NIel AutopilotRettet 29. september 2026 kl. 22.32

Læs i dit tempo

Kort

Syv små ESP32-S3-computerchips er sat sammen til at køre en sprogmodel, altså et program der skriver tekst, med 0,4 milliarder talværdier. Det betyder noget fordi metoden presser modellen meget lille så billig elektronik kan forstå tekst. Nu kan andre følge byggevejledningen og selv samle, klargøre og programmere de syv chips.

Begynder

Forestil dig syv små computerchips af typen ESP32-S3, der hjælpes ad som et hold i en stafet. Tilsammen kører de en sprogmodel, altså et program der kan skrive tekst, med 0,4 milliarder (B) indstillinger, kaldet parametre. Parametre er som små skruer, der bestemmer hvad modellen svarer. For at få plads er modellen presset helt flad. Det kaldes kvantisering, altså at runde tal groft af, her med 1,58-bit ternær metode efter BitNet-ideen, altså regning med kun tre værdier. Arbejdet er delt som distribueret pipeline-inferens i en klynge, altså fælles beregning hvor opgaven går på samlebånd fra chip til chip i gruppen.

Én chip er mester, altså master, der styrer de andre. Hvad sker der, når man skriver noget? Mesteren tager imod teksten og deler den i bidder. Det gøres med en Byte-Par-Kodning (Byte Pair Encoding, BPE)-deler, altså en tokenizer der klipper ord i små stykker som stavelser. Så slår den op i en indlejring, altså en ordbog der giver hvert stykke tal, gemt som heltal på 4 bit (Integer 4-bit, INT4). Sjovt nok beskriver projektet modellen som en beskåret 0,5B-model, mens titlen siger 0,4B.

De seks andre chips er regnenoder, altså arbejdere. Hver arbejder regner på en del af de såkaldte transformer-blokke, altså stablen af regnetrin i modellen. Det er opmærksomhedslag, altså attention, med Forespørgsel (Query, Q), Nøgle (Key, K), Værdi (Value, V) og Udgang (Output, O), som tilsammen vælger hvad der er vigtigt. Og det er flerlagsnetværk (Multi-Layer Perceptron, MLP)-lag med port (gate), op (up) og ned (down), altså tre filtre i træk. Til den ternære lineære algebra, altså regning med tre værdier i rækker og søjler, bruger koden særlige opslagstabeller, altså snydeark, og gange-og-læg-sammen på maskinsprog, altså assembler-optimerede operationer. Chipsene taler sammen over Seriel Perifer Grænseflade (Serial Peripheral Interface, SPI) i kæde, altså en tynd ledning hvor besked går fra nabo til nabo. Mesteren bruger en SPI-driver med to kanaler, altså to veje på én gang, som sender mellemresultater, kaldet aktiveringer, fra lag til lag.

Til sidst samler mesteren svaret med Sprogmodel-hoved (Language Model-hoved, LM-hoved), altså den sidste omregner til ord, og grådig sampling, altså at den hver gang nysgerrigt vælger det mest sandsynlige næste ord. Undervejs holder noderne styr på Qwen-opmærksomhed med Roterende Positionsindkodning (Rotary Positional Embedding, RoPE), altså en smart måde at huske rækkefølgen på, og Nøgle-Værdi-lager (Key-Value-cache, KV-cache), altså et kladdehæfte til tidligere udregninger. Kortene kører med Espressifs udviklingssystem til tingenes internet (Espressif Internet of Things Development Framework, ESP-IDF)-firmware, altså fast program på chippen, med egen opdelingstabel, altså partitionstabel, til stykker (token), model og fnorm. Og projektet henviser til en trin-for-trin-vejledning, altså en workflow-guide, med ledninger, klargøring af model og programmering. Kan så lidt hardware virkelig tale sammen på den måde?

AiNews' genererede delekort for „Billig hardware flytter AI-magten væk fra skyen“
Genereret motiv i AiNews' radarsprog · ikke et fotografi fra historien

Syv ESP32-S3-chips kører tilsammen en sprogmodel på 0,4 mia. parametre. Modellen er presset ned med 1,58-bit ternær kvantisering efter BitNet-ideen, og regnearbejdet er delt som distribueret pipeline-inferens på tværs af klyngen.

Én chip er master. Masteren tager imod brugerens input, deler teksten med en BPE-tokenizer og slår op i indlejring med INT4. Projektet beskriver modellen som en nedskåret 0,5B-model, mens titlen siger 0,4B.

De seks andre chips er regnenoder. Hver node regner på en del af transformer-blokkene, altså opmærksomhedslag med Q, K, V og O samt MLP-lag med gate, up og down. Koden bruger særlige opslagstabeller og assembler-optimerede gange-og-læg-sammen-operationer til den ternære lineære algebra.

Chipene taler sammen over SPI i kæde. Masteren bruger en SPI-driver med to kanaler, som sender aktiveringer fra lag til lag. Til sidst samler masteren svaret med LM-hoved og grådig sampling.

Noderne holder styr på Qwen-opmærksomhed med RoPE og KV-cache under kørslen. Kortene kører ESP-IDF-firmware med egen partitionstabel til token, model og fnorm, og projektet henviser til en workflow-guide med ledninger, klargøring af model og programmering.

Det er uklart: Kilderne giver ingen tal for hastighed, hukommelse, strøm eller svarkvalitet, og uoverensstemmelsen mellem 0,4B og 0,5B er ikke forklaret.

Kilder

  1. ESP32S3 cluster running 1.58-bit (BitNet) Language model github.com
  2. ESP32S3 cluster running 1.58-bit (BitNet) Language model https:// github.com/Low-Zi-Hong/ESP32s3 -LLM-Cluster # github… mastodon.social
  3. ESP32S3 cluster running 1.58-bit (BitNet) Language model: a cluster of ESP32S3 microcontrollers runs a 1.58-bit BitNet… mstdn.jp
Produktionshistorie
  1. Radar Signal ? af 100 · spredning 3 kilder
  2. Vurdering Nyheds 4/5 — BitNet-model på ESP32-klynge viser lokal AI på billig hardware
  3. Skrevet Model: deepseek-v4-flash · temperatur 0.4
  4. Overskrift 5 kandidater, valgt af chat.dk
  5. Korrektur 1 zen · 2 rettelser
  6. Korrektur 2 chatdk · 3 rettelser
  7. Vedtagelse ainews-auto-v3 · score 0.8486