AI-træning bliver en privatsag for 998 dollars
Hugo Vergnes trænede en 3,8 milliarder parametre stor model på 65 milliarder tokens for 998 dollars på 43 timer med lejede B200-GPU'er.
Læs i dit tempo
Kort
En person har trænet en stor sprogmodel for under 1.000 dollars på lejede GPU'er. Det betyder, at avanceret AI-udvikling nu er mulig for enkeltpersoner uden store budgetter. Fremover kan flere lave egne modeller, og projektets værktøjer er offentligt tilgængelige.
Begynder
En enkeltperson kan nu træne en sprogmodel med 3,8 milliarder parametre for under 1.000 dollars. Hugo Vergnes har offentliggjort et projekt, hvor han trænede modellen little-lm på 65 milliarder tokens i 43 timer for 998 dollars på lejede NVIDIA B200-GPU'er. En parameter er en justerbar værdi i modellen, der hjælper den med at lære mønstre i tekst. Et token er en lille bid af tekst, for eksempel et ord eller en del af et ord. GPU'er er specialiserede regneenheder, der er gode til at håndtere mange beregninger på samme tid.
Modellen opnår en score på 0,384 i CORE-benchmarken. En benchmark er en standardtest, der måler, hvor godt en model klarer opgaver. Til sammenligning scorede nanochat d32, en model på omkring 1 milliard parametre, 0,310 for en tilsvarende pris. Vergnes' model er altså både større og bedre for næsten samme beløb. Det betyder, at han har fået mere kapacitet og bedre resultater for pengene.
Vergnes skriver, at projektet var inspireret af Andrej Karpathys nanochat. Han udviklede modellen om aftenen, fejlsøgte på en RTX 5090 og færdiggjorde træningen på lejede B200'er. Fejlsøgning er processen med at finde og rette fejl i koden. Han understreger, at B200'erne gav bedre værdi per arbejdsenhed end H100'erne, som nanochat brugte. Arbejdsenhed er et mål for, hvor meget regnekraft man får for pengene.
Som en del af projektet har Vergnes bygget little-lm, et konfigurationsdrevet framework til træning af små decoder-only-sprogmodeller. Et framework er en samling af værktøjer og regler, der gør det lettere at bygge noget. En decoder-only-model er en type sprogmodel, der forudsiger det næste ord i en tekst. Hver kørsel er specificeret i en YAML-fil, og komponenter som model, datasæt og optimizer registrerer sig selv i et globalt register. En YAML-fil er en simpel tekstfil, der beskriver indstillinger. En optimizer er en algoritme, der justerer parametrene under træning. Det gør det muligt at skifte eksempelvis optimizer eller datasæt med en ændring på én linje.
Vergnes fremhæver, at god infrastruktur betaler sig selv tilbage, især når man støder på konvergensproblemer. Konvergensproblemer opstår, når modellen ikke lærer godt nok under træning. Han mener, at den bedste infrastruktur er den, hvor man sjældent skal redigere kode manuelt – hvor man kan læse konfigurationen og forstå præcis, hvad der sker.
Den endelige model er Llama-stil med RMSNorm. Llama-stil refererer til en bestemt arkitektur, der oprindeligt blev udviklet af Meta. RMSNorm er en teknik, der hjælper med at stabilisere træningen. Vergnes har ikke offentliggjort alle detaljer om, hvad der ikke virkede, men han skriver, at rapporten beskriver både succeser og fejltagelser.
Projektet viser, at træning af sprogmodeller bliver mere tilgængeligt. Hvor det tidligere krævede et forskningslaboratorium eller en tech-gigant med millioner i compute-budget, kan en person med et par tusind dollars nu opnå meningsfulde resultater. Compute-budget er den mængde regnekraft, man har råd til at bruge. Det åbner døren for flere til at eksperimentere og bidrage til udviklingen af sprogmodeller.

En enkeltperson kan nu træne en sprogmodel med 3,8 milliarder parametre for under 1.000 dollars. Hugo Vergnes har offentliggjort et projekt, hvor han trænede modellen little-lm på 65 milliarder tokens i 43 timer for 998 dollars på lejede NVIDIA B200-GPU'er.
Modellen opnår en score på 0,384 i CORE-benchmarken. Til sammenligning scorede nanochat d32, en model på omkring 1 milliard parametre, 0,310 for en tilsvarende pris. Vergnes' model er altså både større og bedre for næsten samme beløb.
Vergnes skriver, at projektet var inspireret af Andrej Karpathys nanochat. Han udviklede modellen om aftenen, fejlsøgte på en RTX 5090 og færdiggjorde træningen på lejede B200'er. Han understreger, at B200'erne gav bedre værdi per arbejdsenhed end H100'erne, som nanochat brugte.
Som en del af projektet har Vergnes bygget little-lm, et konfigurationsdrevet framework til træning af små decoder-only-sprogmodeller. Hver kørsel er specificeret i en YAML-fil, og komponenter som model, datasæt og optimizer registrerer sig selv i et globalt register. Det gør det muligt at skifte eksempelvis optimizer eller datasæt med en ændring på én linje.
Vergnes fremhæver, at god infrastruktur betaler sig selv tilbage, især når man støder på konvergensproblemer. Han mener, at den bedste infrastruktur er den, hvor man sjældent skal redigere kode manuelt – hvor man kan læse konfigurationen og forstå præcis, hvad der sker.
Den endelige model er Llama-stil med RMSNorm. Vergnes har ikke offentliggjort alle detaljer om, hvad der ikke virkede, men han skriver, at rapporten beskriver både succeser og fejltagelser.
Projektet viser, at træning af sprogmodeller bliver mere tilgængeligt. Hvor det tidligere krævede et forskningslaboratorium eller en tech-gigant med millioner i compute-budget, kan en person med et par tusind dollars nu opnå meningsfulde resultater.
Kilder
- Training a 3.8B LLM to 0.384 CORE for $998 – Hugo Vergnes hugovergnes.github.io
- Training a 3.8B LLM to 0.384 CORE for $998 – Hugo Vergnes https:// hugovergnes.github.io/little-l m-3-8b/ # github # llm mastodon.social
- Training a 3.8B LLM to 0.384 CORE for $998 – Hugo Vergnes https:// hugovergnes.github.io/little-l m-3-8b/ Comments:… mastodon.social
Produktionshistorie
- Radar Signal ? af 100 · spredning 2 kilder
- Vurdering Nyheds 5/5 — Konkret træning med pris og resultat, relevant for byggere.
- Skrevet Model: deepseek-v4-flash · temperatur 0.4
- Overskrift 5 kandidater, valgt af deepseek-v4-flash
- Billede Genereret af gemini-2.5-flash-image
- Vedtagelse ainews-auto-v3 · score 0.9119