Lokal LLM
Seneste nyt fra sektionen. Følg med RSS.
Runway lader dig styre AI-video live
Runway vil minimere tiden til første frame og streame video, mens brugeren skriver prompts. Realtidsgenerering kan også sænke GPU-omkostningerne, fordi hurtigere modeller bruger mindre GPU-tid.
ENZO lader dig køre 2000 AI-modeller uden skyen
ENZO er en open source-platform, der kører lokalt og samler mere end 2000 gratis AI-modeller. Den har agenter, integration med Google-tjenester, kodevisning og en krypteret vault til API-nøgler.
Nye konti isolerer arbejde, men deler modellen
Unsloth v0.1.810-beta tilføjer AMD-støtte til Docker og multi-brugerkonti med isolering. Billeddiffusion med INT8/FP8 kører dobbelt så hurtigt, og Windows på ARM64 får CUDA-støtte til træning og inferens.
HP lader dig køre kæmpe AI-modeller i toget
HPs Zbook Ultra G3a får op til 192 gigabyte delt hukommelse med 273 Gbps båndbredde til lokale AI-modeller. Den 16-tommer maskine vejer 1,9 kilo, holder 16 timer og kommer i oktober. Prisen er endnu ukendt.
Apple udfordrer Nvidias dominans på AI-hardware
Apple arbejder på en erhvervsserver med to eller fire M8 Ultra-chips til AI-inferens, skriver The Information. Serveren kan tidligst komme i 2029, og Apple overvejer Nvidias NVLink Fusion til at forbinde chipsene.
NVIDIA lader udviklere slå sikkerheden fra i GPU-kerner
NVIDIA har udgivet cuTile Rust, et tile-baseret system til at skrive GPU-kerner i Rust. Det udvider Rusts ejerskabsmodel til GPU-kerner, opdeler mutable output i disjunkte stykker og bevarer ejerskabskontrakten på tværs af kernel-launches. Udviklere kan fravælge sikkerheden lokalt, når de har brug for lavere-niveau-kontrol.
Brugeren beholder kontrollen over GPU-rækkefølgen
Unsloth har udgivet Windows ARM64-binaries med en rettelse, der sikrer, at brugerens valgte GPU-rækkefølge bevares i multi-GPU-opsætninger.
AI-agenter afleverer opgaver i din indbakke
Pizza Bot er en open source-desktopapp, der kører AI-agenter i baggrunden og viser resultaterne i en email-lignende indbakke. Appen er Apache 2.0-licenseret, kræver ingen konto og understøtter flere modeludbydere, herunder OpenAI, Anthropic og lokale modeller via Ollama.
Forskere deler udstyr, men ikke data
Fødereret læring starter med én server og få klienter. Når projektet vokser, bliver opgaven at drive delt infrastruktur. Nvidia beskriver, hvordan FLARE skalerer på tværs af Docker, Kubernetes og Slurm, tildeler GPU'er efter behov og holder studier og data adskilt.
OpenAI gør mobilkameraet skarpere fra første billede
OpenAI køber Glass Imaging for over 300 millioner dollars. Selskabet, stiftet af to tidligere Apple-ingeniører, bruger neurale netværk til at forbedre smartphone-kameraer i optagelsesøjeblikket. Opkøbet styrker OpenAIs hardware-ambitioner.
Ollama skærer i API – udviklere mister kontrol
Ollama har udgivet v0.34.1-rc2, hvor API-parameteren typical_p er afskrevet. Nye modeller kan ikke længere oprettes med parameteren, mens eksisterende GGUF-modeller med indstillingen fortsat understøttes.
Påstanden om lokal AI får nu et modregnestykke
Sunk Cost beregner, hvor lang tid en lokal AI-hardware skal bruges, før den har tjent sig selv ind sammenlignet med at leje modellen per token.
Ubuntu-brugere slipper for selv at kompilere llama.cpp
llama.cpps udgivelse b10969 inkluderer nu Ubuntu-CUDA-byg til x64 og ARM64. CI'en bruger CUDA 12.8 og 13.3, og ARM64-byg kompileres med GCC 14. Afhængige biblioteker følger med, men NCCL er fjernet indtil licensen er afklaret.
Den skrivende agent får nu en uafhængig dommer
Qodo har lanceret Agentic Toolbox, der lader kodeagenter som Claude Code, Codex og Cursor bruge Qodo til uafhængig kodegennemgang. Gennemgangen kan køre på lokale ændringer, før en pull request eksisterer.
Værktøj afslører AI-hallucinationer på under et mikrosekund
Spanda er en open source-motor i Rust, der måler sprogmodellers usikkerhed på 760 nanosekunder. Metoden matcher Semantic Entropy på matematisk ræsonnement og bruger ingen GPU. Værktøjet kan opdage hallucinationer i realtid.
AI-træning bliver en privatsag for 998 dollars
En udvikler har trænet en 3,8B-sprogmodel til en CORE-score på 0,384 for 998 dollars i lejede GPU-timer – et tegn på, at træning af egne modeller bliver billigere.
NVIDIA åbner Windows-enheder for AI-udvikling
CUDA Toolkit 13.4 tilføjer support til Windows på Arm og giver udviklere mere kontrol over delte GPU'er. Opdateringen bygger på den eksisterende Linux-support og udvider CUDA-applikationer til Windows-enheder med Arm-processorer.
Åben kildekode flytter magten over AI-agenterne
Over 1.000 brugere anvender Moadim.io, en open source-planlægger til AI-agenter. Værktøjet installeres som en lokal Rust-daemon og administreres gennem Git.
Hjemmets computere halverer ventetiden på AI
Nvidias nye værktøj PAIR gør det muligt at bruge flere computere på et hjemmenetværk som et lille datacenter til lokal AI. Værktøjet fordeler opgaver automatisk mellem ledige enheder, hvilket i en demo reducerede tidsforbruget fra 18 til under 9 minutter.
Lokal software bryder tech-giganternes magt
GPT4All er et open source-program til kørsel af store sprogmodeller lokalt på desktop-operativsystemer. Det understøtter både CPU og GPU, GGUF-formater og integration med eksterne API'er.
NVIDIA gør CUDA-kode 300 gange hurtigere med ny optimeringsguide
NVIDIA har udgivet en guide til optimering af CUDA-kode. Ved at bruge CCCL- og CUB-biblioteker samt pinned memory kan udviklere fjerne hukommelsesfejl og øge hastigheden markant. I et konkret eksempel reduceres kørselstiden fra 6,8 sekunder til 23 millisekunder.
Otte år gamle computere kører nu moderne AI i Indien via skyen
Reliance Jio udvider sin cloud PC-tjeneste til alle internetbrugere i Indien. Ved at streame en virtuel computer fra skyen kan maskiner op til otte år gamle køre AI-applikationer uden behov for nye komponenter. Abonnementerne koster fra ca. 11 dollars.
Unsloth gør Qwen- og GLM-modeller dobbelt så hurtige
Unsloth v0.1.806-beta gør inferens op til to gange hurtigere for Qwen3.8-Flash-Next og GLM-5.3-Flash. Opdateringen bringer desuden 30x hastighedsforbedringer til lange samtaler på Mac via MLX samt understøttelse af nye audiomodeller og forbedret multi-GPU-træning.
Anthropic lancerer Fable 5.1 med lavere priser og færre fejl i filtrene
Anthropic har udgivet Fable 5.1 og Mythos 5.1. Fable-versionen er nu billigere i brug og har færre fejl i sine sikkerhedsfiltre. Samtidig får virksomheder mulighed for at køre modellerne på egen hardware uden datalæk.