Spring til indhold
AiNews.dkDanske nyheder om Kunstig Intelligens

Lokal LLM

Seneste nyt fra sektionen. Følg med RSS.

Runway lader dig styre AI-video live

Runway vil minimere tiden til første frame og streame video, mens brugeren skriver prompts. Realtidsgenerering kan også sænke GPU-omkostningerne, fordi hurtigere modeller bruger mindre GPU-tid.

1 kildelige nu

ENZO lader dig køre 2000 AI-modeller uden skyen

ENZO er en open source-platform, der kører lokalt og samler mere end 2000 gratis AI-modeller. Den har agenter, integration med Google-tjenester, kodevisning og en krypteret vault til API-nøgler.

2 kilderfor 2 timer siden

Nye konti isolerer arbejde, men deler modellen

Unsloth v0.1.810-beta tilføjer AMD-støtte til Docker og multi-brugerkonti med isolering. Billeddiffusion med INT8/FP8 kører dobbelt så hurtigt, og Windows på ARM64 får CUDA-støtte til træning og inferens.

1 kildefor 3 dage siden

HP lader dig køre kæmpe AI-modeller i toget

HPs Zbook Ultra G3a får op til 192 gigabyte delt hukommelse med 273 Gbps båndbredde til lokale AI-modeller. Den 16-tommer maskine vejer 1,9 kilo, holder 16 timer og kommer i oktober. Prisen er endnu ukendt.

1 kildefor 3 dage siden

Apple udfordrer Nvidias dominans på AI-hardware

Apple arbejder på en erhvervsserver med to eller fire M8 Ultra-chips til AI-inferens, skriver The Information. Serveren kan tidligst komme i 2029, og Apple overvejer Nvidias NVLink Fusion til at forbinde chipsene.

1 kildefor 4 dage siden

NVIDIA lader udviklere slå sikkerheden fra i GPU-kerner

NVIDIA har udgivet cuTile Rust, et tile-baseret system til at skrive GPU-kerner i Rust. Det udvider Rusts ejerskabsmodel til GPU-kerner, opdeler mutable output i disjunkte stykker og bevarer ejerskabskontrakten på tværs af kernel-launches. Udviklere kan fravælge sikkerheden lokalt, når de har brug for lavere-niveau-kontrol.

1 kildefor 4 dage siden

Brugeren beholder kontrollen over GPU-rækkefølgen

Unsloth har udgivet Windows ARM64-binaries med en rettelse, der sikrer, at brugerens valgte GPU-rækkefølge bevares i multi-GPU-opsætninger.

1 kildefor 4 dage siden

AI-agenter afleverer opgaver i din indbakke

Pizza Bot er en open source-desktopapp, der kører AI-agenter i baggrunden og viser resultaterne i en email-lignende indbakke. Appen er Apache 2.0-licenseret, kræver ingen konto og understøtter flere modeludbydere, herunder OpenAI, Anthropic og lokale modeller via Ollama.

2 kilderfor 5 dage siden

Forskere deler udstyr, men ikke data

Fødereret læring starter med én server og få klienter. Når projektet vokser, bliver opgaven at drive delt infrastruktur. Nvidia beskriver, hvordan FLARE skalerer på tværs af Docker, Kubernetes og Slurm, tildeler GPU'er efter behov og holder studier og data adskilt.

1 kildefor 5 dage siden

OpenAI gør mobilkameraet skarpere fra første billede

OpenAI køber Glass Imaging for over 300 millioner dollars. Selskabet, stiftet af to tidligere Apple-ingeniører, bruger neurale netværk til at forbedre smartphone-kameraer i optagelsesøjeblikket. Opkøbet styrker OpenAIs hardware-ambitioner.

1 kildefor 5 dage siden

Ollama skærer i API – udviklere mister kontrol

Ollama har udgivet v0.34.1-rc2, hvor API-parameteren typical_p er afskrevet. Nye modeller kan ikke længere oprettes med parameteren, mens eksisterende GGUF-modeller med indstillingen fortsat understøttes.

1 kildefor 6 dage siden

Påstanden om lokal AI får nu et modregnestykke

Sunk Cost beregner, hvor lang tid en lokal AI-hardware skal bruges, før den har tjent sig selv ind sammenlignet med at leje modellen per token.

5 kilderfor 6 dage sidenRadar-signal

Ubuntu-brugere slipper for selv at kompilere llama.cpp

llama.cpps udgivelse b10969 inkluderer nu Ubuntu-CUDA-byg til x64 og ARM64. CI'en bruger CUDA 12.8 og 13.3, og ARM64-byg kompileres med GCC 14. Afhængige biblioteker følger med, men NCCL er fjernet indtil licensen er afklaret.

1 kildefor 6 dage siden

Den skrivende agent får nu en uafhængig dommer

Qodo har lanceret Agentic Toolbox, der lader kodeagenter som Claude Code, Codex og Cursor bruge Qodo til uafhængig kodegennemgang. Gennemgangen kan køre på lokale ændringer, før en pull request eksisterer.

1 kildefor 6 dage siden

Værktøj afslører AI-hallucinationer på under et mikrosekund

Spanda er en open source-motor i Rust, der måler sprogmodellers usikkerhed på 760 nanosekunder. Metoden matcher Semantic Entropy på matematisk ræsonnement og bruger ingen GPU. Værktøjet kan opdage hallucinationer i realtid.

2 kilderfor 8 dage siden

AI-træning bliver en privatsag for 998 dollars

En udvikler har trænet en 3,8B-sprogmodel til en CORE-score på 0,384 for 998 dollars i lejede GPU-timer – et tegn på, at træning af egne modeller bliver billigere.

3 kilderfor 10 dage siden

NVIDIA åbner Windows-enheder for AI-udvikling

CUDA Toolkit 13.4 tilføjer support til Windows på Arm og giver udviklere mere kontrol over delte GPU'er. Opdateringen bygger på den eksisterende Linux-support og udvider CUDA-applikationer til Windows-enheder med Arm-processorer.

1 kildefor 11 dage siden

Åben kildekode flytter magten over AI-agenterne

Over 1.000 brugere anvender Moadim.io, en open source-planlægger til AI-agenter. Værktøjet installeres som en lokal Rust-daemon og administreres gennem Git.

2 kilderfor 15 dage siden

Hjemmets computere halverer ventetiden på AI

Nvidias nye værktøj PAIR gør det muligt at bruge flere computere på et hjemmenetværk som et lille datacenter til lokal AI. Værktøjet fordeler opgaver automatisk mellem ledige enheder, hvilket i en demo reducerede tidsforbruget fra 18 til under 9 minutter.

1 kildefor 16 dage siden

Lokal software bryder tech-giganternes magt

GPT4All er et open source-program til kørsel af store sprogmodeller lokalt på desktop-operativsystemer. Det understøtter både CPU og GPU, GGUF-formater og integration med eksterne API'er.

2 kilderfor 17 dage siden

NVIDIA gør CUDA-kode 300 gange hurtigere med ny optimeringsguide

NVIDIA har udgivet en guide til optimering af CUDA-kode. Ved at bruge CCCL- og CUB-biblioteker samt pinned memory kan udviklere fjerne hukommelsesfejl og øge hastigheden markant. I et konkret eksempel reduceres kørselstiden fra 6,8 sekunder til 23 millisekunder.

1 kildefor 18 dage siden

Otte år gamle computere kører nu moderne AI i Indien via skyen

Reliance Jio udvider sin cloud PC-tjeneste til alle internetbrugere i Indien. Ved at streame en virtuel computer fra skyen kan maskiner op til otte år gamle køre AI-applikationer uden behov for nye komponenter. Abonnementerne koster fra ca. 11 dollars.

1 kildefor 18 dage siden

Unsloth gør Qwen- og GLM-modeller dobbelt så hurtige

Unsloth v0.1.806-beta gør inferens op til to gange hurtigere for Qwen3.8-Flash-Next og GLM-5.3-Flash. Opdateringen bringer desuden 30x hastighedsforbedringer til lange samtaler på Mac via MLX samt understøttelse af nye audiomodeller og forbedret multi-GPU-træning.

1 kildefor 18 dage siden

Anthropic lancerer Fable 5.1 med lavere priser og færre fejl i filtrene

Anthropic har udgivet Fable 5.1 og Mythos 5.1. Fable-versionen er nu billigere i brug og har færre fejl i sine sikkerhedsfiltre. Samtidig får virksomheder mulighed for at køre modellerne på egen hardware uden datalæk.

1 kildefor 19 dage siden