Spring til indhold
AiNews.dkDanske nyheder om Kunstig Intelligens

Lokal LLM

Unsloth gør Qwen- og GLM-modeller dobbelt så hurtige

Ny version af Unsloth aktiverer MTP som standard, hvilket halverer tiden for inferens på specifikke flash-modeller.

1 kildeVedtaget af NIel AutopilotRettet 2. september 2026 kl. 16.22

Læs i dit tempo

Kort

Unsloth har udgivet en stor opdatering med hurtigere AI-modeller, nye lydfunktioner og et gratis program til computeren. Det betyder, at kunstig intelligens nu svarer markant hurtigere og er lettere at bruge for flere. Brugere kan nu downloade Unsloth Desktop til Windows, Mac og Linux.

Begynder

Nye opdateringer gør AI-modeller som Qwen3.8-Flash-Next og GLM-5.3-Flash dobbelt så hurtige til at svare. Det sker via Multi-Token Prediction, som er en teknik, hvor maskinen kan gætte flere ord på én gang i stedet for ét ad gangen. Det er lidt som at læse hele sætninger i stedet for enkelte bogstaver. Programmet Unsloth i version v0.1.806-beta gør dette muligt, men man kan stadig selv slå funktionen fra.

Mac-brugere kan opleve, at svar i lange samtaler bliver 30 gange hurtigere med systemet MLX. Modellerne understøtter nu deres fulde kontekstvindue, hvilket svarer til AI'ens korttidshukommelse, så den kan håndtere længere tekstforløb. Samtidig bliver hukommelsen i den digitale motor, en Graphics Processing Unit (GPU), tømt mere effektivt, når man skifter mellem forskellige modeller.

Der er kommet fire nye lydmodeller, herunder MiniMax-Music3, Higgs og MOSS. Unsloth kan nu vise status live, mens lyden skabes, og man kan arkivere sine lydklip. Over 170 andre forbedringer hjælper hardwaren, blandt andet ved at styre hukommelsen bedre, når man bruger flere grafikmotorer. For dem med AMD-hardware på Windows og Linux finder systemet nu selv den bedste installation.

Flere værktøjer kan nu køre samtidigt uden at bytte rundt på oplysningerne. Forbindelser via Model Context Protocol (MCP)-servere bevares gennem hele samtalen, så næste kald går hurtigere. Man kan nu rette lokal kode med Codex-værktøjet apply_patch og godkende planer for dybdegående research, før undersøgelsen starter. Endelig er Unsloth Desktop nu gratis og tilgængelig for alle som open source — altså software, hvor koden er åben for alle — på Windows, macOS og Linux med baggrundsopdateringer og mulighed for at vælge sin egen port til lokale netværk (LAN).

Vil du have, at jeg forklarer nærmere, hvordan den forbedrede korttidshukommelse på Mac kan hjælpe dig i praksis?

AiNews' genererede delekort for „Unsloth gør Qwen- og GLM-modeller dobbelt så hurtige“
Genereret motiv i AiNews' radarsprog · ikke et fotografi fra historien

To gange hurtigere inferens er resultatet af MTP, som nu er aktiveret som standard for Qwen3.8-Flash-Next og GLM-5.3-Flash. Version v0.1.806-beta af Unsloth gør det muligt at køre disse modeller hurtigere, men brugeren kan stadig deaktivere funktionen.

30 gange hurtigere svar i lange samtaler kan Mac-brugere opleve med MLX. Modellerne understøtter nu deres fulde kontekstvindue og håndterer længere sekvenser af generering. MLX frigiver desuden GPU-hukommelse mere effektivt mellem forskellige modelskift.

Fire nye audiomodeller, herunder MiniMax-Music3, Higgs og MOSS, er nu understøttet. Unsloth har tilføjet live-opdateringer af status under generering af lyd samt mulighed for at arkivere lydklip.

Over 170 forbedringer dækker også hardware og træning. Der er nu bedre planlægning af hukommelsen ved brug af flere GPU'er, og AMD-installationer på Windows og Linux finder automatisk den bedste build.

Flere værktøjskald kan nu køres samtidigt uden at argumenterne bliver byttet om. Værktøjsforbindelser via MCP-servere bevares gennem hele samtalen for at gøre kald hurtigere.

Lokal kode kan nu redigeres ved hjælp af Codex-værktøjet apply_patch. Brugerne kan desuden gennemgå og godkende planer for Deep Research, før selve undersøgelsen starter.

En gratis open source-version af Unsloth Desktop er nu tilgængelig til Windows, macOS og Linux. Programmet understøtter baggrundsopdateringer og giver mulighed for at vælge en brugerdefineret port til LAN-adgang.

Kilder

  1. 2x Faster Qwen3.8-Flash + GLM-5.3-Flash MTP github.com
Produktionshistorie
  1. Radar Signal ? af 100 · spredning 1 kilder
  2. Skrevet Model: mimo-v2.5-free · temperatur 0.4
  3. Overskrift 4 kandidater, valgt af chat.dk
  4. Korrektur 1 zen · 2 rettelser
  5. Vedtagelse ainews-auto-v3 · score 0.4431