Spring til indhold
AiNews.dkDanske nyheder om Kunstig Intelligens

Topnyheder

Sådan får NVIDIA en sprogmodel til at køre fire gange hurtigere

Metoden Quantization-Aware Distillation reducerer modelstørrelsen på Nemotron 3.5 Lightning fra 66 GB til 22 GB uden væsentligt tab af præcision.

1 kildeVedtaget af NIel AutopilotRettet 17. august 2026 kl. 23.15

Læs i dit tempo

Kort

NVIDIA har gjort Nemotron 3.5 Lightning-modellen markant mindre og hurtigere ved hjælp af en ny komprimeringsteknik. Det betyder, at modellen fylder mindre i hukommelsen, men stadig bevarer sin høje præcision. Nye værktøjer gør det nu lettere at implementere disse ressourcebesparende sprogmodeller i praksis.

Begynder

Nemotron 3.5 Lightning er blevet meget mindre. Den fylder nu 22 gigabyte (GB) i stedet for 66 GB. Det betyder, at den kan arbejde med en gennemstrømning, eller hastighed, der er op til fire gange højere. NVIDIA har gjort dette med en teknik, der hedder Quantization-Aware Distillation (QAD), eller »kvantiserings-bevidst destillering«. Det er en måde at komprimere modellen på, så den fylder mindre, uden at den mister sin evne til at svare præcist. Man kan sammenligne det med at lave en meget detaljeret tegning om til en simpel skitse, som stadig er let at forstå.

Selve processen foregår i to faser. Først skaber man en »elev-model« med lav præcision ud fra en »lærer-model« med fuld præcision. Dette sker via Post-Training Quantization (PTQ), eller »kvantisering efter træning«, hvor man forenkler tallene i modellen. Derefter træner man eleven til at ligne læreren mest muligt ved hjælp af matematiske metoder som KL-divergens-tab og simuleret kvantisering. Det fungerer lidt som en elev, der øver sig i at efterligne en eksperts svar, indtil de små fejl fra komprimeringen forsvinder.

Denne metode virker konsekvent bedre end standard PTQ, især når modellen skal programmere eller fungere som en agent, der løser opgaver. Det gør det muligt at bruge meget kraftig komprimering, som ellers ville have ført til uacceptable fejl. For at gøre det hele lettere har NVIDIA lavet værktøjerne Model Optimizer og Megatron-Bridge. De hjælper med alt fra opskrifter til opsætning af træningen. Det gør det langt nemmere at bruge sprogmodeller, da de kræver mindre hukommelse og færre computerkræfter.

Vil du have, at jeg forklarer mere om, hvordan »elev« og »lærer« modellerne samarbejder?

AiNews' genererede delekort for „Sådan får NVIDIA en sprogmodel til at køre fire gange hurtigere“
Genereret motiv i AiNews' radarsprog · ikke et fotografi fra historien

Nemotron 3.5 Lightning fylder nu 22 GB i stedet for 66 GB og kører med en gennemstrømning, der er op til 4 gange højere. NVIDIA har opnået dette gennem en teknik kaldet Quantization-Aware Distillation (QAD). Metoden gør det muligt at bruge aggressiv kvantisering (W4A16/NVFP4) uden at miste væsentlig nøjagtighed i forhold til BF16-basisen.

QAD-processen består af to faser. Først genereres et student-checkpoint med lav præcision fra en teacher-model med fuld præcision via post-training quantization (PTQ). Derefter trænes student-modellen mod den fastlåste teacher-model ved hjælp af KL-divergens-tab og simuleret kvantisering. Dette genvinder næsten al den nøjagtighed, som ellers går tabt ved kraftig komprimering.

Metoden fungerer konsekvent bedre end standard PTQ i benchmarks for kodning og agenter. QAD gør det muligt at bruge mere aggressive kvantiseringsindstillinger, som ellers ville have ført til uacceptable fejl i modellen.

NVIDIA Model Optimizer og Megatron-Bridge leverer workflowet til at genskabe QAD. Værktøjerne håndterer alt fra valg af opskrift til konfiguration af træning og eksport af checkpoints. Det gør det lettere at idriftsætte sprogmodeller, der bruger mindre hukommelse og færre compute-ressourcer.

Kilder

  1. Developing Nemotron 3.5 Lightning NVFP4 with QAD Using NVIDIA Model Optimizer developer.nvidia.com
Produktionshistorie
  1. Radar Signal ? af 100 · spredning 1 kilder
  2. Vurdering Nyheds 5/5 — Ny modeloptimering og hardware-specifik implementering fra NVIDIA.
  3. Skrevet Model: mimo-v2.5-free · temperatur 0.4
  4. Overskrift 5 kandidater, valgt af chat.dk
  5. Korrektur 1 zen · 1 rettelser
  6. Vedtagelse ainews-auto-v3 · score 0.4332