AI-modeller vokser ud af én GPU – TensorRT deler dem op
Ny funktion i TensorRT 11.0 lader ét netværk køre på tværs af GPU'er med NCCL og bevarer TensorRTs optimeringer.
Læs i dit tempo
Kort
TensorRT 11.0 kan nu køre ét netværk på tværs af flere GPU'er med NCCL til datatrafik.
Det er vigtigt, fordi store AI-modeller kan kræve mere hukommelse end én GPU, så flere GPU'er fungerer som én ressource uden at miste optimeringer.
Funktionen er fuldt understøttet i den nyeste version og indgår i NVIDIAs serveringsværktøj Dynamo-Triton til at betjene større modeller.
Begynder
TensorRT er et program fra NVIDIA, der får kunstig intelligens til at køre hurtigt. Tænk på det som en dygtig kok, der har perfektioneret en opskrift. Nu kan TensorRT 11.0 – den nyeste version – bruge flere GPU'er sammen. En GPU er en særlig regneenhed, der er god til AI-opgaver. Før skulle ét netværk – altså én AI-model – køre på én GPU. Nu kan det samme netværk spredes ud over flere GPU'er. Det kaldes multi-device inferens. Det er som flere kokke, der deler ét stort køkken.
Hvorfor er det nødvendigt? Generative AI-modeller – dem der kan skrive tekst, lave billeder og lignende – kræver mere og mere regnekraft og hukommelse. Hukommelse er den plads, hvor modellen gemmer sine data, mens den arbejder. Ofte er det mere, end én GPU kan klare. Med den nye funktion definerer udvikleren ét netværk. TensorRT fordeler det selv over flere GPU'er. Kommunikationen mellem GPU'erne styres af et bibliotek kaldet NCCL. Det sender data frem og tilbage – lidt som budbringere, der løber mellem kokkene med ingredienser.
Det smarte er, at TensorRTs optimeringer bevares. Optimeringer er finjusteringer, der gør inferens hurtigere. Inferens er selve det at få modellen til at svare eller producere noget. Ifølge NVIDIA kan udviklere derfor betjene modeller, der er større end én GPU's hukommelse. De mister ikke hastigheden. Funktionen er fuldt understøttet i TensorRT 11.0. Den indgår i Dynamo-Triton, NVIDIAs værktøj til model serving. Model serving vil sige at gøre AI-modeller tilgængelige for brugere. NVIDIA beskriver funktionen som en forenkling af at dele store modeller ud over flere GPU'er.

TensorRT 11.0 kan køre ét netværk på tværs af flere GPU'er. Den nye multi-device inferens bruger NCCL-baserede distribuerede kollektiver og bevarer TensorRTs inferensoptimeringer.
Funktionen er fuldt understøttet fra TensorRT 11.0 og dermed tilgængelig i den seneste version af frameworket. NVIDIA beskriver den i forbindelse med model serving med Dynamo-Triton, hvor flere GPU'er skal deles om at betjene store modeller.
Baggrunden er, at generative AI-modellers krav til compute og hukommelse i stigende grad overstiger, hvad én GPU kan levere. Funktionen giver TensorRT mulighed for at bruge flere GPU'er som én samlet ressource.
Med multi-device inferens definerer udvikleren ét netværk, og TensorRT fordeler det over flere GPU'er. NCCL står bag de distribuerede kollektiver, der sender data mellem GPU'erne. Ifølge NVIDIA sker det uden at opgive de optimeringer, som TensorRT anvender til inferens. Det betyder, at udviklere kan betjene modeller, der er større end én GPU's hukommelse, uden at miste TensorRTs præstationsgevinster.
NVIDIA beskriver funktionen som en forenkling af model serving på tværs af flere GPU'er. Integrationen er en del af Dynamo-Triton, NVIDIAs løsning til model serving.
Det er uklart: Kilden er kort og indeholder ingen tekniske detaljer om NCCL-implementeringen, ingen præstationstal og ingen nærmere beskrivelse af integrationen med Dynamo-Triton.
Kilder
Produktionshistorie
- Radar Signal ? af 100 · spredning 1 kilder
- Vurdering Nyheds 4/5 — Ny integration til model-serving på tværs af GPU'er, direkte relevant for udviklere.
- Skrevet Model: deepseek-v4-flash · temperatur 0.4
- Overskrift 5 kandidater, valgt af deepseek-v4-flash
- Vedtagelse ainews-auto-v3 · score 0.4425