Spring til indhold
AiNews.dkDanske nyheder om Kunstig Intelligens

Lokal LLM

Sådan finder NVIDIA de små fejl, der bremser hele AI-træningen

Strategien samler telemetri fra compute, netværk, storage, orchestration og applikationer for at finde årsager til ydelsesfald og undgå grå fejl i InfiniBand-klynger.

1 kildeVedtaget af NIel AutopilotRettet 13. august 2026 kl. 09.41
AiNews' genererede delekort for „Sådan finder NVIDIA de små fejl, der bremser hele AI-træningen“
Genereret motiv i AiNews' radarsprog · ikke et fotografi fra historien

NVIDIA har udviklet et rammesæt til overvågning (observability), der integrerer telemetri på fem lag: compute, netværk, storage, orchestration og applikationslag. Systemet gør det muligt at lave præcise rodårsagsanalyser og mindske kaskadefejl.

Grå fejl i InfiniBand-klynger kan bremse store træningsjobs markant. Ved en grå fejl er hardwaren nedbrudt, men systemet melder ikke, at den er nede. Da AI-træning følger en model for synkron parallel behandling (bulk synchronous parallel), vil én langsom komponent holde hele jobbet tilbage under operationer som NCCL all-reduce.

Et eksempel viser et træningsjob, der har kørt i tre dage, hvor gennemløbet pludselig falder i seks timer. Årsagen var et enkelt InfiniBand-link med en forhøjet fejlrate på bits, som ikke udløste en fejlmelding.

Otte specialiserede værktøjer, heriblandt DCGM, NVSM og UFM, kobler telemetri til infrastrukturen. Overvågningen sker via samlede dashboards i Prometheus og Grafana. Fokus er på at have mindst ét dedikeret værktøj per domæne og koble alle kritiske alarmer til en ansvarlig person via SLO- og SLI-metrikker.

Målet er at identificere fejlbehæftede komponenter og finde løsninger, før store mængder compute-ressourcer går tabt. Det kræver, at alle alarmer er konkrete og kan handles på med det samme.

Kilder

  1. How to Choose Full-Stack Observability for NVIDIA AI Factories developer.nvidia.com
Produktionshistorie
  1. Radar Signal ? af 100 · spredning 1 kilder
  2. Vurdering Nyheds 3/5 — Teknisk vejledning til observability på NVIDIA AI hardware.
  3. Skrevet Model: mimo-v2.5-free · temperatur 0.4
  4. Overskrift 5 kandidater, valgt af chat.dk
  5. Korrektur 2 chatdk · 1 rettelser
  6. Vedtagelse ainews-auto-v3 · score 0.3603