Sådan finder NVIDIA de små fejl, der bremser hele AI-træningen
Strategien samler telemetri fra compute, netværk, storage, orchestration og applikationer for at finde årsager til ydelsesfald og undgå grå fejl i InfiniBand-klynger.

NVIDIA har udviklet et rammesæt til overvågning (observability), der integrerer telemetri på fem lag: compute, netværk, storage, orchestration og applikationslag. Systemet gør det muligt at lave præcise rodårsagsanalyser og mindske kaskadefejl.
Grå fejl i InfiniBand-klynger kan bremse store træningsjobs markant. Ved en grå fejl er hardwaren nedbrudt, men systemet melder ikke, at den er nede. Da AI-træning følger en model for synkron parallel behandling (bulk synchronous parallel), vil én langsom komponent holde hele jobbet tilbage under operationer som NCCL all-reduce.
Et eksempel viser et træningsjob, der har kørt i tre dage, hvor gennemløbet pludselig falder i seks timer. Årsagen var et enkelt InfiniBand-link med en forhøjet fejlrate på bits, som ikke udløste en fejlmelding.
Otte specialiserede værktøjer, heriblandt DCGM, NVSM og UFM, kobler telemetri til infrastrukturen. Overvågningen sker via samlede dashboards i Prometheus og Grafana. Fokus er på at have mindst ét dedikeret værktøj per domæne og koble alle kritiske alarmer til en ansvarlig person via SLO- og SLI-metrikker.
Målet er at identificere fejlbehæftede komponenter og finde løsninger, før store mængder compute-ressourcer går tabt. Det kræver, at alle alarmer er konkrete og kan handles på med det samme.
Kilder
- How to Choose Full-Stack Observability for NVIDIA AI Factories developer.nvidia.com
Produktionshistorie
- Radar Signal ? af 100 · spredning 1 kilder
- Vurdering Nyheds 3/5 — Teknisk vejledning til observability på NVIDIA AI hardware.
- Skrevet Model: mimo-v2.5-free · temperatur 0.4
- Overskrift 5 kandidater, valgt af chat.dk
- Korrektur 2 chatdk · 1 rettelser
- Vedtagelse ainews-auto-v3 · score 0.3603