Spring til indhold
AiNews.dkDanske nyheder om Kunstig Intelligens

Topnyheder

Nyt værktøj afslører, om dine AI-svar er hurtige nok

NVIDIAs nye værktøj AIPerf måler, hvor hurtigt sprogmodeller svarer i stor skala.

1 kildeVedtaget af NIel AutopilotRettet 18. september 2026 kl. 23.01

Læs i dit tempo

Kort

NVIDIA har udgivet AIPerf, et værktøj til at måle hastigheden af store sprogmodeller under mange samtidige forespørgsler. Det betyder noget, fordi tidligere testmetoder ikke viste den rigtige belastning, og derfor var det svært at vide, om systemet er hurtigt nok. Nu kan udviklere bruge AIPerf til at få pålidelige tal og planlægge kapacitet bedre.

Begynder

NVIDIA har lavet et nyt måleværktøj, der hedder AIPerf. Det skal måle, hvor hurtigt store sprogmodeller svarer, når mange mennesker bruger dem på samme tid. En stor sprogmodel er en kunstig intelligens, der kan forstå og skrive tekst. Når modellen svarer på et spørgsmål, kaldes det inferens. At benchmarke betyder at måle ydelsen med et standardiseret værktøj — lidt som at tage tid på en løber med et stopur.

Problemet, som værktøjet løser, kender alle, der har sat en model i drift. Når systemet kører for rigtige brugere, er det svært at vide, om det svarer hurtigt nok. De gamle måder at teste på giver ikke et retvisende billede. Man kan for eksempel sende en enkelt forespørgsel med kommandoværktøjet curl, skrive et lille program i Python med asyncio, som er en teknik til at køre flere opgaver på én gang, eller selv kode en midlertidig belastningsgenerator, der sender mange forespørgsler. Fælles for dem alle er, at de er begrænset af, hvad ét enkelt program kan klare. Python har desuden en indbygget begrænsning, der hedder Global Interpreter Lock, som gør, at programmet kun kan udføre én handling ad gangen. Det svarer til at teste en restaurant ved at bestille én ret ad gangen i stedet for at se, hvordan køkkenet klarer en hel fyraften.

AIPerf er bygget til at måle i stor skala. Det vil sige, at det kan sende mange forespørgsler på samme tid, præcis som når en rigtig tjeneste bliver brugt af mange mennesker. For udviklere og teams, der driver sprogmodeller for andre, giver det mere pålidelige tal at planlægge, hvor meget trafik systemet kan klare. NVIDIA beskriver værktøjet i et blogindlæg, hvor de også forklarer, hvorfor de gamle metoder ikke slår til. AIPerf er et forsøg på at lave en fælles standard for at måle inferens i stor skala.

AiNews' genererede delekort for „Nyt værktøj afslører, om dine AI-svar er hurtige nok“
Genereret motiv i AiNews' radarsprog · ikke et fotografi fra historien

NVIDIA har udgivet AIPerf, et benchmarkværktøj til at måle inferens for store sprogmodeller i stor skala. Værktøjet adresserer et problem, som alle der sætter en model i produktion kender: Når systemet kører, og prompts får svar, er det svært at vide, om det er hurtigt nok.

De typiske måder at teste på giver ikke et retvisende billede. At sende curl-kommandoer, skrive et asyncio-script eller selv kode endnu en midlertidig belastningsgenerator har alle samme grundlæggende problem: De er begrænset af ydelsen fra en enkelt proces, og Python GIL sætter en grænse for samtidighed. Målingerne afspejler derfor ikke en rigtig produktionsbelastning, hvor mange forespørgsler kommer samtidig.

AIPerf er designet til at benchmarke inferens i stor skala. Det betyder, at det kan måle, hvordan en model opfører sig under belastning, i stedet for kun at teste en enkelt forespørgsel ad gangen. For udviklere og teams, der driver sprogmodeller i produktion, giver det mere pålidelige tal at planlægge kapacitet ud fra.

NVIDIA beskriver værktøjet i et blogindlæg, hvor de også gennemgår, hvorfor eksisterende metoder ikke slår til. AIPerf er et bud på at standardisere måling af inferens i stor skala.

Det er uklart: Kilden er et uddrag af NVIDIAs blogindlæg; detaljer om AIPerfs funktion og tilgængelighed er ikke dækket.

Kilder

  1. Benchmarking LLM Inference at Scale with AIPerf developer.nvidia.com
Produktionshistorie
  1. Radar Signal ? af 100 · spredning 1 kilder
  2. Vurdering Nyheds 4/5 — Ny benchmark til at måle inference-ydelse, relevant for udviklere.
  3. Skrevet Model: deepseek-v4-flash · temperatur 0.4
  4. Overskrift 5 kandidater, valgt af deepseek-v4-flash
  5. Vedtagelse ainews-auto-v3 · score 0.4375