Sådan undgår NVIDIA at bruge de dyreste AI-modeller til simple opgaver
NeMo Switchyard sender opgaver til den rette model baseret på pris og kapacitet for at sænke omkostningerne i produktion.
Læs i dit tempo
Kort
NeMo Switchyard er et værktøj, der automatisk sender AI-opgaver til den mest velegnede model. Det reducerer omkostninger og ventetid, fordi simple opgaver ikke behøver at bruge de dyreste modeller. Udviklere kan nu bruge systemet til at sænke udgifterne i deres AI-løsninger uden at gå på kompromis med kvaliteten.
Begynder
Forestil dig NeMo Switchyard som en smart receptionist for kunstig intelligens (AI). I stedet for at sende alle spørgsmål til den dyreste ekspert, som måske har lang ventetid, vurderer systemet hver opgave i realtid. Det sender arbejdet videre til den model, der passer bedst til opgavens krav til pris og præcision. Det svarer til, at en simpel forespørgsel lander hos en hurtig assistent, mens de sværeste gåder går til professoren. På den måde undgår man, at alt sendes til den største og dyreste model, hvilket sparer både penge og tid.
Det er ofte unødvendigt at bruge en frontmodel – det vil sige den mest avancerede hovedmodel – til rutineprægede opgaver eller simpel sortering af information. NeMo Switchyard gør det muligt at bruge mindre modeller til disse trin. De tunge modeller aktiveres kun, når der er brug for komplekst ræsonnement og dyb logisk tænkning. Det sikrer, at kvaliteten forbliver høj, uden at omkostningerne løber løbsk.
Systemet leveres som et Software Development Kit (SDK), hvilket er en digital værktøjskasse til programmører. Værktøjet er uafhængigt af, hvem der leverer modellerne. Det understøtter både standardalgoritmer og algoritmer, der gennemgår finjustering, hvilket betyder, at de får ekstra træning til specifikke opgaver. Da logikken for at styre trafikken er adskilt fra selve modeludbyderne, kan udviklere skifte deres modeller ud uden at skulle bygge hele deres applikation om.
Test udført sammen med LangChain og Cognition viser, at denne styring sænker omkostningerne betydeligt. Samtidig bevares en høj nøjagtighed, når AI-agenter – som er automatiserede systemer, der kan udføre opgaver – bliver brugt i rigtige produktionsmiljøer.
Vil du have, at jeg forklarer nærmere, hvordan forskellen på en lille og en stor AI-model påvirker hastigheden af et svar?

NeMo Switchyard reducerer omkostninger og øger effektiviteten ved at sende AI-opgaver til den bedst egnede model. Værktøjet balancerer brugen af specialiserede modeller og frontmodeller alt efter opgavens krav til præcision og pris.
Routeren vurderer hver anmodning og dens kontekst i realtid. Den sender derefter arbejdet videre til en model, der passer til opgavens begrænsninger og politikker. Det forhindrer, at alle anmodninger sendes til den største og dyreste model, hvilket ellers øger både pris og ventetid.
Det er ofte unødvendigt at bruge en frontmodel til simple opgaver som klassificering eller rutineprægede opfølgninger. NeMo Switchyard gør det muligt at bruge mindre modeller til disse trin og kun aktivere de tunge modeller til komplekst ræsonnement.
Systemet leveres som et SDK, der er uafhængigt af udbyderen. Det understøtter både algoritmer, der ikke kræver finjustering, og algoritmer, der kan finjusteres. Logikken for routing er adskilt fra selve modeludbyderne, så udviklere kan skifte modeller uden at skulle bygge deres applikationer om.
Test med LangChain og Cognition viser, at routing med NeMo Switchyard sænker omkostningerne betydeligt. Samtidig bevares en høj nøjagtighed i arbejdsgangene for AI-agenter i produktionsmiljøer.
Kilder
- Route AI Agent Workloads Across Models with NVIDIA NeMo Switchyard developer.nvidia.com
Produktionshistorie
- Radar Signal ? af 100 · spredning 1 kilder
- Vurdering Nyheds 5/5 — Nyt værktøj (NeMo Switchyard) til agent-workloads
- Skrevet Model: mimo-v2.5-free · temperatur 0.4
- Overskrift 5 kandidater, valgt af chat.dk
- Korrektur 1 zen · 1 rettelser
- Vedtagelse ainews-auto-v3 · score 0.4296