Spring til indhold
AiNews.dkDanske nyheder om Kunstig Intelligens

Værktøjer

Udviklere dropper stikprøver og tjekker al AI-trafik

Open source-biblioteket sender alle evalueringer for en agent-kørsel som én anmodning, der koster brøkdele af en cent og svarer på under et sekund.

2 kilderVedtaget af NIel AutopilotRettet 21. september 2026 kl. 21.51

Læs i dit tempo

Kort

Jevals er et nyt frit værktøj, der sender otte kvalitetstjek i én forespørgsel med Jev-modeller i stedet for en dyr dommer-model.

Det gør kvalitetskontrol ekstremt billig og hurtig, så man kan tjekke hver handling i arbejdsprocessen i stedet for kun en stikprøve.

Værktøjet virker med flere modeller og fjerner den dyreste del af kontrolkæden, så hold kan kontrollere langt mere.

Begynder

Jevals er et nyt open source-bibliotek — et værktøj, hvor koden er offentlig og gratis at bruge. I stedet for at lade en dyr AI-dommer bedømme kvaliteten, bruger Jevals Jev-beslutningsmodeller, altså modeller der træffer vurderinger. Et API-kald er en besked fra ét program til et andet over internettet, lidt som at bestille hos en tjener. Jevals sender otte evalueringer i ét enkelt API-kald. Hele loggen over én AI-samtale, kaldet en trace, sendes som én enkelt HTTP-anmodning — én besked til serveren. De otte evalueringer i eksemplet koster 0,00006 dollar og tager 0,33 sekunder. Det er et par tusindedele af en cent per kørsel. Derfor kan man køre evalueringer på hver eneste trace og endda inde i selve agent-løkken, det kredsløb hvor en AI-agent beslutter, handler, observerer og beslutter igen.

Biblioteket tjekker, om AI’en vælger det rigtige værktøj, og om den bruger værktøjsresultaterne korrekt. Det tjekker også forankring i faktiske data, altså om svaret bygger på virkelige data og ikke noget, AI’en har fundet på. Derudover vurderer det overholdelse af scope, svarkvalitet og fuldstændighed. Endelig er der tjek for indirekte injection-angreb, hvor skjulte instruktioner gemmer sig i data, AI’en læser, og for beskyttede sundhedsoplysninger, også kaldet PHI.

Jevals kan køre med flere forskellige modeller. Det virker med Jev gennem TypeSafe eller Vercel AI Gateway, med Kev eller Laya lokalt på en Mac, eller med en almindelig chat-LLM, altså en almindelig AI-chatmodel baseret på en stor sprogmodel. De lokale modeller er hurtigere og billigere, mens en chat-LLM er langsommere og dyrere.

Prisen er grunden til, at de fleste teams kun evaluerer en lille stikprøve af deres trafik. En frontmodel-dommer — en af de mest avancerede AI-modeller, der findes — er den dyreste del af hele evalueringskæden. I Ragas, som de fleste metriknavne stammer fra, koster faithfulness, hvor trofast svaret er mod kildematerialet, to kald til en stor sprogmodel. Answer relevancy, hvor relevant svaret er for spørgsmålet, kræver tre kald plus indlejringer, også kaldet embeddings, der omdanner tekst til tal, så AI’en kan sammenligne betydninger. Kontekstpræcision, hvor præcist AI’en bruger den rigtige kontekst, koster et kald per hentet chunk, altså per stykke tekst skåret ud af et større dokument. Hvert kald medbringer few-shot-eksempler, der viser AI’en, hvordan den skal svare, og genererer JSON, et struktureret dataformat, bid for bid. Jevals samler alle tjek i én anmodning og fjerner dermed den dyreste del af evalueringskæden.

AiNews' genererede delekort for „Udviklere dropper stikprøver og tjekker al AI-trafik“
Genereret motiv i AiNews' radarsprog · ikke et fotografi fra historien

Jevals sender otte evalueringer i ét API-kald. Det er et nyt open source-bibliotek, der bruger Jev-beslutningsmodeller i stedet for en dyr LLM-dommer. Alle tjek for en enkelt trace sendes som én HTTP-anmodning.

De otte evalueringer i eksemplet koster 0,00006 dollar og tager 0,33 sekunder. Det svarer til et par tusindedele af en cent per kørsel, så man kan køre evalueringer på hver eneste trace og inde i selve agent-løkken.

Biblioteket indeholder tjek for værktøjsvalg, brug af værktøjsresultater, forankring i faktiske data, overholdelse af scope, svarkvalitet, fuldstændighed, indirekte injection-angreb og beskyttede sundhedsoplysninger (PHI).

Jevals kan køre med flere forskellige modeller. Det virker med Jev gennem TypeSafe eller Vercel AI Gateway, med Kev eller Laya lokalt på en Mac, eller med en almindelig chat-LLM. De lokale modeller er hurtigere og billigere, mens en chat-LLM er langsommere og dyrere.

Prisen er grunden til, at de fleste teams kun evaluerer en lille stikprøve af deres trafik. En frontmodel-dommer er den dyreste del af pipelinen. I Ragas, som de fleste metriknavne stammer fra, koster faithfulness to LLM-kald. Answer relevancy kræver tre kald plus indlejringer (embeddings). Kontekstpræcision koster et kald per hentet chunk. Hvert kald medbringer few-shot-eksempler og genererer JSON token for token.

Jevals samler alle tjek i én anmodning og fjerner dermed den dyreste del af evalueringspipelinen.

Kilder

  1. jevals – replacing LLM judges with typed Jev decisions github.com
  2. jevals – replacing LLM judges with typed Jev decisions github.com
Produktionshistorie
  1. Radar Signal ? af 100 · spredning 1 kilder
  2. Vurdering Nyheds 3/5 — Nyt eval-værktøj som alternativ til LLM-judges.
  3. Skrevet Model: deepseek-v4-flash · temperatur 0.4
  4. Overskrift 5 kandidater, valgt af deepseek-v4-flash
  5. Vedtagelse ainews-auto-v3 · score 0.5925