Tracelint blokerer builds i CI, når AI-agenter ignorerer fejl i deres værktøjer
Tracelint læser agentens spor og afslører ignorerede tool-fejl, sløjfer og schema-overtrædelser — deterministisk, uden API-nøgle
Læs i dit tempo
Kort
Tracelint er et nyt værktøj, der finder strukturelle fejl i AI-agenters adfærd ved at analysere deres digitale spor. Det er vigtigt, da agenter ofte ignorerer fejlmeldinger fra deres værktøjer, hvilket kan føre til forkerte svar. Værktøjet kører automatisk i udviklingssystemer og markerer fejl uden brug af dyre AI-modeller.
Begynder
Nogle gange kan en AI-agent – et program, der kan udføre handlinger – begå en mærkelig fejl. Den kan bruge et værktøj, for eksempel til betaling, og få en fejlbesked tilbage, men alligevel fortælle kunden, at ordren er sendt. Det svarer til, at en ekspedient smiler og siger »tak for købet«, selvom betalingskortet lige er blevet afvist. Det er ikke en fantasifuld løgn, men en teknisk brist i det, man kalder et eksekveringsspor, som er en slags digital logbog over alt, hvad agenten har gjort.
For at finde disse fejl findes værktøjet Tracelint. Det fungerer som en »linter«, hvilket er en automatisk fejlfinder, der gennemgår logbogen. Tracelint finder fejl på en deterministisk måde, hvilket betyder, at det altid giver det samme resultat for den samme fejl. Man bruger ikke andre Store Sprogmodeller (Large Language Models) til at dømme, da det er for dyrt og upræcist. Derfor er Tracelint velegnet til Kontinuerlig Integration (Continuous Integration), som er en automatisk sikkerhedskontrol, før ny software bliver udgivet.
Værktøjet holder øje med fire konkrete fejl. Det tjekker, om agenten følger reglerne for dataformater, som kaldes JSON Schema. Det ser, om agenten ignorerer fejl fra værktøjerne, eller om den sidder fast i en sløjfe og gør det samme igen og igen. Det opdager også, hvis agenten bruger information, som den slet ikke har set i sin logbog. Alt dette tjekkes med faste regler, så der er ingen AI involveret i selve kontrollen.
Tracelint giver besked via såkaldte udgangskoder, der fortæller, om kørslen var ren, om der var en strukturel fejl, eller om der var problemer med input. Det virker med data, man allerede indsamler, og følger standarden OpenInference, som er en fælles sprogregel fra OpenTelemetry til AI. Det gør det kompatibelt med platforme som Arize Phoenix og Langfuse. Der findes en demo, der laver en rapport i HTML-format, uden at man behøver en adgangskode eller at downloade store modeller.
Vil du have, at jeg uddyber en af de fire fejltyper med et konkret eksempel?

Ignorerede tool-fejl er synlige i sporet
En AI-agent kan kalde et tool, få en fejlbesked tilbage og alligevel fortsætte som om intet var hændt. Eksempelvis returnerer et betalingsværktøj fejlkoden 402, men agenten fortæller kunden, at ordren er afsendt. Det er ikke en hallucination i klassisk forstand — det er en strukturel defekt i kørslen, der er synlig i execution-tracket.
Værktøjet hedder Tracelint
Tracelint er en linter til agentkørsler. Den læser det spor agenten efterlader og markerer fejl deterministisk, uden at en anden model dømmer. Ifølge kilden har LLM-judges lav lokaliseringsnøjagtighed på trace-fejl, er ikke-deterministiske og koster penge per trace — og er derfor uegnede til CI-gating.
Fire typer fejl, den opfanger
Værktøjet håndterer konkrete, afgørlige fejl: et tool-kald, der overtræder dets egen JSON Schema, et tool, der returnerer en fejl, men agenten fortsætter, det samme tool kaldt flere gange med identiske argumenter og resultater (en sløjfe), og argumenter, der ikke findes i det agenten observerede.
Alle fire fejltyper kan verificeres med en validator og trace-data — ingen model er involveret.
Kører i CI med exit-koder
Tracelint returnerer exit 0 ved rene kørsler, exit 2 ved en strukturelt bevist defekt og exit 3 ved inputfejl. Heuristiske fund blokerer ikke builds. Værktøjet kører på traces, du allerede indsamler — det er kompatibelt med formater som OpenInference, der er OpenTelemetry's semantiske konvention for AI, og som bruges af platforme som Arize Phoenix og Langfuse.
En demo-kørsel medfølger og genererer en HTML-rapport uden API-nøgle eller model-download.
Det er uklart: Artiklen bygger udelukkende på den ene kildes egen beskrivelse. Der er ingen uafhængige benchmarks, ingen community-feedback og ingen sammenligning med lignende værktøjer i materialet.
Kilder
Produktionshistorie
- Radar Signal ? af 100 · spredning 1 kilder
- Vurdering Nyheds 4/5 — Konkret metode til at opdage fejl i agenters tool calls.
- Skrevet Model: mimo-v2.5-free · temperatur 0.4
- Overskrift 5 kandidater, valgt af chat.dk
- Korrektur 1 zen · 9 rettelser
- Vedtagelse ainews-auto-v3 · score 0.907