Verdict forvandler GitHub-issues til beviser for softwarefejl
Verdict forvandler GitHub-issues til tekniske undersøgelser og kræver deterministiske beviser, før en bug erklæres som reproduceret.
Læs i dit tempo
Kort
Verdict er et nyt værktøj, der forvandler fejlrapporter fra GitHub til strukturerede undersøgelser. Det sikrer konkrete beviser fremfor gæt, hvilket gør rettelser af softwarefejl mere pålidelige. Nu bruges tre roller til at finde, indsnævre og teste fejlen, så der kan laves en plan for rettelsen.
Begynder
Verdict forvandler fejlrapporter fra GitHub, som er en platform til kodelagring, til grundige undersøgelser. Det fungerer lidt som et laboratorium. Værktøjet kører bestemte kommandoer under faste betingelser. Det kræver et bevis, der altid giver samme resultat, før man siger, at fejlen er fundet. Dette kaldes en reproduktion. Det sikrer, at man har konkrete beviser, før man begynder at rette fejlen.
En sprogmodel kan gætte på, hvorfor en »stack trace« – en liste over computerens sidste skridt før et nedbrud – ser ud, som den gør. Men Verdict ser fejlfinding som et eksperiment i stedet for en samtale. Systemet fokuserer på hårde data. Det undersøger, hvor ofte fejlen opstår, og hvilke versioner af koden den findes i.
Tre roller styrer arbejdet. »Hunter« leder efter fejlen i forskellige kombinationer af indstillinger og skriver alt ned. »Surgeon« fungerer som en kirurg, der indsnævrer problemet til det mindst mulige område. Til sidst laver »Insurance« en plan, der sikrer, at fejlen ikke kommer tilbage. Denne plan indeholder navnet på testen, opsætningen og det præcise punkt, hvor det går galt.
Et eksempel er TrueForge-fejl nummer 417. Her bekræftede Verdict fejlen i 10 ud af 10 forsøg. Problemet var en snapshot-registrering, som er en funktion til at gemme en tilstand, der ventede uendeligt på svar fra et andet system. Ved at bruge en fast låst køretid kunne Verdict bevise, at fejlen altid skete under de givne betingelser.
Vil du have mig til at uddybe, hvordan en af de tre roller arbejder i praksis?

Verdict forvandler GitHub-issues til afgrænsede undersøgelser af softwarefejl. Værktøjet kører godkendte kommandoer under fastlagte betingelser og kræver deterministiske beviser, før en fejl erklæres som reproduceret. Det fungerer som en ramme for agenter, der skal producere beviser, før der skrives en rettelse.
En sprogmodel kan foreslå en plausibel forklaring på en stack trace, men det er ikke det samme som en reproduktion. Verdict behandler fejlfinding som et eksperiment fremfor en samtale. Systemet fokuserer på konkrete data om, hvor ofte en fejl opstår, og hvilken repository-range beviserne understøtter.
Processen styres af tre specialiserede roller: Hunter, Surgeon og Insurance. Hunter søger i en matrix af betingelser godkendt af maintaineren og logger alle resultater i en bevisførelse. Surgeon indsnævrer fejlen til det mindste mistænkte område baseret på loggen. Insurance laver reproduktionen om til en regressionsplan med testnavn, fixture og fejlet påstand.
10 ud af 10 kørsler bekræftede en fejl i TrueForge issue #417. Her kunne en snapshot-registrering vente uendeligt, når en upstream-anmodning aldrig blev besvaret. Verdict brugte en fastlåst runtime og bekræftede, at fejlen var konstant under de givne betingelser.
Kilder
Produktionshistorie
- Radar Signal ? af 100 · spredning 1 kilder
- Vurdering Nyheds 5/5 — Ny teknisk ramme (harness) til agent-baseret debugging.
- Skrevet Model: mimo-v2.5-free · temperatur 0.4
- Overskrift 5 kandidater, valgt af chat.dk
- Vedtagelse Godkendt af Lars Louvre