Spring til indhold
AiNews.dkDanske nyheder om Kunstig Intelligens

Lokal LLM

Værktøj afslører AI-hallucinationer på under et mikrosekund

Open source-værktøjet Spanda beregner usikkerhed og hallucinationer uden GPU og matcher en neural metode på matematiske opgaver.

2 kilderVedtaget af NIel AutopilotRettet 12. september 2026 kl. 01.19
Læst op af en AI-stemme

Læs i dit tempo

Kort

Spanda er et nyt gratis værktøj, der måler sprogmodellers tvivl på 760 milliarddele af et sekund og er meget hurtigere. Det betyder noget, fordi det kan finde opdigtede svar, såkaldte hallucinationer, i realtid uden dyr specialhardware. Værktøjet er nu delt gratis på kodesiden GitHub og kan hentes gratis til brug.

Begynder

Hvordan ved man, om en maskine gætter? En sprogmodel er et computerprogram, der skriver tekst. Usikkerhed betyder her, hvor meget svarene vakler. Spanda er et nyt værktøj, der måler denne vaklen. Det er åben kildekode, altså kode alle må se og bruge. Det er skrevet i programmeringssproget Rust. Det kan fange hallucinationer, altså opdigtede svar, i realtid, altså mens man venter. Det kræver ingen særlig regnechip til grafik, på engelsk kaldet Graphics Processing Unit (Graphics Processing Unit, GPU). Målingen tager 760 nanosekunder, altså 760 milliarddele af et sekund. Det er omkring 90.000 gange hurtigere end den kendte metode Semantisk Entropi (Semantic Entropy).

Den gamle metode sammenligner flere svar med hinanden. Den bruger en neural klassifikator til tekstimplikation, altså et netværk af kunstige neuroner, der vurderer om to sætninger betyder det samme, på engelsk kaldet Natural Language Inference (Natural Language Inference, NLI). Det kræver et kvadratisk antal sammenligninger, altså at arbejdet vokser meget hurtigt med antallet, ligesom når alle i en klasse skal hilse på alle. Ved ti svar er der 45 neurale vurderinger. Hvert kald koster omkring 90 millisekunder, altså 90 tusindedele af et sekund, på regnechippen. Det gør metoden for langsom til produktion med høj volumen, altså til mange brugere på én gang. Spanda bruger i stedet normaliseret entropi med eksakt match, på engelsk kaldet Exact-Match Normalized Entropy (Exact-Match Normalized Entropy, R_sc). Entropi betyder her spredning i svarene. Metoden er parameterfri, altså uden indstillingsknapper der skal trænes. Den kræver ingen regnechip. Den regner usikkerheden direkte over deterministiske leksikalske klynger, altså faste grupper af ordret ens svar. På matematisk ræsonnement i testsættet til grundskolematematik (Grade School Math 8K, GSM8K) matcher eller overgår den den neurale Semantiske Entropi, når modellen er stor nok.

Målingerne vækker nysgerrighed: Jo større model, jo bedre virker metoden? Modelstørrelse måles i parametre, altså de små tal modellen husker sprog med. Et mål for træfsikkerhed, på engelsk kaldet Area Under Receiver Operating Characteristic (Area Under Receiver Operating Characteristic, AUROC), stiger fra 0,577 ved 1,5 milliarder parametre til 0,706 ved 7 milliarder og 0,889 ved 27 milliarder. Sandsynligheden for at det er tilfældigt, kaldet p-værdi, er 1,89 gange 10 i minus 28. Fra 7 milliarder og opefter opnår Spanda samme diskriminationsstyrke, altså evne til at skille rigtigt fra forkert, som tunge krydsenkodere, altså store sammenligningsredskaber der læser to tekster sammen, af typen Decoding-enhanced Bert with disentangled Attention version 3 (Decoding-enhanced Bert with disentangled Attention version 3, DeBERTa-v3) til tekstimplikation, skriver udviklerne. Udviklerne advarer dog om et fænomen ved 120 milliarder parametre på faktuelle spørgsmål i quiztestsættet (Trivia Question Answering, TriviaQA). Her kan modellen hallucinere det samme forkerte svar med høj selvtillid. De kalder det Selvsikkert Sammenbrud i Gentagelse (Confident Mode Collapse). Det betyder, at metoden ikke fanger hallucinationer, når modellen er sikker på et gentaget forkert svar.

Hvad med selve teknikken? Sammenlignet med udgaver i programmeringssproget Python er Rust-versionen markant lettere, ligesom en rygsæk mod en flyttekasse. Kernetiden, altså selve regnetiden, er 760 nanosekunder mod 15 millisekunder. Hukommelsesforbruget er cirka 3 megabyte, altså enheder for lagerplads, mod 230 megabyte. Kold start, altså tiden fra programmet åbnes første gang, tager 3,6 millisekunder mod 1,17 sekunder. Spanda er udgivet på GitHub, altså et åbent sted på nettet hvor kode deles. Der findes en Python-pakke, altså en klar pakke til Python, der kan hentes med kommandoen pip install spnda.

Redaktionel illustration til „Værktøj afslører AI-hallucinationer på under et mikrosekund“
Genereret illustration · ikke et fotografi fra historien

Spanda måler en sprogmodels usikkerhed på 760 nanosekunder – omkring 90.000 gange hurtigere end den etablerede metode Semantic Entropy. Det nye open source-værktøj er skrevet i Rust og kan bruges til at opdage hallucinationer i realtid uden GPU.

Den traditionelle metode, Semantic Entropy, sammenligner flere genererede svar med en neural klassifikator til tekstimplikation (NLI). Det kræver et kvadratisk antal sammenligninger: ved ti svar er der 45 neurale evalueringer, og hvert kald koster omkring 90 millisekunders GPU-tid. Det gør metoden for langsom til produktion med høj volumen.

Spanda bruger i stedet normaliseret eksakt-match-entropi (Exact-Match Normalized Entropy, R_sc). Metoden er parameterfri, kræver ingen GPU og beregner usikkerheden direkte over deterministiske leksikalske klynger. På matematisk ræsonnement (GSM8K) matcher eller overgår den neurale Semantic Entropy, når modellen er stor nok.

Målingerne viser en klar tendens: Jo større model, jo bedre virker metoden. AUROC stiger fra 0,577 ved 1,5B parametre til 0,706 ved 7B og 0,889 ved 27B (p = 1,89 × 10^-28). Fra 7B og opefter opnår Spanda samme diskriminationsstyrke som tunge DeBERTa-v3 NLI-krydsenkodere, skriver udviklerne.

Udviklerne advarer dog om et fænomen ved 120B-parametre på faktuelle spørgsmål (TriviaQA). Her kan modellen hallucinere det samme forkerte svar med høj selvtillid – noget de kalder Confident Mode Collapse. Det betyder, at metoden ikke fanger hallucinationer, når modellen er sikker på et gentaget forkert svar.

Sammenlignet med Python-udgaver er Rust-versionen markant lettere: kernel-latens er 760 nanosekunder mod 15 millisekunder, hukommelsesforbruget er cirka 3 MB mod 230 MB, og kold start tager 3,6 millisekunder mod 1,17 sekunder. Spanda er udgivet på GitHub, og der findes en Python-pakke med pip install spnda.

Det er uklart: Benchmarkene er udviklernes egne målinger.

Kilder

  1. Spanda – Sub-microsecond LLM epistemic uncertainty in Rust github.com
  2. Spanda: Sub-microsecond LLM epistemic uncertainty in Rust news.ycombinator.com
Produktionshistorie
  1. Radar Signal ? af 100 · spredning 2 kilder
  2. Vurdering Nyheds 4/5 — Nyt Rust-værktøj til usikkerhed i LLM'er, relevant for udviklere.
  3. Skrevet Model: deepseek-v4-flash · temperatur 0.4
  4. Overskrift 5 kandidater, valgt af deepseek-v4-flash
  5. Korrektur 1 zen · 1 rettelser
  6. Billede Genereret af gemini-2.5-flash-image
  7. Vedtagelse ainews-auto-v3 · score 1.1925