Spring til indhold
AiNews.dkDanske nyheder om Kunstig Intelligens

Topnyheder

Enigheden blandt AI-dommere kan være fælles fejl

Amazon-forskere vægter dommerstemmer efter uafhængighed og får 9-14 procentpoint bedre nøjagtighed end et vægtet flertal.

3 kilderVedtaget af NIel AutopilotRettet 14. september 2026 kl. 21.07
Læst op af en AI-stemme

Læs i dit tempo

Kort

Amazon-forskere har udviklet en metode, der vægter sprogmodeldommeres stemmer efter uafhængighed, hvilket gav 9-14 procentpoint bedre nøjagtighed.

Det betyder noget, fordi afhængige dommere ikke tæller som uafhængige vurderinger, så et panel på 10 kan opføre sig som færre.

Nu anbefaler forskerne at tjekke dommernes forskellighed og justere tilliden til resultaterne derefter.

Begynder

Forestil dig ti dommere, der skal vurdere, om et svar er relevant. Otte siger ja, to siger nej. Det lyder overbevisende – men kun hvis dommerne har stemt uafhængigt af hinanden. Har de delt træningsdata, samme instruks eller samme modeltype, tæller de ikke som ti selvstændige vurderinger. Det svarer til at spørge den samme person ti gange. Forskere hos Amazon har udviklet en metode, der vægter stemmer fra sprogmodeldommere – kunstige intelligenser, der bedømmer andre kunstige intelligensers output – efter hvor uafhængige de er. I tre opgaver med paneler på ti dommere gav metoden 9 til 14 procentpoint bedre nøjagtighed end et vægtet flertal, hvor nogle stemmer tæller mere end andre.

Metoden hedder afhængighedsbevidst label-aggregering – altså en måde at lægge stemmer sammen på, der tager højde for, at dommerne kan påvirke hinanden. Den bruger Ising-modeller, som oprindeligt kommer fra fysikken og beskriver, hvordan ting påvirker hinanden to og to, lidt som magneter, der trækker i hinanden. Modellerne finder mønstre i, hvilke dommere der systematisk ender med samme vurdering, og vægter samtidig den enkelte dommers pålidelighed. Dermed kan man skelne uafhængig evidens fra fejl, som dommerne deler. Metoden kræver ingen menneskelig facitliste. Den er ikke-superviseret, hvilket betyder, at den kan bruges netop der, hvor man sætter dommerpaneler ind, fordi der ikke findes et svar at måle imod. Forbedringen blev målt på tre opgaver: at klassificere relevans, at opdage giftigt sprog og at vurdere opsummeringer. Det er typiske opgaver i en LLM-som-dommer-pipeline, hvor en eller flere store sprogmodeller (LLM) bedømmer output fra et andet system.

Forskerne Krishna Balasubramanian og Sasha Podkopaev giver også praktiske råd til dem, der bygger den slags systemer. De anbefaler at undersøge paneldiversiteten statistisk, før man stoler på den. Man skal se efter klynger i enigheden – mønstre, hvor bestemte dommere systematisk lander samme sted. Og man skal rapportere sin usikkerhed justeret for sammenhængen mellem dommerne i stedet for at behandle alle stemmer som lige meget værd. Pointen er ikke, at dommerpaneler er ubrugelige. Pointen er, at et stemmetal er et svagt signal, når dommerne kommer fra samme familie og har fået samme instruks. Et panel på ti dommere kan i praksis opføre sig som langt færre.

Redaktionel illustration til „Enigheden blandt AI-dommere kan være fælles fejl“
Genereret illustration · ikke et fotografi fra historien

Amazon-forskere foreslår at vægte stemmer fra sprogmodeldommere efter, hvor uafhængige de er. Metoden giver 9-14 procentpoint bedre nøjagtighed end et vægtet flertal i tre opgaver med paneler på 10 dommere.

Problemet er enigheden selv. Otte af ti dommere siger »relevant«, to siger »ikke relevant«. Otte ud af ti lyder overbevisende, men tallet siger kun noget, hvis stemmerne er afgivet uafhængigt af hinanden. Deler dommerne træningsdata, prompt eller modelfamilie, tæller de ikke som ti selvstændige vurderinger.

Forskerne Krishna Balasubramanian og Sasha Podkopaev beskriver en metode, de kalder afhængighedsbevidst label-aggregering. Den bruger Ising-modeller til at modellere parvise afhængigheder mellem dommerne, samtidig med at den enkelte dommers pålidelighed vægtes. Dermed kan man skelne uafhængig evidens fra fejl, som dommerne deler.

Det sker uden menneskelige referencelabels. Metoden er ikke-superviseret, hvilket betyder, at den kan bruges i de opsætninger, hvor man netop sætter dommerpaneler ind, fordi der ikke findes et facit at måle imod.

De tre opgaver, hvor forbedringen blev målt, er relevansklassificering, toksicitetsdetektion og vurdering af opsummeringer. Alle tre er typiske opgaver i en pipeline med LLM-as-a-judge, hvor en eller flere modeller bedømmer output fra et andet system.

Forskerne giver også praktiske råd til den, der bygger sådanne pipelines. Undersøg paneldiversiteten statistisk, før du stoler på den. Se efter klynger i enigheden — mønstre, hvor bestemte dommere systematisk lander sammen. Og rapportér konfidens justeret for korrelation mellem dommerne i stedet for at behandle alle stemmer som lige meget værd.

Pointen er ikke, at dommerpaneler er ubrugelige. Den er, at et stemmetal er et svagt signal, når dommerne kommer fra samme familie og har fået samme prompt. Et panel af 10 dommere kan i praksis opføre sig som langt færre.

Det er uklart: Materialet er et abstract fra Amazon Science. Metodens detaljer, datasæt og den præcise opgørelse af de 9-14 procentpoint er ikke gengivet i kilden. De to Mastodon-links indeholdt ingen tekst.

Kilder

  1. When LLM judges agree, should we believe them? amazon.science
  2. When LLM judges agree, should we believe them? mastodon.social
  3. When LLM judges agree, should we believe them? mastodon.social
Produktionshistorie
  1. Radar Signal ? af 100 · spredning 2 kilder
  2. Vurdering Nyheds 3/5 — Metodediskussion om pålideligheden af LLM-dommere er relevant for udviklere, men det er uklart om der er ny empiri bag.
  3. Skrevet Model: deepseek-v4-flash · temperatur 0.4
  4. Overskrift 5 kandidater, valgt af deepseek-v4-flash
  5. Korrektur 1 zen · 2 rettelser
  6. Billede Genereret af gemini-2.5-flash-image
  7. Vedtagelse ainews-auto-v3 · score 0.9628