Spring til indhold
AiNews.dkDanske nyheder om Kunstig Intelligens

Topnyheder

Sprogmodeller tåler ikke at stå alene

En blogpost argumenterer for, at LLM'er er upålidelige som klassifikatorer. I stedet bør deres output indgå som feature i en simpel logistisk regression.

2 kilderVedtaget af NIel AutopilotRettet 18. september 2026 kl. 07.09
Læst op af en AI-stemme

Læs i dit tempo

Kort

En ny blogpost argumenterer for, at sprogmodeller er dårlige til at kategorisere tekst og i stedet bør indgå som et input i en traditionel maskinlæringsmodel.

Det betyder noget, fordi sikkerhedsestimaterne er upålidelige, og vigtig information kan overses, så fejltyperne bliver svære at styre.

Artiklen foreslår at bruge sprogmodellens output i en simpel statistisk model, som tilpasses de faktiske data.

Begynder

En ny blogpost på siden Minimally Sufficient argumenterer for, at sprogmodeller er dårligt egnede som klassifikatorer. En sprogmodel er et computerprogram, der er trænet i at forstå og skrive tekst. En klassifikator er et program, der skal placere noget i en kategori – for eksempel afgøre, om en e-mail er spam eller ej. Når man bruger en sprogmodel som klassifikator, giver man den en beskrivelse af opgaven og lader den svare med en kategori. Det giver flere grundlæggende problemer.

For det første svarer modellen ofte med en bestemt kategori uden et velkalibreret mål for, hvor sikker den er. Et mål er velkalibreret, hvis tallene faktisk holder stik: Hvis modellen siger »70 procent sandsynligt«, skal det også være rigtigt i 70 procent af tilfældene – ligesom en vejrudsigt, der lover 70 procent regn, skal have regn i 70 procent af tilfældene. Man kan godt bede modellen om at angive sin sikkerhed, men der er ingen grund til at tro, at tallet er pålideligt. Det gør det svært at afveje præcision mod recall på en principiel måde. Præcision handler om, hvor mange af de ting, modellen udpeger, der faktisk er korrekte. Recall handler om, hvor mange af de korrekte ting, modellen faktisk finder. Uden et pålideligt sikkerhedstal kan man ikke finde den rette balance mellem de to.

Sprogmodeller er gode til ustruktureret tekst, altså fritekst uden et fast format. Men mange opgaver indeholder også struktureret data – tal og kategorier i faste felter, som man kender det fra et skema. Selv hvis man lægger de data ind i beskrivelsen til modellen, er der ingen garanti for, at den bruger dem. Det samme gælder for teksten i beskrivelsen: Man ved ikke, hvilke dele modellen faktisk har lagt vægt på. Modellen har også en indbygget forventning til data, som kan passe dårligt til ens egen situation. Den ved for eksempel ikke, om man tester på en gruppe, hvor den positive klasse – altså den kategori, man leder efter – er sjælden eller hyppig. Man kan fortælle den det, men det er ikke sikkert, at den indarbejder informationen korrekt i sin vurdering.

Forfatteren understreger, at fejlene ikke er sprogmodellens skyld: Den er ikke designet til at være en klassifikator. Løsningen er i stedet at behandle sprogmodellens svar som én blandt flere input til en traditionel maskinlæringsmodel. En maskinlæringsmodel er et program, der lærer af eksempler. Konkret foreslår artiklen at pakke sprogmodellens vurdering ind i en simpel logistisk regression. En logistisk regression er en matematisk metode, der vejer forskellige input sammen og giver et ja-eller-nej-svar med en tilhørende sandsynlighed. I stedet for at lade sprogmodellen bestemme svaret alene, lader man den bidrage med sin vurdering, og så lærer regressionen, hvor meget den vurdering skal vægte. I et særligt tilfælde, hvor vægten bliver uendelig stor, svarer modellen til at bruge sprogmodellen som klassifikator – men det er en dårlig strategi. Den sædvanlige tilgang er i stedet at tilpasse vægtene til de faktiske data, så man får et mere pålideligt resultat.

AiNews' genererede delekort for „Sprogmodeller tåler ikke at stå alene“
Genereret motiv i AiNews' radarsprog · ikke et fotografi fra historien

En ny blogpost på Minimally Sufficient argumenterer for, at sprogmodeller er dårligt egnede som klassifikatorer. I stedet bør deres output indgå som feature i en traditionel maskinlæringsmodel.

En LLM, der får en prompt og returnerer en label, har flere grundlæggende problemer. Svarene er ofte hårde labels uden velkalibreret sandsynlighed. Man kan bede modellen om at angive, hvor sikker den er, men der er ingen grund til at tro, at det tal er velkalibreret. Det gør det svært at afveje præcision mod recall på en principiel måde.

LLM'er er gode til ustruktureret tekst, men mange opgaver har også struktureret data. Selv hvis man lægger dataene ind i prompten, er der ingen garanti for, at modellen bruger dem. Det samme gælder for prosa i prompten: man ved ikke, hvilke dele modellen faktisk har lagt vægt på.

LLM'er har også en indbygget forventning til data, som kan passe dårligt til ens egen population. Modellen ved for eksempel ikke, om man tester på en population, hvor den positive klasse er sjælden eller hyppig. Man kan fortælle den det, men det er ikke sikkert, at den indarbejder informationen korrekt i sin vurdering.

Forfatteren understreger, at fejlene ikke er LLM'ens skyld: den er ikke designet som klassifikator. Løsningen er at behandle LLM'ens output som en feature. Konkret foreslår artiklen at pakke LLM'ens vurdering ind i en simpel logistisk regression: p(y=1|x) = σ(α + β · LLM(x)). I specialtilfældet, hvor β går mod uendeligt, svarer modellen til at bruge LLM'en som klassifikator — men det er en dårlig parameterstrategi. Den sædvanlige tilgang er i stedet at tilpasse parametrene til data.

Det er uklart: Kilden er afkortet midt i artiklen, så forfatterens konkrete næste skridt ud over den logistiske regression er ikke dækket.

Kilder

  1. LLM Classification Is Feature Engineering minimallysufficient.com
  2. LLM Classification Is Feature Engineering https:// minimallysufficient.com/posts/… mastodon.social
Produktionshistorie
  1. Radar Signal ? af 100 · spredning 2 kilder
  2. Vurdering Nyheds 3/5 — Praktisk indsigt om LLM-klassificering
  3. Skrevet Model: deepseek-v4-flash · temperatur 0.4
  4. Overskrift 5 kandidater, valgt af deepseek-v4-flash
  5. Vedtagelse ainews-auto-v3 · score 0.7618