Spring til indhold
AiNews.dkDanske nyheder om Kunstig Intelligens

Værktøjer

AI finder de rigtige tags ved først at gætte helt frit

Doug Turnbull foreslår at lade AI'en hallucinere tags uden kendskab til det eksisterende ordforråd og derefter bruge indlejringer til at finde de nærmeste match.

1 kildeVedtaget af NIel AutopilotRettet 15. august 2026 kl. 01.19

Læs i dit tempo

Kort

Doug Turnbull foreslår en metode, hvor en AI gætter tags uden at kende den fulde liste. Dette løser problemet med, at modeller ikke kan modtage for meget tekst på én gang. Vektor-indlejringer (matematiske sammenligninger) kobler derefter gættene sammen med de faktiske tags i databasen.

Vil du have, at jeg uddyber, hvordan vektor-indlejringer fungerer i praksis?

Begynder

Forestil dig at skulle vælge det helt rigtige ord fra en liste med 1.856 forskellige mærkater. For Simon Willison var det et problem, fordi en sprogmodel – et computerprogram, der kan forstå og skrive menneskeligt sprog – ikke kan rumme så meget information på én gang. Det svarer lidt til at prøve at læse en hel telefonbog i ét hurtigt blik for at finde et enkelt navn.

Doug Turnbull foreslår derfor en anden metode. I stedet for at give programmet hele listen først, får modellen lov til at gætte frit på, hvilke mærkater der passer til indholdet. Herefter bruges noget, der hedder vektor-indlejringer. Man kan tænke på det som et digitalt landkort, hvor ord med lignende betydning bor tæt på hinanden. Computeren finder blot det officielle mærkat fra listen, der ligger tættest på modellens gæt på dette kort.

For at gøre gætterne endnu mere præcise kan man give modellen eksempler i sin prompt. En prompt er den instruktion, man skriver til programmet. Turnbull viser, at det hjælper at vise formatet, som for eksempel »Møbler / Stuemøbler / Sofaborde«. På den måde kan man sortere store mængder gammelt indhold uden at overbelaste programmet, da man ikke længere behøver at fodre det med hele listen hver gang.

Vil du have, at jeg forklarer nærmere, hvordan det »digitale landkort« med vektor-indlejringer fungerer i praksis?

AiNews' genererede delekort for „AI finder de rigtige tags ved først at gætte helt frit“
Genereret motiv i AiNews' radarsprog · ikke et fotografi fra historien

1.856 tags er for mange til at sende til en sprogmodel i én omgang. Simon Willison har derfor haft svært ved at få en model til at vælge de rigtige mærkater fra sin blogs store samling af tags.

Doug Turnbull foreslår en løsning, hvor modellen får lov at gætte frit. Man beder modellen om at generere tags til indholdet uden at give den adgang til den eksisterende liste over ord først.

Vektor-indlejringer (vector embeddings) finder derefter de faktiske tags, der ligger tættest på modellens gæt. På den måde bruges AI'ens forestillinger som en bro til det konkrete ordforråd i databasen.

En effektiv prompt til metoden bør indeholde eksempler på tag-strukturen. Turnbull viser i et eksempel med møbelkategorier, at modellen gætter mere præcist, hvis den kender formatet på kategorierne, såsom »Møbler / Stuemøbler / Sofaborde«.

Denne tilgang gør det muligt at sortere store mængder gammelt indhold uden at ramme modellens grænse for, hvor meget tekst den kan modtage i en prompt. Det fjerner behovet for at fodre modellen med hele tag-listen hver gang.

Kilder

  1. Don't classify. Hallucinate! simonwillison.net
Produktionshistorie
  1. Radar Signal ? af 100 · spredning 1 kilder
  2. Vurdering Nyheds 5/5 — Teknisk tilgang til LLM-adfærd fra anerkendt kilde.
  3. Skrevet Model: mimo-v2.5-free · temperatur 0.4
  4. Overskrift 5 kandidater, valgt af chat.dk
  5. Vedtagelse ainews-auto-v3 · score 0.4406