Spring til indhold
AiNews.dkDanske nyheder om Kunstig Intelligens

Værktøjer

AI gætter på tallene og lyder overbevisende

Ti modeller fik 68 tællespørgsmål: Med tal fra værktøjet rammer alle plet, men uden skal der tusinder af tokens til at tælle 330 rækker.

2 kilderVedtaget af NIel AutopilotRettet 30. september 2026 kl. 10.44

Læs i dit tempo

Kort

En ny Kaggle-test stillede ti AI-modeller de samme 68 tællespørgsmål med tal-værktøj eller liste-værktøj.

Den viser at korte svar ofte giver forkerte optællinger, mens grundige optællinger rammer rigtigt, uafhængigt af pris.

Nu holder testen alt andet fast for at se hvem der selv kan tælle store lister.

Begynder

Forestil dig, at du skal tælle bønner i et stort glas. Du kan enten få en seddel med det præcise antal. Eller du kan få hældt bønnerne ud på bordet og selv tælle. Hvad mon er lettest at fejle på? En ny prøve fra Kaggle, altså en hjemmeside hvor man afprøver computerprogrammer, undersøger netop det. Den stiller ti sprogmodeller, altså computerhjælpere der svarer på spørgsmål, de samme 68 tællespørgsmål om 330 identifikationsnumre, forkortet id'er, altså numre der står for hver ting der skal tælles.

Prøven bruger et hjælpeværktøj i to udgaver. Den ene udgave hedder Count_ids. Den giver det præcise tal samt det mindste og det største nummer tilbage. Den anden udgave hedder List_ids. Den giver kun selve listen af matchende numre tilbage. Så skal modellen selv tælle. I de første to opgaver står id'erne ikke i startbeskeden, som på fagsprog kaldes en prompt. Forskellen er altså kun, om værktøjet giver et tal eller en liste.

Med tallet fra værktøjet svarede alle på nær én model rigtigt på alle spørgsmål. Med listen knækkede feltet i to. De grundige skrev lange svar. De brugte fra 2.700 til 8.200 output-tokens pr. spørgsmål, altså små tekstbidder som svaret er bygget af. De talte 15 til 21 af 21 lister korrekt. De sparsomme skrev under 600 bidder. De talte kun 0 til 10 rigtigt. Alligevel lød de sikre. Forskellen var ikke pris eller størrelse. Claude Opus 5 var dyrest i feltet. Den brugte 579 bidder og talte 9 af 21 lister korrekt. Gemma 4 er en åben model med 26 milliarder, altså 26B, parametre. Den brugte 8.153 bidder og talte 20 rigtigt.

Hvorfor fanger de små test ikke fejlen? Et spørgsmål om, hvor mange der er 10 eller mere, har svaret 8. Det får alle modeller rigtigt. Men 11 id'er siger intet om 300. Og 11 svarer til størrelsen i de hurtige test, som alle består. Prøven holder alt fast undtagen hvem der regner. Hvert søgekrav, altså det filter der vælger id'er, tjekkes på de id'er det vælger. Så id større end 9 tæller som rigtigt for 10 eller mere. Og hvert forkert svar føres tilbage til enten en forkert søgning eller en forkert optælling.

AiNews' genererede delekort for „AI gætter på tallene og lyder overbevisende“
Genereret motiv i AiNews' radarsprog · ikke et fotografi fra historien

Modeller, der brugte 2.700 til 8.200 output tokens pr. spørgsmål, talte 15 til 21 af 21 lister korrekt. Modeller, der svarede med under 600 tokens, talte kun 0 til 10 rigtigt.

En ny benchmark fra Kaggle stiller ti modeller de samme 68 tællespørgsmål. Værktøjet findes i to udgaver. Count_ids giver det præcise tal, minimum og maksimum tilbage. List_ids giver de matchende id'er tilbage, og så skal modellen selv tælle.

Med tallet fra værktøjet svarede alle på nær én model rigtigt på alle spørgsmål om 330 id'er. Med listen knækkede feltet i to. De grundige brugte mange tokens og talte rigtigt. De sparsomme svarede kort og gættede forkert, men lød sikre.

Forskellen var ikke pris eller størrelse. Claude Opus 5 var dyrest i feltet, svarede med 579 tokens og talte 9 af 21 lister korrekt. Gemma 4 26B er en åben 26B-model, brugte 8.153 tokens og talte 20 rigtigt.

Fejlen gemmer sig i de små test. Spørgsmålet om, hvor mange der er 10 eller mere, har svaret 8, og det får alle modeller rigtigt. Men 11 id'er siger intet om 300. 11 svarer til størrelsen i de hurtige test, alle består.

Benchmarken holder alt fast undtagen hvem der regner. I de første to opgaver står id'erne ikke i prompten. Forskellen er kun, om værktøjet giver et tal eller en liste. Hvert filter tjekkes på de id'er, det vælger, så id > 9 tæller som rigtigt for 10 eller mere. Hvert forkert svar føres tilbage til enten en forkert søgning eller en forkert optælling.

Det er uklart: Kilden knækker midt i beskrivelsen af de 68 spørgsmål, og opgaverne med id'er i prompten og run_python er ikke dækket i detaljer.

Kilder

  1. Count It or Compute It: When a Tool Returns Rows, the Models That Count Them Right Spend the Tokens dev.to
  2. Count It or Compute It: When a Tool Returns Rows, the Models That Count Them Right Spend the Tokens dev.to
Produktionshistorie
  1. Radar Signal ? af 100 · spredning 1 kilder
  2. Vurdering Nyheds 3/5 — praktisk test af værktøjskald og optælling relevant for agentbyggere
  3. Skrevet Model: deepseek-v4-flash · temperatur 0.4
  4. Overskrift 5 kandidater, valgt af chat.dk
  5. Korrektur 1 zen · 6 rettelser
  6. Vedtagelse ainews-auto-v3 · score 0.7642