Spring til indhold
AiNews.dkDanske nyheder om Kunstig Intelligens

Værktøjer

Claude Code slår Codex CLI i test af bluff og ræsonnement

Claude Opus 5 udkonkurrerer gpt-5.6-sol i en test af bluff og ræsonnement, hvor Claude ramte 8 ud af 11 udfordringer.

1 kildeRedigeret af Lars LouvreRettet 19. august 2026 kl. 12.46

Læs i dit tempo

Kort

Claude Code vandt alle serier over Codex CLI i spillet Liar's Dice. Det viser, at Claude er bedre til at ræsonnere om sandsynligheder under strenge regler mod snyd. Resultatet er nu bekræftet via logfiler og tekniske genafspilninger.

Begynder

To AI-systemer, Claude Code og Codex CLI, mødtes i en duel i spillet Liar's Dice. Det er et spil, hvor man skal gætte på sandsynligheder og bluffe. Claude Opus 5, som driver Claude Code, vandt overbevisende alle tre serier med resultatet 2-0 i hver. Claude ramte rigtigt i 8 ud af 11 udfordringer, mens Codex kun ramte 4 ud af 26. Resultatet er bekræftet via logfiler og såkaldte seeds, som er startværdier, der gør det muligt at afspille spillet præcis ens hver gang.

For at sikre fair play brugte man en regelmotor og to Model Context Protocol (MCP)-servere. MCP er en standard for, hvordan AI-modeller kommunikerer med eksterne værktøjer. Systemet sørgede for, at ingen af agenterne kunne se modstanderens terninger. Man fjernede simpelthen informationen fra JSON-projektionen, hvilket er den måde, data bliver præsenteret på i et bestemtt format (JavaScript Object Notation). Det svarer til, at dommeren gemmer terningerne bag en skærm, så man fysisk ikke kan snyde, i stedet for blot at bede spillerne om at lade være.

Selve spillet kræver, at man kan tænke logisk over sandsynligheder. Spillerne skal enten hæve buddet på, hvor mange terninger der har en bestemt værdi, eller udfordre modstanderen. Hvis en udfordring er korrekt, mister modstanderen en terning. Spillet fortsætter, indtil en spiller løber tør for terninger.

Kommunikationen blev styret af en lokal HTTP-koordinator (Hypertext Transfer Protocol), hvilket fungerer som en privat intern forbindelseslinje. Ved start blev digitale adgangstegn, kaldet tokener, bundet til specifikke pladser. Da værktøjsskemaet ikke indeholdt muligheder for at ændre plads, var det umuligt for en agent at udgive sig for at være modstanderen.

Vil du have, at jeg uddyber, hvordan sandsynlighederne i Liar's Dice fungerer, så du bedre kan forstå AI'ernes udfordring?

AiNews' genererede delekort for „Claude Code slår Codex CLI i test af bluff og ræsonnement“
Genereret motiv i AiNews' radarsprog · ikke et fotografi fra historien

Claude Code vandt alle tre best-of-three serier i en duel mod Codex CLI i spillet Liar's Dice. Claude Opus 5 vandt hver serie 2-0. Claude ramte 8 ud af 11 udfordringer, mens Codex kun ramte 4 ud af 26. Resultatet er baseret på data fra session-logs og deterministiske genafspilninger fra seeds.

En regelmotor styrede testen via to MCP-servere (Model Context Protocol). Systemet sikrede, at ingen af agenterne kunne se modstanderens terninger, fordi informationen blev fjernet fra JSON-projektionen i skemaet. Dette forhindrede snyd mere effektivt end en systembesked, da agenterne fysisk ikke havde adgang til dataene.

Spillet kræver ræsonnement om sandsynligheder for at vinde. Spillerne skal enten hæve buddet på antallet af terninger med en bestemt værdi eller udfordre modstanderen. Hvis udfordringen er korrekt, mister modstanderen en terning, og spillet fortsætter, indtil en spiller løber tør for terninger.

En localhost-only HTTP-koordinator styrede kommunikationen. Tokener blev bundet til specifikke pladser ved processtart for at forhindre, at en agent kunne udgive sig for at være modstanderen. Værktøjsskemaet indeholdt ingen parametre for pladser, hvilket gjorde det umuligt at manipulere rollen i spillet.

Kilder

  1. Codex vs. Claude Code at Liar's Dice: the Winning Bluff Was the Truth dev.to
Produktionshistorie
  1. Radar Signal ? af 100 · spredning 1 kilder
  2. Vurdering Nyheds 4/5 — Kapacitetssammenligning mellem to førende kodningsmodeller.
  3. Skrevet Model: mimo-v2.5-free · temperatur 0.4
  4. Overskrift 5 kandidater, valgt af chat.dk
  5. Korrektur 1 zen · 2 rettelser
  6. Vedtagelse Godkendt af Lars Louvre