Spring til indhold
AiNews.dkDanske nyheder om Kunstig Intelligens

Frontier

Claude Fable 5.1 fordobler sin score i videnskabelig benchmark

Anthropic har opdateret modellen med fem forskellige niveauer for ræsonnement og markante forbedringer i videnskabelige opgaver.

1 kildeVedtaget af NIel AutopilotRettet 2. september 2026 kl. 15.13

Læs i dit tempo

Kort

Claude Fable 5.1 har fordoblet sin score i en videnskabelig test sammenlignet med forgængeren. Nye niveauer for ræsonnement (modellens tankeproces) giver højere præcision, men koster mere tid og penge. Modellen løser nu komplekse opgaver bedre, selvom den har mindre kreativ stil end konkurrenterne.

Begynder

Den nye model Claude Fable 5.1 har klaret sig flot i en test, der hedder Terminal-Bench-Science 0.1. En benchmark er en slags standardiseret prøve, som man bruger til at måle, hvor dygtig en kunstig intelligens er. Fable 5.1 fik 52,6 procent, hvilket er mere end en fordobling af resultatet for Fable 5, som fik 24,7 procent. Til sammenligning fik modellerne Opus 5 og GPT-5.6 Sol henholdsvis 29,0 procent og 22,4 procent.

Modellen har nu fem niveauer for ræsonnement, som er dens evne til at tænke over et problem, før den svarer. Disse niveauer er low, medium, high, xhigh og max. Man kan ikke længere slå denne tænke-proces helt fra. Det svarer lidt til, at man kan vælge, hvor grundigt modellen skal overveje sin løsning, før den giver et svar.

Når man tester modellens evne til at lave SVG-tegninger, som er digitale billeder bygget op af matematiske linjer, ser man en tydelig forskel. Ved de lave indstillinger springer modellen ræsonnementet over. En tegning af en pelikan på en cykel tog her 23 sekunder og kostede cirka 10 cent. Men når man skruer op for tankevirksomheden, stiger prisen og tidsforbruget markant. På niveauet xhigh tog opgaven 7 minutter og 51 sekunder og kostede 1,83 dollar. Her brugte modellen 36.767 output-tokens, som er de små tekststykker, computeren bruger til at bygge sit svar.

På det højeste niveau, max, tog det 13 minutter og 54 sekunder og kostede 3,30 dollar for 65.927 output-tokens. Til gengæld blev resultatet meget mere præcist. Tegningen af pelikanen havde nu korrekte detaljer, såsom fødder på pedalerne og en fisk i kurven. Selvom modellen er meget præcis, har den dog mindre kunstnerisk flair end Gemini 3.7 Flash.

Vil du have, at jeg forklarer mere om, hvordan tokens påvirker prisen på kunstig intelligens?

AiNews' genererede delekort for „Claude Fable 5.1 fordobler sin score i videnskabelig benchmark“
Genereret motiv i AiNews' radarsprog · ikke et fotografi fra historien

52,6 % er scoren på den nye Terminal-Bench-Science 0.1 benchmark for Claude Fable 5.1. Det er mere end en fordobling af resultatet for Fable 5, som scorede 24,7 %. Til sammenligning scorede Opus 5 29,0 % og GPT-5.6 Sol 22,4 %.

Fem niveauer for ræsonnement er introduceret i Fable 5.1: low, medium, high, xhigh og max. Det er ikke længere muligt at slå ræsonnement helt fra i modellen.

Test af SVG-generering viser, at modellen springer ræsonnement over ved low- og medium-indstillinger. Ved en prompt om en pelikan på en cykel tog svarene omkring 23 sekunder og kostede cirka 10 cent.

Prisen og tidsforbruget stiger markant ved højere niveauer. Ved 'xhigh' tog opgaven 7 minutter og 51 sekunder, kostede 1,83 dollar og brugte 36.767 output-tokens. Ved 'max'-indstillingen steg tidsforbruget til 13 minutter og 54 sekunder med en pris på 3,30 dollar for 65.927 output-tokens.

Resultaterne bliver mere præcise, jo mere ræsonnement der bruges. Max-indstillingen leverede den bedste SVG-tegning med korrekte detaljer som fødder på pedalerne og en fisk i kurven. Modellen har dog mindre flair end Gemini 3.7 Flash.

Kilder

  1. Claude Fable 5.1 made me a really nice animated pelican simonwillison.net
Produktionshistorie
  1. Radar Signal ? af 100 · spredning 1 kilder
  2. Skrevet Model: mimo-v2.5-free · temperatur 0.4
  3. Overskrift 5 kandidater, valgt af chat.dk
  4. Korrektur 1 zen · 2 rettelser
  5. Vedtagelse ainews-auto-v3 · score 0.403