Spring til indhold
AiNews.dkDanske nyheder om Kunstig Intelligens
← Til ranglisten
ModelradarenHentet 1. oktober 2026 kl. 18.30
FINAL-BenchModel

Darwin-180B-RSI

Der er endnu ikke bred nok dokumentation til en placering.

Model og dokumentation ↗

Hvad bygger scoren på?

Råtal, relativ placering og dokumentation.

GPQA

Dokumentation · indgår ikke i scoren

Kilde og testnoter ↗

Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.

GPQA Diamond, all 198 items; majority vote over up to 16 samples (temperature=1.0, top_p=0.95, top_k=20); thinking budget 131,072 tokens; bf16

Se det oprindelige resultat ↗

94,4målt · skala 0–100Ikke rangeret

MMLU-Pro

Dokumentation · indgår ikke i scoren

Kilde og testnoter ↗

Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.

MMLU-Pro test, all 12,032 items; single sample (temperature=1.0, top_p=0.95, top_k=20); thinking budget 131,072 tokens; bf16

Se det oprindelige resultat ↗

88,1målt · skala 0–100Ikke rangeret

AIME 2026

Dokumentation · indgår ikke i scoren

Kilde og testnoter ↗

Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.

AIME 2026, all 30 problems; majority vote over 16 samples (maj@16) = 100.0; mean accuracy over 16 samples = 98.75; temperature=1.0, top_p=0.95, top_k=20; thinking budget 131,072 tokens; bf16

Se det oprindelige resultat ↗

100,0målt · skala 0–100Ikke rangeret

HMMT februar 2026

Dokumentation · indgår ikke i scoren

Kilde og testnoter ↗

Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.

HMMT February 2026, all 33 problems; majority vote over 16 samples (maj@16) = 100.0; mean accuracy over 16 samples = 96.59; temperature=1.0, top_p=0.95, top_k=20; thinking budget 131,072 tokens; bf16

Se det oprindelige resultat ↗

100,0målt · skala 0–100Ikke rangeret

Model og testopsætning

Reasoning-niveauer tæller ikke som forskellige modeller.

Kilderne oplyser ikke separate reasoning-indstillinger. Se testnoterne ved hvert resultat.

Vores nyheder

Fra AiNews.dk’s arkiv om Darwin-180B-RSI.

Der er endnu ingen artikler om denne model i vores arkiv.

Hvad betyder scoren?

Scoren er gennemsnittet af modellens percentilplaceringer i dokumenterede benchmarks: 100 er øverst, 50 er midten. Resultater sammenlignes inden for samme benchmark, før gennemsnittet beregnes. Mindst seks benchmarks med mindst fem sammenligningsmodeller kræves for rangering. Selvindberettede modelkort indgår som dokumentation, men ikke i rangeringen. Manglende tal estimeres ikke. Forskellig dækning og testopsætning giver fortsat usikkerhed.

Scoren er en relativ placering, ikke procent rigtige svar. 90 betyder en høj gennemsnitlig placering blandt de målte modeller. Benchmarkdækning, reasoning-niveau og brug af værktøjer kan variere. De faktiske resultater og opsætninger står på profilen.

Vi fylder aldrig manglende målinger ud for at nå 100 modeller.