Spring til indhold
AiNews.dkDanske nyheder om Kunstig Intelligens
← Til ranglisten
ModelradarenHentet 1. oktober 2026 kl. 18.30
Z.aiÅbne vægte

glm-5.1

Nr. 69 på modelradaren.

Model og dokumentation ↗

Hvad bygger scoren på?

Råtal, relativ placering og dokumentation.

AA Long Context Reasoning v1.1

Indgår i scoren · 131 sammenligningsmodeller

Kilde og testnoter ↗

Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.

Via AI IQ · Artificial Analysis Intelligence Index v4.3.2 · version 4.3.2 · kildens dato 2026-09-30

Se det oprindelige resultat ↗

73,7målt · skala 0–100Percentil 38,8

Agents' Last Exam

Indgår i scoren · 29 sammenligningsmodeller

Kilde og testnoter ↗

Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.

Via AI IQ · Agents' Last Exam · kildens dato 2026-09-30

Se det oprindelige resultat ↗

11,5målt · skala 0–100Percentil 21,4

BrowseComp

Indgår i scoren · 39 sammenligningsmodeller

Kilde og testnoter ↗

Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.

Via AI IQ · LLM Stats BrowseComp · kildens dato 2026-09-30

Se det oprindelige resultat ↗

79,3målt · skala 0–100Percentil 53,9

BullshitBench v2

Indgår i scoren · 79 sammenligningsmodeller

Kilde og testnoter ↗

Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.

Via AI IQ · BullshitBench v2 · kildens dato 2026-09-30

Se det oprindelige resultat ↗

22,0målt · skala 0–100Percentil 26,9

CritPt

Indgår i scoren · 136 sammenligningsmodeller

Kilde og testnoter ↗

Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.

Via AI IQ · Artificial Analysis Intelligence Index v4.3.2 · version 4.3.2 · kildens dato 2026-09-30

Se det oprindelige resultat ↗

4,6målt · skala 0–100Percentil 51,5

FrontierMath Tier 1-3

Indgår i scoren · 74 sammenligningsmodeller

Kilde og testnoter ↗

Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.

Via AI IQ · Epoch AI FrontierMath Tiers 1-3 v2 · kildens dato 2026-09-30

Se det oprindelige resultat ↗

36,8målt · skala 0–100Percentil 37,0

GPQA Diamond

Indgår i scoren · 156 sammenligningsmodeller

Kilde og testnoter ↗

Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.

Via AI IQ · Artificial Analysis Intelligence Index v4.3.2 · version 4.3.2 · kildens dato 2026-09-30

Se det oprindelige resultat ↗

86,8målt · skala 0–100Percentil 55,5

Humanity's Last Exam

Indgår i scoren · 146 sammenligningsmodeller

Kilde og testnoter ↗

Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.

Via AI IQ · Artificial Analysis Intelligence Index v4.3.2 · version 4.3.2 · kildens dato 2026-09-30

Se det oprindelige resultat ↗

30,1målt · skala 0–100Percentil 51,7

IFBench

Indgår i scoren · 95 sammenligningsmodeller

Kilde og testnoter ↗

Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.

Via AI IQ · Artificial Analysis Intelligence Index v4.3.2 · version 4.3.2 · kildens dato 2026-09-30

Se det oprindelige resultat ↗

76,3målt · skala 0–100Percentil 84,0

LiveCodeBench

Indgår i scoren · 61 sammenligningsmodeller

Kilde og testnoter ↗

Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.

Via AI IQ · Vals.ai LiveCodeBench · kildens dato 2026-08-04

Se det oprindelige resultat ↗

81,4målt · skala 0–100Percentil 45,0

MathArena

Indgår i scoren · 57 sammenligningsmodeller

Kilde og testnoter ↗

Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.

Via AI IQ · MathArena Models · kildens dato 2026-09-30

Se det oprindelige resultat ↗

23,4målt · skala 0–100Percentil 46,4

MCP Atlas

Indgår i scoren · 32 sammenligningsmodeller

Kilde og testnoter ↗

Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.

Via AI IQ · Scale Labs MCP Atlas · kildens dato 2026-09-30

Se det oprindelige resultat ↗

75,6målt · skala 0–100Percentil 45,2

ProgramBench

Indgår i scoren · 51 sammenligningsmodeller

Kilde og testnoter ↗

Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.

Via AI IQ · Vals.ai ProgramBench · kildens dato 2026-09-30

Se det oprindelige resultat ↗

1,0målt · skala 0–100Percentil 29,0

SciCode

Indgår i scoren · 144 sammenligningsmodeller

Kilde og testnoter ↗

Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.

Via AI IQ · Artificial Analysis Intelligence Index v4.3.2 · version 4.3.2 · kildens dato 2026-09-30

Se det oprindelige resultat ↗

44,8målt · skala 0–100Percentil 46,5

SimpleQA Verified

Indgår i scoren · 71 sammenligningsmodeller

Kilde og testnoter ↗

Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.

Via AI IQ · Epoch AI SimpleQA Verified · kildens dato 2026-09-30

Se det oprindelige resultat ↗

34,0målt · skala 0–100Percentil 27,1

SWE-rebench

Indgår i scoren · 25 sammenligningsmodeller

Kilde og testnoter ↗

Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.

Via AI IQ · SWE-rebench · kildens dato 2026-09-22

Se det oprindelige resultat ↗

50,7målt · skala 0–100Percentil 50,0

Terminal-Bench 4.0

Indgår i scoren · 84 sammenligningsmodeller

Kilde og testnoter ↗

Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.

Via AI IQ · Artificial Analysis Intelligence Index v4.3.2 · version 4.3.2 · kildens dato 2026-09-30

Se det oprindelige resultat ↗

2,0målt · skala 0–100Percentil 51,8

GPQA

Dokumentation · indgår ikke i scoren

Kilde og testnoter ↗

Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.

Se det oprindelige resultat ↗

86,2målt · skala 0–100Ikke rangeret

SWE-bench Pro

Dokumentation · indgår ikke i scoren

Kilde og testnoter ↗

Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.

high reasoning

Se det oprindelige resultat ↗

58,4målt · skala 0–100Ikke rangeret

AIME 2026

Dokumentation · indgår ikke i scoren

Kilde og testnoter ↗

Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.

Se det oprindelige resultat ↗

95,3målt · skala 0–100Ikke rangeret

Terminal-Bench 2.0

Dokumentation · indgår ikke i scoren

Kilde og testnoter ↗

Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.

agent: Terminus 2(Claude Code)

Se det oprindelige resultat ↗

69,0målt · skala 0–100Ikke rangeret

Model og testopsætning

Reasoning-niveauer tæller ikke som forskellige modeller.

Vores nyheder

Fra AiNews.dk’s arkiv om glm-5.1.

Der er endnu ingen artikler om denne model i vores arkiv.

Hvad betyder scoren?

Scoren er gennemsnittet af modellens percentilplaceringer i dokumenterede benchmarks: 100 er øverst, 50 er midten. Resultater sammenlignes inden for samme benchmark, før gennemsnittet beregnes. Mindst seks benchmarks med mindst fem sammenligningsmodeller kræves for rangering. Selvindberettede modelkort indgår som dokumentation, men ikke i rangeringen. Manglende tal estimeres ikke. Forskellig dækning og testopsætning giver fortsat usikkerhed.

Scoren er en relativ placering, ikke procent rigtige svar. 90 betyder en høj gennemsnitlig placering blandt de målte modeller. Benchmarkdækning, reasoning-niveau og brug af værktøjer kan variere. De faktiske resultater og opsætninger står på profilen.

Vi fylder aldrig manglende målinger ud for at nå 100 modeller.