Hvad bygger scoren på?
Råtal, relativ placering og dokumentation.
AA Long Context Reasoning v1.1
Kilde og testnoter ↗
Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.
Via AI IQ · Artificial Analysis Intelligence Index v4.3.2 · version 4.3.2 · kildens dato 2026-09-30
Agents' Last Exam
Kilde og testnoter ↗
Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.
Via AI IQ · Agents' Last Exam · kildens dato 2026-09-30
ARC-AGI-1
Kilde og testnoter ↗
Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.
Via AI IQ · ARC Prize verified leaderboard · kildens dato 2026-09-30
ARC-AGI-2
Kilde og testnoter ↗
Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.
Via AI IQ · ARC Prize verified leaderboard · kildens dato 2026-09-30
ARC-AGI-3
Kilde og testnoter ↗
Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.
Via AI IQ · ARC Prize verified leaderboard · kildens dato 2026-09-30
BrowseComp
Kilde og testnoter ↗
Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.
Via AI IQ · LLM Stats BrowseComp · kildens dato 2026-09-30
BullshitBench v2
Kilde og testnoter ↗
Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.
Via AI IQ · BullshitBench v2 · kildens dato 2026-09-30
CritPt
Kilde og testnoter ↗
Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.
Via AI IQ · Artificial Analysis Intelligence Index v4.3.2 · version 4.3.2 · kildens dato 2026-09-30
FACTS Grounding
Kilde og testnoter ↗
Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.
Via AI IQ · Kaggle FACTS Grounding v2 · kildens dato 2026-09-30
FrontierMath Tier 1-3
Kilde og testnoter ↗
Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.
Via AI IQ · Epoch AI FrontierMath Tiers 1-3 v2 · kildens dato 2026-09-30
FrontierMath Tier 4
Kilde og testnoter ↗
Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.
Via AI IQ · Epoch AI FrontierMath Tier 4 v2 · kildens dato 2026-09-30
GPQA Diamond
Kilde og testnoter ↗
Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.
Via AI IQ · Artificial Analysis Intelligence Index v4.3.2 · version 4.3.2 · kildens dato 2026-09-30
Humanity's Last Exam
Kilde og testnoter ↗
Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.
Via AI IQ · Artificial Analysis Intelligence Index v4.3.2 · version 4.3.2 · kildens dato 2026-09-30
IFBench
Kilde og testnoter ↗
Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.
Via AI IQ · Artificial Analysis Intelligence Index v4.3.2 · version 4.3.2 · kildens dato 2026-09-30
LiveCodeBench
Kilde og testnoter ↗
Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.
Via AI IQ · Vals.ai LiveCodeBench · kildens dato 2026-08-04
MathArena
Kilde og testnoter ↗
Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.
Via AI IQ · MathArena Models · kildens dato 2026-09-30
MCP Atlas
Kilde og testnoter ↗
Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.
Via AI IQ · Scale Labs MCP Atlas · kildens dato 2026-09-30
MMMU-Pro
Kilde og testnoter ↗
Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.
Via AI IQ · Artificial Analysis Intelligence Index v4.3.2 · version 4.3.2 · kildens dato 2026-09-30
OSWorld-Verified
Kilde og testnoter ↗
Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.
Via AI IQ · LLM Stats OSWorld-Verified · kildens dato 2026-09-30
ProgramBench
Kilde og testnoter ↗
Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.
Via AI IQ · Vals.ai ProgramBench · kildens dato 2026-09-30
SciCode
Kilde og testnoter ↗
Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.
Via AI IQ · Artificial Analysis model leaderboard · kildens dato 2026-09-10
SimpleQA Verified
Kilde og testnoter ↗
Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.
Via AI IQ · Epoch AI SimpleQA Verified · kildens dato 2026-09-30
SWE-rebench
Kilde og testnoter ↗
Uafhængig verificering ikke oplyst. Hentet 1. oktober 2026 kl. 18.30.
Via AI IQ · SWE-rebench · kildens dato 2026-09-22
Model og testopsætning
Reasoning-niveauer tæller ikke som forskellige modeller.
Non-reasoning
Claude Opus 4.7 (Non-reasoning, high)
Benchmarkkilde ↗Kildens dato: 2026-07-21Max
Claude Opus 4.7 (max)
Benchmarkkilde ↗Kildens dato: 2026-09-30Thinking
Claude Opus 4.7 (Thinking)
Benchmarkkilde ↗Kildens dato: 2026-07-21xHigh
Claude-Opus-4.7 (xhigh)
Benchmarkkilde ↗Kildens dato: 2026-07-21Vores nyheder
Fra AiNews.dk’s arkiv om Claude Opus-4.7.
- 01
Hvad betyder scoren?
Scoren er gennemsnittet af modellens percentilplaceringer i dokumenterede benchmarks: 100 er øverst, 50 er midten. Resultater sammenlignes inden for samme benchmark, før gennemsnittet beregnes. Mindst seks benchmarks med mindst fem sammenligningsmodeller kræves for rangering. Selvindberettede modelkort indgår som dokumentation, men ikke i rangeringen. Manglende tal estimeres ikke. Forskellig dækning og testopsætning giver fortsat usikkerhed.
Scoren er en relativ placering, ikke procent rigtige svar. 90 betyder en høj gennemsnitlig placering blandt de målte modeller. Benchmarkdækning, reasoning-niveau og brug af værktøjer kan variere. De faktiske resultater og opsætninger står på profilen.
Vi fylder aldrig manglende målinger ud for at nå 100 modeller.
- AA Long Context Reasoning v1.1
- Agents' Last Exam
- ARC-AGI-1
- ARC-AGI-2
- ARC-AGI-3
- BrowseComp
- BullshitBench v2
- CritPt
- FACTS Grounding
- FrontierMath Tier 1-3
- FrontierMath Tier 4
- GPQA Diamond
- Humanity's Last Exam
- IFBench
- IOI V2
- LiveCodeBench
- MathArena
- MCP Atlas
- MMLU-Pro
- MMMU-Pro
- OSWorld-Verified
- ProgramBench
- ProofBench 1.1
- SciCode
- SimpleQA Verified
- SWE-rebench
- Terminal-Bench 4.0
- GSM8K
- GPQA
- Humanity’s Last Exam
- MMLU-Pro
- SWE-bench Verified
- SWE-bench Pro
- AIME 2026
- HMMT februar 2026
- Terminal-Bench 2.0