Intelligens, under lup
Top 100
AI-modeller
Fra GPT og Claude til åbne modeller.
Se resultaterne. Følg udviklingen.
GPT-6-astra
21 benchmarks · Lukket model
Claude Fable-5.1
20 benchmarks · Lukket model
Claude Opus-5.5
18 benchmarks · Lukket model
Ranglisten
Gennemsnitlig benchmarkpercentil| Nr. | Model | Grundlag | Score |
|---|---|---|---|
| 01 | 21 benchmarksUændret | 96,0 | |
| 02 | 20 benchmarksUændret | 94,9 | |
| 03 | 18 benchmarksUændret | 93,9 | |
| 04 | 13 benchmarksUændret | 92,7 | |
| 05 | 22 benchmarksUændret | 88,9 | |
| 06 | 11 benchmarksUændret | 87,9 | |
| 07 | 23 benchmarksUændret | 87,4 | |
| 08 | 18 benchmarksUændret | 86,6 | |
| 09 | 25 benchmarksUændret | 84,9 | |
| 10 | 12 benchmarksUændret | 81,4 | |
| 11 | 7 benchmarksUændret | 80,7 | |
| 12 | 9 benchmarksUændret | 77,9 | |
| 13 | 22 benchmarksUændret | 77,8 | |
| 14 | 10 benchmarksUændret | 76,9 | |
| 15 | 18 benchmarksUændret | 76,8 | |
| 16 | 8 benchmarksUændret | 76,6 | |
| 17 | 24 benchmarksUændret | 76,2 | |
| 18 | 21 benchmarksUændret | 75,7 | |
| 19 | 14 benchmarksUændret | 74,6 | |
| 20 | 12 benchmarksUændret | 74,3 | |
| 21 | 17 benchmarksUændret | 74,2 | |
| 22 | 22 benchmarksUændret | 73,8 | |
| 23 | 7 benchmarksUændret | 72,1 | |
| 24 | 9 benchmarksUændret | 70,8 | |
| 25 | 6 benchmarksUændret | 68,7 | |
| 26 | 15 benchmarksUændret | 68,7 | |
| 27 | 18 benchmarksUændret | 68,5 | |
| 28 | 12 benchmarksUændret | 67,2 | |
| 29 | 11 benchmarksUændret | 66,2 | |
| 30 | 10 benchmarksUændret | 66,2 | |
| 31 | 25 benchmarksUændret | 66,0 | |
| 32 | 11 benchmarksUændret | 65,5 | |
| 33 | 23 benchmarksUændret | 65,0 | |
| 34 | 7 benchmarksUændret | 64,7 | |
| 35 | 19 benchmarksUændret | 64,2 | |
| 36 | 21 benchmarksUændret | 64,0 | |
| 37 | 10 benchmarksUændret | 63,5 | |
| 38 | 20 benchmarksUændret | 63,5 | |
| 39 | 17 benchmarksUændret | 63,2 | |
| 40 | 20 benchmarksUændret | 62,6 | |
| 41 | 18 benchmarksUændret | 62,6 | |
| 42 | 21 benchmarksUændret | 62,2 | |
| 43 | 23 benchmarksUændret | 61,6 | |
| 44 | 13 benchmarksUændret | 61,2 | |
| 45 | 17 benchmarksUændret | 61,0 | |
| 46 | 10 benchmarksUændret | 59,7 | |
| 47 | 22 benchmarksUændret | 59,7 | |
| 48 | 7 benchmarksUændret | 59,3 | |
| 49 | 14 benchmarksUændret | 57,7 | |
| 50 | 18 benchmarksUændret | 57,4 | |
| 51 | 8 benchmarksUændret | 57,3 | |
| 52 | 10 benchmarksUændret | 56,6 | |
| 53 | 19 benchmarksUændret | 56,4 | |
| 54 | 19 benchmarksUændret | 56,0 | |
| 55 | 10 benchmarksUændret | 54,3 | |
| 56 | 19 benchmarksUændret | 53,9 | |
| 57 | 14 benchmarksUændret | 52,6 | |
| 58 | 13 benchmarksUændret | 51,3 | |
| 59 | 21 benchmarksUændret | 50,0 | |
| 60 | 17 benchmarksUændret | 49,9 | |
| 61 | 14 benchmarksUændret | 49,4 | |
| 62 | 11 benchmarksUændret | 48,3 | |
| 63 | 6 benchmarksUændret | 48,2 | |
| 64 | 15 benchmarksUændret | 47,8 | |
| 65 | 20 benchmarksUændret | 46,9 | |
| 66 | 18 benchmarksUændret | 46,7 | |
| 67 | 17 benchmarksUændret | 46,4 | |
| 68 | 13 benchmarksUændret | 45,5 | |
| 69 | 17 benchmarksUændret | 44,8 | |
| 70 | 8 benchmarksUændret | 44,0 | |
| 71 | 18 benchmarksUændret | 43,4 | |
| 72 | 11 benchmarksUændret | 43,3 | |
| 73 | 17 benchmarksUændret | 43,1 | |
| 74 | 7 benchmarksUændret | 42,5 | |
| 75 | 18 benchmarksUændret | 42,4 | |
| 76 | 9 benchmarksUændret | 42,2 | |
| 77 | 6 benchmarksUændret | 40,6 | |
| 78 | 8 benchmarksUændret | 39,6 | |
| 79 | 7 benchmarksUændret | 37,5 | |
| 80 | 12 benchmarksUændret | 37,4 | |
| 81 | 16 benchmarksUændret | 37,1 | |
| 82 | 9 benchmarksUændret | 37,0 | |
| 83 | 16 benchmarksUændret | 36,9 | |
| 84 | 11 benchmarksUændret | 36,9 | |
| 85 | 15 benchmarksUændret | 36,4 | |
| 86 | 16 benchmarksUændret | 36,2 | |
| 87 | 9 benchmarksUændret | 36,1 | |
| 88 | 11 benchmarksUændret | 35,9 | |
| 89 | 7 benchmarksUændret | 35,6 | |
| 90 | 15 benchmarksUændret | 35,5 | |
| 91 | 18 benchmarksUændret | 35,5 | |
| 92 | 13 benchmarksUændret | 35,4 | |
| 93 | 9 benchmarksUændret | 35,4 | |
| 94 | 11 benchmarksUændret | 35,0 | |
| 95 | 10 benchmarksUændret | 34,9 | |
| 96 | 8 benchmarksUændret | 33,7 | |
| 97 | 8 benchmarksUændret | 33,5 | |
| 98 | 8 benchmarksUændret | 33,5 | |
| 99 | 16 benchmarksUændret | 32,3 | |
| 100 | 15 benchmarksUændret | 30,3 |
Ingen rangerede modeller matcher din søgning.
Modeller med begrænset dokumentation 230
Disse modeller har endnu ikke seks kvalificerede benchmarks. Se deres tal og kilder uden en samlet placering.
Hvad betyder scoren?
Scoren er gennemsnittet af modellens percentilplaceringer i dokumenterede benchmarks: 100 er øverst, 50 er midten. Resultater sammenlignes inden for samme benchmark, før gennemsnittet beregnes. Mindst seks benchmarks med mindst fem sammenligningsmodeller kræves for rangering. Selvindberettede modelkort indgår som dokumentation, men ikke i rangeringen. Manglende tal estimeres ikke. Forskellig dækning og testopsætning giver fortsat usikkerhed.
Scoren er en relativ placering, ikke procent rigtige svar. 90 betyder en høj gennemsnitlig placering blandt de målte modeller. Benchmarkdækning, reasoning-niveau og brug af værktøjer kan variere. De faktiske resultater og opsætninger står på profilen.
Vi fylder aldrig manglende målinger ud for at nå 100 modeller.
- AA Long Context Reasoning v1.1
- Agents' Last Exam
- ARC-AGI-1
- ARC-AGI-2
- ARC-AGI-3
- BrowseComp
- BullshitBench v2
- CritPt
- FACTS Grounding
- FrontierMath Tier 1-3
- FrontierMath Tier 4
- GPQA Diamond
- Humanity's Last Exam
- IFBench
- IOI V2
- LiveCodeBench
- MathArena
- MCP Atlas
- MMLU-Pro
- MMMU-Pro
- OSWorld-Verified
- ProgramBench
- ProofBench 1.1
- SciCode
- SimpleQA Verified
- SWE-rebench
- Terminal-Bench 4.0
- GSM8K
- GPQA
- Humanity’s Last Exam
- MMLU-Pro
- SWE-bench Verified
- SWE-bench Pro
- AIME 2026
- HMMT februar 2026
- Terminal-Bench 2.0