Ny modelkombination løser 83 % af softwareopgaver billigere
Ved at bruge DeepSeek V4 Pro 0813 først og GPT-5.6 Sol som backup, kan man løse flere opgaver billigere end ved kun at bruge den dyreste model.
Læs i dit tempo
Kort
En ny metode bruger en billig AI-model først og skifter kun til en dyrere model, hvis den fejler. Dette gør løsningen af softwareopgaver 60 % billigere og mere effektiv end at bruge den dyreste model alene. Resultatet er, at 83 % af testopgaverne nu kan løses for kun 3,35 dollars per styk.
Begynder
Kan man løse softwareopgaver billigere og bedre? I en test, der hedder DeepSWE-benchmarken – som er en standardiseret måling af, hvor gode computerprogrammer er til at løse opgaver – er man nået frem til noget spændende. Ved at bruge en billig model, DeepSeek V4 Pro 0813, først og kun skifte til den dyre model, GPT-5.6 Sol, hvis det første forsøg fejler, kan 83 % af opgaverne løses for 3,35 dollars stykket. Det svarer lidt til at lade en dygtig lærling prøve først og kun tilkalde den dyre specialist, hvis opgaven er for svær. Denne metode er 10 procentpoint mere effektiv og 60 % billigere end kun at bruge specialisten.
Prisforskellen mellem de to modeller er enorm. DeepSeek V4 Pro 0813 koster 0,24 dollars per gennemløb, mens GPT-5.6 Sol koster 8,37 dollars. Det er en forskel på 35 gange. For 100 dollars kan Pro-modellen løse 261 opgaver, mens Sol-modellen kun kan løse 9.
Hvem er egentlig bedst? GPT-5.6 Sol er stærkest ved første forsøg med en succesrate på 72,7 %, mens Pro-modellen kun når 62,8 %. Men hvis man giver modellerne fire forsøg hver, vender billedet. Her løser Pro-modellen 88,5 % af opgaverne, mens Sol kun når 85,8 %.
Sol-modellen er hurtigere og mere stabil i sin proces. Et gennemløb tager 17 minutter med 53 trin for Sol, mens Pro kræver 35 minutter og 146 trin. Men Sol har en tendens til at ødelægge tests, der før var bestået, i 20 % af fejltilfældene. Det er næsten dobbelt så meget som hos Pro-modellen.
Vil du have, at jeg forklarer nærmere, hvorfor det kan være en fordel at give en AI-model flere forsøg på den samme opgave?

83 % af softwareopgaverne i DeepSWE-benchmarken løses nu for 3,35 dollars per opgave. Det sker ved at køre DeepSeek V4 Pro 0813 først og kun skifte til GPT-5.6 Sol, hvis den første model fejler. Denne metode er 10 procentpoint mere effektiv og 60 % billigere end kun at bruge GPT-5.6 Sol.
Prisforskellen mellem de to modeller er 35 gange. DeepSeek V4 Pro 0813 koster 0,24 dollars per gennemløb, mens GPT-5.6 Sol koster 8,37 dollars. For 100 dollars kan Pro løse 261 opgaver, mens Sol kun løser 9.
GPT-5.6 Sol er den stærkeste model ved første forsøg. Den har en succesrate på 72,7 % (pass@1) mod Pro-modellens 62,8 %. Ved fire forsøg (pass@4) vender billedet dog, og Pro løser 88,5 % af opgaverne mod Sols 85,8 %.
Sol kører hurtigere og mere stabilt end Pro. Et gennemløb tager 17 minutter med 53 trin for Sol, mens Pro kræver 35 minutter og 146 trin. Sol har dog en tendens til at ødelægge tests, der allerede var bestået, i 20 % af fejltilfældene, hvilket er næsten dobbelt så meget som hos Pro.
Kilder
Produktionshistorie
- Radar Signal ? af 100 · spredning 1 kilder
- Vurdering Nyheds 4/5 — Sammenligning af kapacitet, pris og routing mellem specifikke modeller.
- Skrevet Model: mimo-v2.5-free · temperatur 0.4
- Overskrift 5 kandidater, valgt af chat.dk
- Korrektur 1 zen · 1 rettelser
- Vedtagelse ainews-auto-v3 · score 0.4009