Spring til indhold
AiNews.dkDanske nyheder om Kunstig Intelligens

YouTube Hype

Ny kodemodel giver udviklere mere for pengene

SWE-2 scorer 83,75 procent på KingBench 3 og overgår DeepSeek V4.1 Flash samt Astra og Fable. Modellen er nu en del af Devin Pro til 20 dollars om måneden.

1 kildeVedtaget af NIel AutopilotRettet 11. september 2026 kl. 13.58
Læst op af en AI-stemme

Læs i dit tempo

Kort

Cognitions nye kodemodel SWE-2 fik 83,75 procent på testen KingBench 3 og slog DeepSeek V4.1 Flash. Det betyder, at udviklere kan få en stærk kodemodel til kun 20 dollars om måneden via Devin Pro uden en dyr erhvervsløsning. Nu ligger SWE-2 på femtepladsen og fremhæves som et af de stærkeste åbne alternativer.

Begynder

Firmaet Cognition har lavet en ny kodemodel. En kodemodel er et computerprogram, der kan hjælpe med at skrive og forbedre kode. Modellen hedder SWE-2. På testen KingBench 3, som er en slags eksamen for kodemodeller, fik den 67 point ud af 80. Det svarer til 83,75 procent. Dermed slår den DeepSeek V4.1 Flash, som fik 81,25 procent. SWE-2 ligger nu på femtepladsen på ranglisten.

SWE-2 er blevet testet på flere slags opgaver. Det gælder længere opgaver, hvor modellen selv skal tage flere skridt og bruge værktøjer undervejs. Det kaldes agentiske opgaver. Den er også testet på simulationer, man kan påvirke undervejs, på tredimensionelle programmer, på spil og på finjustering af modeller. Finjustering betyder, at man træner en model videre på et bestemt område. Ifølge gruppen AICodeKing, som står bag testen, er SWE-2 særligt god til komplekse opgaver. Det er opgaver, hvor flere værktøjer skal bruges i samme arbejdsgang.

En udfordring er, at SWE-2 har en tendens til at stille spørgsmål for at få opgaven præciseret. Det kan være en fordel nogle gange. Lidt som en håndværker, der spørger om målene, før han saver. Men det kan også bremse arbejdet, hvis man hellere vil have, at modellen bare går i gang.

SWE-2 er en del af abonnementet Devin Pro. Det koster 20 dollars om måneden. Det gør modellen interessant for udviklere, som vil have en stærk kodemodel uden at betale for et dyrere virksomhedsabonnement. AICodeKing fremhæver også, at SWE-2 overgår både Astra og Fable i testen. Det gør den til et af de stærkeste alternativer med åben kildekode på markedet lige nu. Åben kildekode betyder, at andre kan se og bruge koden.

Redaktionel illustration til „Ny kodemodel giver udviklere mere for pengene“
Genereret illustration · ikke et fotografi fra historien

Cognitions nye kodemodel SWE-2 scorer 67 ud af 80 point, svarende til 83,75 procent, på KingBench 3. Dermed slår den DeepSeek V4.1 Flash, som fik 81,25 procent, og den placerer sig på femtepladsen på leaderboardet.

SWE-2 er testet på længere agentiske opgaver, interaktive simulationer, 3D-applikationer, spil og finjustering af modeller. Ifølge AICodeKing, som står bag testen, klarer modellen sig særligt godt på komplekse opgaver, hvor flere værktøjer skal bruges i samme workflow.

En udfordring er modellens tilbøjelighed til at stille spørgsmål for at få opgaven præciseret. Det kan være en fordel i nogle sammenhænge, men det kan også bremse arbejdet, hvis man vil have modellen til bare at gå i gang.

SWE-2 er en del af Devin Pro-abonnementet, som koster 20 dollars om måneden. Det gør modellen til et interessant valg for udviklere, der vil have en stærk kodemodel uden at betale for et dyrere enterprise-abonnement.

AICodeKing fremhæver, at SWE-2 overgår både Astra og Fable i testen, hvilket gør den til et af de stærkeste open source-alternativer på markedet lige nu.

Det er uklart: Videoen er en times gammel og har få visninger; testen er fra én YouTuber og ikke uafhængigt verificeret.

Kilder

  1. SWE-2 (Fully Tested): WHAT? IT ACTUALLY BEATS ASTRA & FABLE! youtube.com
Produktionshistorie
  1. Radar Signal ? af 100 · spredning ? kilder
  2. Vurdering Nyheds 4/5 — Test af AI-kodningsmodel, konkret og relevant.
  3. Skrevet Model: deepseek-v4-flash · temperatur 0.4
  4. Overskrift 4 kandidater, valgt af deepseek-v4-flash
  5. Billede Genereret af gemini-2.5-flash-image
  6. Vedtagelse ainews-auto-v3 · score 399