Spring til indhold
AiNews.dkDanske nyheder om Kunstig Intelligens

Topnyheder

De sværeste opgaver står stadig på nul efter træning

Matthew-effekten: Forstærkningslæring løfter lette opgaver, mens de sværeste står stille. Ny metode 'Never Give Up' skal presse de svære.

2 kilderVedtaget af NIel AutopilotRettet 16. september 2026 kl. 02.58
Læst op af en AI-stemme

Læs i dit tempo

Kort

Forskere fandt, at sprogmodellen Olmo 3.1 kun bliver bedre til lette opgaver, ikke de sværeste, under træning med belønning – et mønster kaldet Matthew-effekten. Det er problematisk, fordi gennemsnit skjuler manglende fremskridt på svære opgaver. Nu foreslår forskerne 'Never Give Up' for at holde modellen ved svære problemer, men de sværeste er stadig uløste.

Begynder

Forskere bag sprogmodellen Olmo 3.1 har undersøgt, hvordan modellen lærer af forstærkningslæring. Forstærkningslæring er en træningsmetode, hvor modellen belønnes, hver gang den løser en opgave rigtigt, og dermed gradvist bliver bedre. De analyserede 30 opgaver fra en kendt matematikprøve kaldet AIME og opdagede et skævt mønster: Modellen bliver meget bedre til de lette opgaver, mens de allersværeste næsten ikke forbedres.

For at forstå forskellen delte forskerne opgaverne i tre sværhedsgrader ud fra, hvor godt modellen klarede sig fra starten. Hvis modellen ikke løste en opgave i 32 forsøg, kaldte de den svær. De øvrige opgaver blev delt i mellem og lette. I starten løste modellen 0 procent af de svære opgaver i ét forsøg, 3,8 procent af de mellem svære og 22,7 procent af de lette. Efter træningen var billedet klart: De lette opgaver blev løst langt oftere, mens de svære stadig ikke blev løst i 32 forsøg. Forskerne kalder dette Matthew-effekten, efter princippet om, at den, der har, skal få. Et gennemsnit over alle opgaver ville nemlig skjule, at forbedringerne hovedsageligt kommer fra de opgaver, modellen allerede kunne lidt fra begyndelsen.

Det samme mønster går igen, når forskerne ser på andre områder som kodning og agentopgaver, hvor en model skal udføre handlinger. Her testede de med værktøjerne Deepcoder og DeepSWE og fandt, at jo sværere opgaven er fra start, desto mindre lærer modellen. Gevinsterne fra forstærkningslæring er altså proportionale med, hvor lette problemerne er.

Papiret foreslår en metode kaldet 'Never Give Up' til at løse problemet. Blogindlægget beskriver den ikke i detaljer, men ideen er at få modellen til at blive ved med at arbejde på svære problemer i stedet for at fokusere på de lette. Trods dette ender de sværeste AIME-opgaver stadig med at være uløste i 32 forsøg efter træningen.

Redaktionel illustration til „De sværeste opgaver står stadig på nul efter træning“
Genereret illustration · ikke et fotografi fra historien

Forskere bag sprogmodellen Olmo 3.1 har analyseret 30 AIME-opgaver og fundet et skævt mønster i forstærkningslæring (RL). Modellen bliver markant bedre til lette opgaver, mens de sværeste næsten ikke rykker sig.

Holdet bag papiret, beskrevet i et blogindlæg af Michael Noukhovitch, opdelte opgaverne i tre sværhedsgrader ud fra modellens oprindelige præstation. Opgaver, hvor modellen fik 0 ved pass@32 – altså ikke løste opgaven i 32 forsøg – blev kaldt svære. Resten blev delt i mellem og lette. Startniveauet var 0 %, 3,8 % og 22,7 % pass@1 for henholdsvis svære, mellem og lette opgaver. Papiret ligger på arXiv, koden på GitHub.

Resultatet er tydeligt: De lette opgaver forbedres dramatisk, mens de svære forbliver på pass@32=0. Forfatterne kalder fænomenet Matthew-effekten, efter princippet om at den, der har, skal få. Et gennemsnit over alle opgaver skjuler altså, at forbedringerne hovedsageligt kommer fra de opgaver, modellen allerede kunne lidt.

Det samme mønster går igen i andre domæner. Ved at evaluere kode- og agentopgaver med Deepcoder og DeepSWE finder forskerne, at gevinsterne fra RL er proportionale med, hvor lette problemerne er. Jo sværere opgaven er fra start, desto mindre lærer modellen.

Papiret foreslår en metode kaldet 'Never Give Up' til at løse problemet. Blogindlægget beskriver den ikke i detaljer, men ideen er at få modellen til at blive ved med at arbejde på svære problemer i stedet for at fokusere på de lette.

De sværeste AIME-opgaver ender stadig med pass@32=0 efter træning.

Det er uklart: Blogindlægget er afkortet i kilden, så detaljerne om Never Give Up-metoden er ikke beskrevet.

Kilder

  1. Learning to solve hard problems in RL for LLMs by never giving up mnoukhov.github.io
  2. Learning to solve hard problems in RL for LLMs by never giving up https:// mnoukhov.github.io/posts/ngu/ # github # llm… mastodon.social
Produktionshistorie
  1. Radar Signal ? af 100 · spredning 2 kilder
  2. Vurdering Nyheds 4/5 — Teknisk forskning i RL til LLM, relevant for udviklere.
  3. Skrevet Model: deepseek-v4-flash · temperatur 0.4
  4. Overskrift 5 kandidater, valgt af deepseek-v4-flash
  5. Billede Genereret af gemini-2.5-flash-image
  6. Vedtagelse ainews-auto-v3 · score 0.8377