Spring til indhold
AiNews.dkDanske nyheder om Kunstig Intelligens

Frontier

AI-modeller retter nu selv fejl og gør træningen billigere

Anthropic-forsker har udviklet et system, der automatisk forbedrer modellers alignment på tværs af 10 benchmarks.

1 kildeVedtaget af NIel AutopilotRettet 29. august 2026 kl. 14.03

Læs i dit tempo

Kort

En forsker har skabt et automatisk system, der retter fejl i AI-modellers adfærd mere effektivt end mennesker. Det er langt billigere og beviser, at AI kan optimere sine egne processer. Dette muliggør rekursiv selvforbedring, hvor AI'en i gentagne cyklusser forbedrer sin egen træning.

Begynder

Forestil dig, at vi gerne vil have en kunstig intelligens til at opføre sig præcis, som vi ønsker. Dette kaldes for »justering« eller alignment. Nogle gange kan en model have »fejljusteret adfærd«. Det betyder blot, at den gør noget andet end det, vi egentlig bad om. En forsker fra Anthropics fellows-program har beskrevet et system i artiklen ”Automated Researchers Can Reliably Mitigate Alignment Failures”, der kan rette dette. Systemet forbedrede resultaterne på ti forskellige test-målinger, kaldet benchmarks, uden at gøre modellen dårligere til andre ting.

Systemet fungerer som en slags digital forsker. Det søger i eksisterende viden og foreslår løsninger, præcis som et menneske ville gøre. Processen foregår i små bidder. Systemet foreslår en metode og træner modellen i 30 minutter. Derefter måles resultatet. De gode metoder bliver gemt, mens de dårlige kasseres. Det gør det muligt at skalere processen meget hurtigt.

Denne automatiserede forsker, kaldet en »Automated Alignment Researcher« (AAR), er utrolig effektiv. Den kan udkonkurrere erfarne mennesker på i gennemsnit seks timer. Det er også langt billigere. Det koster cirka 4 dollars i timen for at bruge systemets Application Programming Interface (API). En API er den tekniske forbindelse, man bruger til at tale med modellen. Til sammenligning koster en menneskelig forsker omkring 150 dollars i timen.

Resultaterne peger mod noget, der kaldes »rekursiv selvforbedring«. Det svarer til en elev, der lærer at studere mere effektivt, hvilket gør eleven endnu bedre til at lære. Her er det modellerne, der selv optimerer deres egen træning. Der er dog et vigtigt forbehold. Systemet virker kun, hvis de benchmarks, eller test-målinger, man bruger, rent faktisk afspejler det, man ønsker, at AI'en skal lære.

Vil du have et konkret eksempel på, hvad »fejljusteret adfærd« kan være i praksis?

Redaktionel illustration til „AI-modeller retter nu selv fejl og gør træningen billigere“
Genereret illustration · ikke et fotografi fra historien

Et automatiseret system forbedrede resultaterne på 10 forskellige benchmarks for fejljusteret adfærd uden at forringe modellens generelle præstation. Systemet er udviklet af en forsker i Anthropics fellows-program og er beskrevet i papiret ”Automated Researchers Can Reliably Mitigate Alignment Failures”.

Metoden efterligner traditionel forskning ved at søge i litteratur og foreslå løsninger. Hvert automatiseret system foreslår en metode og træner modellen i 30 minutter, hvorefter resultatet måles. Effektive metoder gemmes, mens dårlige kasseres, hvilket gør det muligt at skalere processen hurtigt.

Den automatiserede forsker (Automated Alignment Researcher, AAR) udkonkurrerer erfarne mennesker på gennemsnitlig seks timer. Omkostningerne til API-inferens er cirka 4 dollars i timen, mens en menneskelig forsker koster 150 dollars i timen.

Resultaterne er et skridt mod rekursiv selvforbedring, hvor modeller selv optimerer deres træningspraksis. Systemet er dog afhængigt af, at de anvendte benchmarks præcist afspejler de faktiske mål for justering (alignment).

Kilder

  1. An Anthropic researcher just gave us a peek at self-improving AI techcrunch.com
Produktionshistorie
  1. Radar Signal ? af 100 · spredning 1 kilder
  2. Vurdering Nyheds 4/5 — Ny indsigt i teknisk kapabilitet vedrørende selvforbedring.
  3. Skrevet Model: mimo-v2.5-free · temperatur 0.4
  4. Overskrift 5 kandidater, valgt af chat.dk
  5. Korrektur 1 zen · 3 rettelser
  6. Billede Genereret af gemini-3.6-flash-medium
  7. Vedtagelse ainews-auto-v3 · score 0.3564