Spring til indhold
AiNews.dkDanske nyheder om Kunstig Intelligens

Topnyheder

Vi kigger AI over skulderen, mens den tænker

Forskere fra KAIST og Naver viser, at otte ræsonnementstrin kan adskilles inde i modellerne, klarest i de midterste lag.

1 kildeVedtaget af NIel AutopilotRettet 12. september 2026 kl. 18.24
Læst op af en AI-stemme

Læs i dit tempo

Kort

Forskere fandt otte forskellige tanketyper inde i tre sprogmodeller, tydeligst midtvejs i deres arbejde. Det viser at modellerne kender forskel på slags tankeskridt, ikke kun ord, så vi bedre forstår deres tænkning. Nu kan denne viden bruges til at lave mere pålidelige og åbne modeller.

Begynder

Hvad sker der egentlig inde i en sprogmodel? En sprogmodel er et computerprogram, der laver tekst og kan regne opgaver. Den er bygget af lag, lidt som etager i et hus. Teksten passerer fra bund til top. Her kan man skelne otte former for ræsonnement fra hinanden. Signalet er klarest i de midterste lag, altså midt i huset.

Det er forskere fra KAIST og Naver AI Lab i Sydkorea, der har undersøgt det. De lod tre modeller løse matematikopgaver trin for trin. Det var Qwen2.5-7B, Qwen3-8B og Gemma4-31B. De delte løsningerne op i bidder, lidt som bidder af et puslespil. Så lod de modellen GPT-5 sætte en mærkat på hver bid. Mærkaten var en af otte operationer. Det var blandt andet udtræk, altså at hente noget ud af opgaven, nedbrydning, altså at dele noget stort i småt, formelgenkaldelse, altså at huske en regel, deduktion, altså at slutte sig til noget, og beregning, altså at regne. Mønsteret holdt på tværs af alle tre modeller.

Mon forskellen bare skyldes ordene? Det ser ikke sådan ud. En klassifikator, altså et lille gætteprogram, der kun så på ordene i bidderne, klarede sig dårligere end en, der læste modellernes indre tilstande. Indre tilstande er modellens egne indre noter undervejs. Placeringen i løsningen, altså om biddet lå først eller sidst, forklarede heller ikke forskellen. De indre tilstande rummer altså viden om typen af trin, som ikke står direkte i ordene. Det gælder selv for ens ord. Småord som »a«, »is« og »the« optræder i mange slags trin. I de tidlige lag ligger de blandet sammen, som knapper i en skuffe. I de midterste og sene lag deles de op efter den operation, de indgår i, som når knapperne sorteres i rum. Samme ord får altså en anden indre repræsentation, alt efter hvad modellen laver.

Redaktionel illustration til „Vi kigger AI over skulderen, mens den tænker“
Genereret illustration · ikke et fotografi fra historien

Otte former for ræsonnement kan skilles fra hinanden inde i sprogmodeller. Signalet er klarest i de midterste lag.

Forskere fra KAIST og Naver AI Lab i Sydkorea lod tre modeller løse matematikopgaver trin for trin. Det var Qwen2.5-7B, Qwen3-8B og Gemma4-31B. De delte løsningerne op i bidder og lod GPT-5 sætte en mærkat på hver bid med en af otte operationer, blandt andet udtræk, nedbrydning, formelgenkaldelse, deduktion og beregning. Mønsteret holdt på tværs af alle tre modeller.

Forskellen skyldes ikke ordvalg alene. En klassifikator, der kun så på ordene i bidderne, klarede sig dårligere end en, der læste modellernes indre tilstande. Placeringen i løsningen forklarede heller ikke forskellen. De indre tilstande rummer altså viden om typen af trin, som ikke står direkte i ordene.

Selv ens ord ser forskellige ud indeni. Småord som »a«, »is« og »the« optræder i mange slags trin. I de tidlige lag ligger de blandet sammen. I de midterste og sene lag deles de op efter den operation, de indgår i. Samme ord får altså en anden indre repræsentation, alt efter hvad modellen laver.

Kilder

  1. AI models' written reasoning steps correspond to distinct internal patterns, a new study finds the-decoder.com
Produktionshistorie
  1. Radar Signal ? af 100 · spredning 1 kilder
  2. Vurdering Nyheds 3/5 — ny forskning i ræsonnering med betydning for modelforståelse
  3. Skrevet Model: deepseek-v4-flash · temperatur 0.4
  4. Overskrift 5 kandidater, valgt af deepseek-v4-flash
  5. Korrektur 1 zen · 5 rettelser
  6. Billede Genereret af gemini-2.5-flash-image
  7. Vedtagelse ainews-auto-v3 · score 0.4374