Spring til indhold
AiNews.dkDanske nyheder om Kunstig Intelligens

Værktøjer

AI-agenter lyder rigtigt, men fuldfører ikke opgaven

Ny guide flytter fokus fra enkelte funktionskald til fuldførelse af arbejdskæder.

1 kildeVedtaget af NIel AutopilotRettet 22. september 2026 kl. 01.11

Læs i dit tempo

Kort

NVIDIA har udgivet en guide til at evaluere AI-agenter, der fokuserer på hele opgaver frem for enkelte svar. Det betyder noget, fordi traditionel scoring ikke viser, om arbejdet faktisk blev fuldført. Nu opfordres udviklere til at måle på opgavens resultat i et live-miljø.

Begynder

NVIDIA har udgivet en guide til at evaluere AI-agenter. AI står for kunstig intelligens. En AI-agent er et system, der ikke bare svarer på spørgsmål, men faktisk udfører opgaver. Guiden flytter fokus fra enkelte svar til hele opgaver. Tidligere handlede evaluering om at score et enkelt funktionskald. Et funktionskald er én enkelt handling, hvor agenten bruger et værktøj. Nu handler det om at score en hel opgave.

Det centrale spørgsmål er, om agenten kan udføre en hel kæde af arbejde. Det kan for eksempel være dusinvis af værktøjskald, der kommer efter hinanden. Et værktøjskald er, når agenten bruger et eksternt værktøj. Det kan for eksempel være at slå noget op i en database eller sende en besked. Og det skal ske mod et live-miljø. Et live-miljø er et rigtigt, kørende system — ikke en testopsætning. Det er som at øve sig i rigtig trafik i stedet for i en simulator. Hvis et trin fejler, skal agenten kunne komme sig og fortsætte.

NVIDIA skriver: »At score, om modellen lyder rigtigt, fortæller dig næsten intet om, hvorvidt arbejdet blev færdigt.« Hvad betyder det i praksis? Jo, at man ikke kun skal vurdere, om agentens svar lyder fornuftigt. Man skal vurdere, om opgaven faktisk blev løst. Det er som at bedømme en medarbejder på, om projektet blev leveret til tiden — ikke på, om de sagde de rigtige ting undervejs. Traditionel scoring ser på modeloutput, altså det, modellen siger eller skriver. Men det fanger ikke, om arbejdet blev fuldført. Derfor skal evaluering følge hele opgaven, fra første værktøjskald til endelig fuldførelse.

Guiden er udgivet på NVIDIAs blog for udviklere og henvender sig til udviklere, der skal idriftsætte agenter i produktion. At idriftsætte i produktion betyder, at agenten skal bruges i virkeligheden, ikke kun i test. NVIDIA understreger, at evaluering skal ske mod et live-miljø, hvor agenten skal kunne håndtere fejl undervejs. Pointen er, at en agent, der lyder rigtigt, ikke nødvendigvis får arbejdet gjort. Derfor bør udviklere designe evalueringer, der måler på opgavens resultat, ikke på modellens formuleringer. NVIDIA beskriver det som en nødvendig udvikling.

AiNews' genererede delekort for „AI-agenter lyder rigtigt, men fuldfører ikke opgaven“
Genereret motiv i AiNews' radarsprog · ikke et fotografi fra historien

NVIDIA har udgivet en guide til evaluering af AI-agenter, der flytter fokus fra enkelte svar til hele opgaver.

Ifølge guiden er det centrale spørgsmål, om agenten kan udføre en kæde af arbejde på tværs af dusinvis af sekventielle værktøjskald mod et live-miljø – og komme sig, når et trin fejler.

'At score, om modellen lyder rigtigt, fortæller dig næsten intet om, hvorvidt arbejdet blev færdigt,' skriver NVIDIA.

Derfor er evaluering af agenter nødt til at udvikle sig fra at score et enkelt funktionskald til at score en hel opgave. Guiden er udgivet på NVIDIAs developer-blog og henvender sig til udviklere, der skal idriftsætte agenter i produktion.

NVIDIA understreger, at evaluering skal ske mod et live-miljø, hvor agenten skal kunne håndtere fejl undervejs. Traditionel scoring af modeloutput fanger ikke, om arbejdet rent faktisk blev fuldført. Det kræver i stedet en evaluering, der følger hele opgaven fra værktøjskald til fuldførelse.

Pointen er, at en agent, der lyder rigtigt, ikke nødvendigvis får arbejdet gjort. Derfor bør udviklere designe evalueringer, der måler på opgavens resultat, ikke på modellens formuleringer. NVIDIA beskriver det som en nødvendig udvikling.

Det er uklart: Vi har kun haft adgang til uddraget af NVIDIAs blogindlæg, ikke de konkrete anbefalinger og værktøjer.

Kilder

  1. How to Evaluate AI Agents From Tool Calls to Task Completion developer.nvidia.com
Produktionshistorie
  1. Radar Signal ? af 100 · spredning 1 kilder
  2. Vurdering Nyheds 3/5 — Praktisk guide til evaluering af AI-agenter, relevant for byggere.
  3. Skrevet Model: deepseek-v4-flash · temperatur 0.4
  4. Overskrift 5 kandidater, valgt af deepseek-v4-flash
  5. Korrektur 1 zen · 3 rettelser
  6. Vedtagelse ainews-auto-v3 · score 0.4374