Spring til indhold
AiNews.dkDanske nyheder om Kunstig Intelligens

Topnyheder

Din samtale bliver en del af AI'ens hukommelse

Forslaget genererer vægte fra live data og opdaterer dem løbende, så viden fra samtalen bliver i modellen i stedet for at forsvinde med prompten.

2 kilderVedtaget af NIel AutopilotRettet 17. september 2026 kl. 20.53
Læst op af en AI-stemme

Læs i dit tempo

Kort

Forskere foreslår en sprogmodel, der under brug opdaterer sine indre parametre med nye data.

Det betyder, at modellen kan huske fakta og rettelser uden at bruge den midlertidige hukommelse, hvilket sparer kræfter og giver bedre generalisering.

Papiret er kun et design uden resultater, så arkitekturen skal nu testes.

Begynder

Dagens sprogmodeller — de programmer, der kan skrive tekst og føre samtaler — har en grundlæggende begrænsning: De kan ikke lære noget nyt, mens de er i brug. Modellens viden sidder i noget, der kaldes vægte. Vægtene er de indre indstillinger, der afgør, hvordan modellen reagerer på input. De bliver fastfrosset, når træningen er slut. Hvis du fortæller modellen en kendsgerning eller retter en fejl, bliver oplysningen ikke gemt i vægtene. Den lægges i stedet i prompten — den tekst, du sender til modellen. Der skal den læses igen for hvert eneste svar. Og den kasseres, når samtalen slutter. Det er lidt som at tale med en person, der skriver dine oplysninger på en seddel, læser sedlen for hvert svar og smider den væk, så snart I er færdige.

Forslaget fra forskerne går ud på at lade modellen lære af live data ved at skrive dem direkte ind i vægtene. Arkitekturen hedder Infinite-Parameter Large Language Model (forkortet LLM) og er beskrevet i et nyt papir på arXiv, et åbent arkiv for forskningsartikler. Den bygger på en teknik kaldet Mixture of Experts. Her aktiverer modellen kun en lille brøkdel af en enorm samling af indre indstillinger for hvert token. Et token er et lille stykke tekst, ofte et ord eller en del af et ord. I stedet for at hente vægte fra en fast samling lader forskerne et kompakt hypernetværk skabe en low-rank-modulation af et fælles basisnetværk. Et hypernetværk er et lille hjælpenetværk, der genererer indstillinger til hovednetværket. En low-rank-modulation er en kompakt justering af de eksisterende vægte. Justeringen laves ud fra de data, der kommer ind, mens modellen kører. De såkaldte feed-forward-vægte — de vægte, der behandler informationen trin for trin gennem netværket — bliver dermed genereret fra live data frem for hentet fra en fast samling.

Tidligere vægtgeneratorer — systemer, der genererer vægte ud fra input — læste konteksten én gang og frøs derefter. Forskerne gør noget andet. De lader en bayesiansk fordeling over generatorens latente kode opdatere sig løbende. En bayesiansk fordeling er en måde at holde styr på usikkerhed og opdatere sin forståelse, efterhånden som nye oplysninger kommer ind. Tænk på en detektiv, der løbende justerer sin teori for hvert nyt spor. Den latente kode er en skjult repræsentation, som generatoren arbejder med. Fordelingen opdateres gennem hele forløbet. Den effektive vægt udledes fra den udviklende fordeling. Det lagrede fodaftryk — den plads, modellen fylder på disken — forbliver fast. Men de vægte, modellen kan bygge, er ifølge forskerne uendelige.

Forskerne skriver, at viden i vægtene sparer regnekraft. Den frigør også kontekstvinduet — den mængde tekst, modellen kan holde styr på ad gangen. Viden i vægtene varer ved fra svar til svar. Og den kan generalisere bedre end in-context learning, hvor modellen lærer af eksempler i prompten. Papiret specificerer desuden en evalueringsprotokol — en fastlagt plan for, hvordan arkitekturen skal testes. Protokollen tester arkitekturen mod in-context learning og retrieval, hvor modellen henter relevant information fra en database. Der er endnu ingen resultater. Forslaget er et design, ikke en afprøvet model.

Redaktionel illustration til „Din samtale bliver en del af AI'ens hukommelse“
Genereret illustration · ikke et fotografi fra historien

Forskere foreslår en sprogmodel, der lærer af live data ved at skrive dem ind i sine egne vægte. Arkitekturen, kaldet Infinite-Parameter LLM, er beskrevet i et nyt papir på arXiv.

Dagens sprogmodeller kan ikke lære af de data, de møder i brug. Vægtene er frosset efter træning, så viden fra en samtale — fakta brugeren oplyser, eller rettelser de giver — lægges i prompten, læses igen for hvert svar og kasseres, når samtalen slutter.

Infinite-Parameter LLM bygger på MoE-arkitekturer (Mixture of Experts), der aktiverer en brøkdel af en enorm parameterbank for hvert token. I stedet for en fast bank genererer et kompakt hypernetværk (hypernetwork) en low-rank-modulation af et fælles basisnetværk ud fra de data, der kommer ind under kørslen. Feed-forward-vægtene bliver dermed genereret fra live data frem for hentet fra en fast samling.

Hvor tidligere vægtgeneratorer læser konteksten én gang og fryser, fører forskerne en bayesiansk fordeling over generatorens latente kode og opdaterer den løbende. Den effektive vægt udledes fra den udviklende fordeling gennem hele sessionen. Det lagrede fodaftryk forbliver fast, mens de vægte, modellen kan kompilere, ifølge forskerne, er uendelige.

Viden i vægtene sparer regnekraft, frigør kontekstvinduet, varer ved fra svar til svar og kan generalisere bedre end in-context learning, skriver forskerne.

Papiret specificerer en evalueringsprotokol, der tester arkitekturen mod in-context learning og retrieval. Der er endnu ingen resultater — forslaget er et design, ikke en afprøvet model.

Det er uklart: Kun abstractet er brugt; papiret er ikke fagfællebedømt, og der er ingen målte resultater.

Kilder

  1. Infinite-Parameter LLMs: Generating and Adapting Weights from Live Data arxiv.org
  2. Infinite-Parameter LLMs: Generating and Adapting Weights from Live Data https:// arxiv.org/abs/2609.18842 # arxiv # llm… mastodon.social
Produktionshistorie
  1. Radar Signal ? af 100 · spredning 2 kilder
  2. Vurdering Nyheds 4/5 — Ny forskning i dynamiske vægte, relevant for LLM-arkitektur.
  3. Skrevet Model: deepseek-v4-flash · temperatur 0.4
  4. Overskrift 5 kandidater, valgt af deepseek-v4-flash
  5. Korrektur 1 zen · 2 rettelser
  6. Billede Genereret af gemini-2.5-flash-image
  7. Vedtagelse ainews-auto-v3 · score 0.9433