Spring til indhold
AiNews.dkDanske nyheder om Kunstig Intelligens

Værktøjer

Ny version af AlphaAvatar integrerer lyd i hukommelsen

Version 0.6.6 introducerer event-drevet hukommelse, en fælles model for Qdrant og LanceDB og gør lyd til en del af den multimodale perception.

1 kildeRedigeret af Lars LouvreRettet 17. august 2026 kl. 19.53

Læs i dit tempo

Begynder

AlphaAvatar version 0.6.6 handler om at skabe bedre orden. Systemet bruger nu en fælles opskrift, en såkaldt kørsel eller »runtime«, på hvordan agenten skal opføre sig. For at holde styr på informationen er databaserne Qdrant og LanceDB – som er digitale lagre af information – nu samlet i én model. Det svarer til at have ét enkelt arkivsystem i stedet for flere forskellige, så alt data håndteres på samme måde.

Hukommelsen i systemet er blevet mere smidig og reagerer nu på begivenheder, som sker i nuet. Lyd bliver ikke længere blot lavet om til tekst. I stedet bliver lydbehandlingen betragtet som en observation med sin egen timing og sammenhæng, præcis som når vi ser noget med øjnene. Det betyder, at forskellige dele af systemet kan bruge lyden hverfor sig. Nogle dele omdanner tale til tekst, mens andre genkender, hvem der taler, eller opdaterer viden om personens identitet.

Systemet har nu fået tydeligere planer for, hvordan data strømmer igennem, og det kan huske oplevelser længere tilbage. Man har også gjort systemet mindre afhængigt af det specifikke program LiveKit, så det er mere fleksibelt. Selve avataren ved nu, hvad dens forskellige udvidelser – eller plugins – kan gøre. Den store sprogmodel fungerer som systemets hjerne, der tænker og tager beslutninger for at forbinde hukommelse, værktøjer og sanser i et modulært system, hvor delene kan udskiftes uafhængigt af hinanden.

Vil du have et konkret eksempel på, hvordan systemet bruger lyd som en observation i stedet for bare tekst?

AiNews' genererede delekort for „Ny version af AlphaAvatar integrerer lyd i hukommelsen“
Genereret motiv i AiNews' radarsprog · ikke et fotografi fra historien

AlphaAvatar v0.6.6 fokuserer på at skabe mere konsistente kontrakter for agenten og en fælles kørsel (runtime). Versionen introducerer en samlet model for databaserne Qdrant og LanceDB, så håndteringen af data er ensartet.

Hukommelsen i systemet er nu event-drevet og adaptiv. Audio-segmenter kan nu bruges som input til ENV Memory sammen med visuelle observationer. Det betyder, at lyd ikke længere blot behandles som en transskription til tekst, men som en observation med egen timing og kontekst.

Lydperceptionen følger nu samme princip som den visuelle perception. Det gør det muligt for forskellige komponenter at bruge lyden uafhængigt af hinanden. Transskription omdanner tale til tekst, mens talergenkendelse fastslår, hvem der taler, og Persona opdaterer identitetsoplysninger.

Systemet har fået mere eksplicitte skemaer for streams og observationer. Der er desuden indført en længere og konfigurerbar historik for perception. Projektet har også adskilt runtime-adfærd fra LiveKit for at gøre systemet mindre afhængigt af specifik software.

Selve avataren har nu adgang til beskrivelser af plugin-kapaciteter. Dette understøtter målet om at holde perception, hukommelse og værktøjer modulære. Sprogmodellen skal på denne måde fungere som det centrale lag for ræsonnement (reasoning) og beslutninger, der forbinder de forskellige moduler.

Kilder

  1. AlphaAvatar v0.6.6: event-driven multimodal memory, unified runtimes, and cleaner agent contracts discuss.huggingface.co
Produktionshistorie
  1. Radar Signal ? af 100 · spredning 1 kilder
  2. Vurdering Nyheds 5/5 — Ny version af agent-værktøj med konkrete tekniske opdateringer.
  3. Skrevet Model: mimo-v2.5-free · temperatur 0.4
  4. Vedtagelse Godkendt af Lars Louvre