Spring til indhold
AiNews.dkDanske nyheder om Kunstig Intelligens

Topnyheder

Google lader dig afbryde AI midt i en samtale

De to modeller, Gemini 3.8 Live og 3.8 Live Extended Thinking, ligner OpenAIs GPT-Live-familie og kan afbrydes under en samtale.

1 kildeVedtaget af NIel AutopilotRettet 16. september 2026 kl. 03.33
Læst op af en AI-stemme

Læs i dit tempo

Kort

Google har udgivet to nye tale-til-tale-modeller, der tager tale ind og giver tale ud. Det betyder noget, fordi de kan afbrydes midt i en samtale, og en webgrænseflade gør dem nemme at afprøve i browseren. Nu kan udviklere bruge Googles vejledning og en direkte lydforbindelse til at bygge deres egne tovejs lydapplikationer.

Begynder

Google har netop præsenteret to nye tale-til-tale-modeller, som de kalder Gemini 3.8 Live og 3.8 Live Extended Thinking. De er en del af Gemini 3.8-familien. Forestil dig, at du taler med en ven i telefonen i stedet for at skrive breve frem og tilbage. Det er forskellen på de her modeller og de tekstbaserede sprogmodeller, vi kender. De tager tale ind og giver tale direkte tilbage, så samtalen føles naturlig og flydende.

En udvikler ved navn Simon Willison har bygget en hjemmeside, hvor man kan afprøve modellerne i sin browser. Det særlige er, at man kan afbryde modellen midt i en sætning, præcis som når man taler med et andet menneske. For at lave værktøjet fik han hjælp af en anden AI-model, GPT-6 Astra Extra High, som skrev koden ud fra Googles dokumentation. På hjemmesiden kan man vælge, hvilken stemme modellen skal have, og man kan skrive en besked til systemet, før samtalen går i gang. Det kræver ingen installation af ekstra programmer, fordi al lyd behandles direkte i browseren.

Teknisk set foregår det hele gennem noget, der kaldes en WebSocket-forbindelse. Du kan tænke på det som en konstant åben telefonlinje mellem din browser og Googles servere, hvor lyden sendes frem og tilbage i begge retninger samtidig. Det er en del af Googles Generative Language API, som er et sæt regler for, hvordan programmer kan tale med Googles tjenester. Willison har også delt et link til Googles egen vejledning, så andre kan lære at sætte den samme slags tovejs lydstrøm op. Hele systemet er bygget til at håndtere en løbende samtale uden forsinkelser, hvilket er det, der gør oplevelsen så levende.

Redaktionel illustration til „Google lader dig afbryde AI midt i en samtale“
Genereret illustration · ikke et fotografi fra historien

Google har udgivet to nye tale-til-tale-modeller (speech-to-speech). De hedder Gemini 3.8 Live og 3.8 Live Extended Thinking og er en del af Gemini 3.8-familien. Modellerne ligner OpenAIs GPT-Live-familie. Hvor tekstbaserede sprogmodeller tager tekst ind og giver tekst ud, tager disse modeller tale ind og giver tale ud.

Modellerne kan afbrydes midt i en samtale. Det viser en webgrænseflade, som Simon Willison har bygget for at prøve dem. Han fik GPT-6 Astra Extra High til at bygge værktøjet ud fra Googles dokumentation.

Webgrænsefladen lader brugeren vælge model og stemmepreset, indtaste en valgfri systembesked og starte en talesamtale i browseren. Den bruger ingen biblioteker, men forbinder direkte til Googles WebSocket-endepunkt og bruger Web Audio API til både optagelse og afspilning. Det betyder, at al lyd behandles i browseren uden ekstra software.

Willison har også linket til Googles tutorial for at komme i gang med WebSockets-API'et. Tutorialen forklarer, hvordan man sætter en tovejs lydstrøm op til modellerne. WebSocket-endepunktet er en del af Googles Generative Language API og bruger metoden BidiGenerateContent til at håndtere den løbende samtale.

Kilder

  1. Gemini Live audio simonwillison.net
Produktionshistorie
  1. Radar Signal ? af 100 · spredning 1 kilder
  2. Vurdering Nyheds 4/5 — Ny funktion i Gemini Live, relevant for AI-udviklere.
  3. Skrevet Model: deepseek-v4-flash · temperatur 0.4
  4. Overskrift 5 kandidater, valgt af deepseek-v4-flash
  5. Korrektur 1 zen · 1 rettelser
  6. Billede Genereret af gemini-2.5-flash-image
  7. Vedtagelse ainews-auto-v3 · score 0.4328