Whisper-modellen gør stemme-agenter hakkende og klipper ord over
Whisper har en forsinkelse på op til 2 sekunder i live-scenarier, fordi modellen er bygget til filer og ikke til streaming.
Læs i dit tempo
Kort
Whisper skaber forsinkelser i live-apps, fordi den behandler lyd i blokke i stedet for løbende. Det medfører en hakkende brugeroplevelse, hvor ord bliver klippet over. Native streaming-modeller, der behandler lyd kontinuerligt, tilbyder en hurtigere og bedre løsning.
Begynder
Whisper skaber en forsinkelse på mellem 300 og 2000 millisekunder (tusindedele af et sekund) i live-systemer. Det sker, fordi Whisper er en batch-model. En batch-model fungerer lidt ligesom at vente med at fortælle en historie, indtil man har læst en hel side færdig, i stedet for at tale løbende. Modellen foretager en inferens, hvilket er selve beregningen af resultatet, i én gennemgang af hele lydstykket. For en digital stemme-assistent føles det hakkende, fordi ord bliver klippet over. Dette princip findes også i den originale Wav2Vec2.
Her findes der også native streaming-modeller, som er bygget til at behandle lyd kontinuerligt. De sender teksten ud, efterhånden som man taler. Disse modeller bruger et lille »lookahead«, som er et kort kig ind i fremtiden på 80 til 320 millisekunder, før de sender teksten. Det svarer til at lytte et splitsekund frem for at forstå sammenhængen bedre. Det gør dem hurtigere end pseudo-streaming, hvor systemet ofte skal gemme over 1000 millisekunder i en buffer, som er en midlertidig hukommelse, før det kan reagere.
Der findes endda en metode kaldet causal streaming. Her fjerner man kigget ind i fremtiden helt for at få det hurtigst mulige svar. Det er den hurtigste løsning, men den er typisk dårligere til at ramme rigtigt i teksten. Eksempler på native streaming-løsninger er NeMo FastConformer og Parakeet streaming. De giver en lavere forsinkelse end Whisper.cpp eller faster-whisper, da sidstnævnte blot forsøger at simulere streaming ved at bruge store blokke af lyd.
Vil du have, at jeg forklarer nærmere, hvordan forskellen på en buffer og et lookahead påvirker oplevelsen for brugeren?

Whisper skaber en forsinkelse på mellem 300 og 2000 millisekunder i live-applikationer. Det skyldes, at Whisper er en batch-model, der er forsøgt tilpasset til streaming. For en stemme-agent betyder det en hakkende brugeroplevelse, hvor ord bliver klippet over ved grænserne for lydstykkerne.
Batch-modeller behandler hele lydfilen eller en fast blok på én gang. Her kører modellen inferens i én gennemgang og returnerer hele teksten. Whisper og den originale Wav2Vec2 er bygget efter dette princip.
Native streaming-modeller behandler lyd kontinuerligt og sender tekst ud, efterhånden som talen ankommer. Disse modeller arbejder med en lille »lookahead« på 80 til 320 millisekunder, hvilket er den tid, modellen ser ind i fremtiden, før den sender tekst. Det gør det muligt at reagere hurtigere end pseudo-streaming, som ofte kræver en buffer på over 1000 millisekunder.
Causal streaming fjerner lookahead helt for at give det hurtigste svar. Denne metode er den hurtigste, men den er typisk dårligere til at ramme rigtigt i teksten.
NeMo FastConformer og Parakeet streaming er eksempler på native streaming-løsninger. De tilbyder en lavere latenstid end Whisper.cpp eller faster-whisper, som i stedet bruger store blokke af lyd for at simulere streaming.
Kilder
Produktionshistorie
- Radar Signal ? af 100 · spredning 1 kilder
- Vurdering Nyheds 4/5 — Teknisk sammenligning af ASR-modeller til mobiludvikling.
- Skrevet Model: mimo-v2.5-free · temperatur 0.4
- Overskrift 5 kandidater, valgt af chat.dk
- Korrektur 1 zen · 1 rettelser
- Korrektur 2 chatdk · 1 rettelser
- Vedtagelse Godkendt af Lars Louvre