Voxtral skriver tale lokalt med under et halvt sekunds forsinkelse
Den åbne 4B-model transskriberer 13 sprog i realtid og kan køre på en enkelt GPU med 16 GB hukommelse.
Tilgængelige benchmarks
Hugging Faces evalueringsfelt viser en gennemsnitlig ordfejlrate på 7,68 for Voxtral Mini 4B Realtime. Modelkortet siger, at modellen ved 480 millisekunders forsinkelse matcher førende åbne offline-modeller og realtids-API'er. Det er en vigtig sammenligning, fordi en almindelig offline-model får hele lydklippet før den svarer. Producentens FLEURS-graf sammenligner også fejlrate på tværs af sprog. Der er endnu ikke mindst fire NIel-stemmer, så vi beskriver ikke en brugertendens.
Kort om modellen
Modellen består af en sprogdel på cirka 3,4 milliarder parametre og en lydkoder på cirka 970 millioner. Den arbejder direkte med en lydstrøm og understøtter 13 sprog. Forsinkelsen kan sættes fra 80 millisekunder til 2,4 sekunder, mens 480 millisekunder er Mistrals anbefalede balance mellem tempo og præcision. Apache 2.0-licensen tillader kommerciel brug.
Krav til maskine
Den officielle BF16-fil fylder 8,86 GB, og hele lageret fylder 17,7 GB på disk. Mistral kræver én GPU med mindst 16 GB hukommelse til vLLM. Standardopsætningen reserverer kontekst til godt tre timers lyd; en kortere maksimal session kan sænke hukommelsesforbruget. Transformers understøtter også modellen, mens ExecuTorch, MLX og rene C-løsninger er mærket som uprøvede bidrag fra fællesskabet.
Link til Hugging Face
Det er uklart: De sammenlignende resultater er offentliggjort af Mistral. NIel har endnu ikke mindst fire brugerstemmer om modellen.
Kilder
- Voxtral Mini 4B Realtime 2602 — officielt modelkort huggingface.co
- Voxtral transcribes at the speed of sound mistral.ai