Sprogmodeller får nu evnen til at se og høre
Version 5.18.0 tilføjer blandt andet Nvidias model til at afgøre, hvem der taler, og en model, der ræsonnerer over tekst, billeder og lyd.
Læs i dit tempo
Kort
Et populært værktøj til kunstig intelligens har fået fire nye modeller til tale, lyd, billeder og video samt tekstsøgning. Det betyder noget, fordi udviklere nu lettere kan se hvem der talte, forstå flere medier samlet og søge bedre i tekst. Nu kan alle bruge modellerne direkte i det fælles værktøj til at bygge nye programmer.
Begynder
Der er kommet fire nye modeller i Transformers 5.18.0. En model er her et program der har lært af eksempler. Mon du kender et rodet middagsselskab på optagelse? Den største nyhed til lyd er Nemotron 3 Diarization. Diarization betyder at afgøre hvem der talte hvornår i lyd fra virkeligheden. Modellen klarer op til otte talere. Den sorterer dem efter hvem der høres først. Den kan køre løbende mens lyden kommer ind. Det hedder streaming på engelsk. Den kan også køre bagefter på en hel fil. Det hedder offline inferens på engelsk. Inferens betyder at bruge det lærte til at gætte. Et enkelt gemt trænet eksemplar klarer det hele. Det hedder et checkpoint på engelsk. Det dækker en forsinkelse fra 80 millisekunder til 30,4 sekunder. Forsinkelse er ventetiden fra tale til svar. Opløsningen kan sættes i trin på 10 millisekunder. Opløsning er hvor fine tidsskiver lyden skæres i. Med opdelt inferens er der ingen øvre grænse for længden. Opdelt betyder at lang lyd deles i bidder først.
Nvidia står bag NemotronH Omni. Tænk på en ven der både lytter, ser og læser på en gang. Det er en enkelt autoregressiv model til fælles ræsonnement over tekst, billeder, video og lyd. Autoregressiv betyder at den gætter et stykke ad gangen. Ræsonnement betyder at tænke sig frem trin for trin. Den kobler NemotronH sprogmodellen med en billedoversætter. En billedoversætter hedder en billedencoder på engelsk. Den hedder RADIO. Den bruger også en valgfri Parakeet lydoversætter. Billedstykker og videostykker lægges ind i sprogmodellens indlejring. Indlejring er modellens indre sprog af tal. Det sker ved positionerne mærket <image> og <video>. Lydklip lægges ind samme sted ved positionen mærket <audio>. Fra NAVER kommer HyperCLOVAX Vision Version 2, skrevet V2. Modellen kobler HyperCloVA X sprogmodellen med en Qwen 2.5 billedoversætter. Billedoversætteren er til syn og sprog. Syn og sprog forkortes VL på engelsk. Det fulde navn skrives Qwen2.5-VL. Den tager tekst, billeder og video. Den ræsonnerer i trin med indbyggede tænketegn. Tegnene skrives som <think>...</think>.
Sidste tilføjelse er Generelle Tekst Indlejringer, forkortet GTE på engelsk. Forestil dig et bibliotek der sorterer efter mening. Det er en koder der ligner en kendt sprogforståer. Sprogforståeren hedder på engelsk Bidirectional Encoder Representations from Transformers, forkortet BERT. Den bruger rotation til rækkefølge i stedet for faste tal for positioner. Metoden hedder på engelsk Rotary Position Embedding, forkortet RoPE. Den bruger også et flerlags netværk med låger. Netværket hedder på engelsk Multi-Layer Perceptron, og med låger hedder det gated. Den bruger normalisering efter hvert restled. Et restled er en genvej uden om et regnetrin. Normalisering holder tallene rolige. Arkitekturen ligger bag Alibabas checkpoints af typen gte. Den ligger også bag Snowflakes snowflake-arctic-embed-m-v2.0.

Fire nye modeller er landet i Transformers 5.18.0.
Største nyhed for lyd er Nemotron 3 Diarization. Modellen afgør, hvem der talte hvornår i lyd fra virkeligheden. Den klarer op til otte talere og sorterer dem efter, hvem der høres først. Den kører både streaming og offline inferens. Ét checkpoint dækker forsinkelse fra 80 ms til 30,4 s. Opløsningen kan sættes i trin på 10 ms. Med opdelt inferens er der ingen øvre grænse for lydens længde.
Nvidia står bag NemotronH Omni. Det er én autoregressiv model til fælles ræsonnement over tekst, billeder, video og lyd. Den kobler NemotronH-sprogmodellen med en RADIO-billedencoder og en valgfri Parakeet-lydencoder. Billed- og videostykker lægges ind i sprogmodellens indlejring ved <image>- og <video>-positioner. Lydklip lægges ind på samme sted ved <audio>-positioner.
Fra NAVER kommer HyperCLOVAX Vision V2. Modellen kobler HyperCloVA X-sprogmodellen med en Qwen2.5-VL-billedencoder. Den tager tekst, billeder og video. Den ræsonnerer i trin med indbyggede tænke-tokens (<think>...</think>).
Sidste tilføjelse er GTE. Det er en BERT-lignende encoder med RoPE i stedet for absolutte positionsindlejringer, gated MLP og normalisering efter hvert restled. Arkitekturen ligger bag Alibabas gte-checkpoints og Snowflakes snowflake-arctic-embed-m-v2.0.
Det er uklart: Releasens rettelser og breaking changes er ikke gennemgået i detaljer.
Kilder
- Release 5.18.0 github.com
Produktionshistorie
- Radar Signal ? af 100 · spredning 1 kilder
- Vurdering Nyheds 3/5 — Ny Transformers-udgivelse er nyt værktøj til udviklere.
- Skrevet Model: deepseek-v4-flash · temperatur 0.4
- Overskrift 5 kandidater, valgt af chat.dk
- Korrektur 1 zen · 4 rettelser
- Korrektur 2 chatdk · 4 rettelser
- Vedtagelse ainews-auto-v3 · score 0.4389