Open source-AI får nu adgang til 780 milliarder parametre
HYV4 er en blanding af eksperter med 780 milliarder parametre og et kontekstvindue på 1 million tokens. Udgivelsen inkluderer også tale- og billedmodeller.
Læs i dit tempo
Kort
Hugging Face Transformers 5.17.0 tilføjer nye AI-modeller, herunder en kæmpe sprogmodel med 780 milliarder parametre og systemer til tale og billeder.
Det giver udviklere adgang til avancerede funktioner som meget lange tekster, naturlig talesyntese og talegenkendelse.
Nu kan man downloade og afprøve modellerne direkte i biblioteket.
Begynder
Den nye version af Hugging Face Transformers – et værktøj til at køre kunstig intelligens – kan nu håndtere en model ved navn HYV4. En model er et program, der har lært at løse opgaver ved at justere milliarder af små knapper, kaldet parametre. HYV4 har 780 milliarder parametre. Det lyder uoverskueligt, men den er bygget smart: For hvert stykke tekst aktiverer den kun 49 milliarder parametre. Det svarer til et kæmpe firma, hvor hver opgave kun går gennem et par specialister ud af mange. Hvert stykke tekst sendes gennem 8 ud af 256 eksperter plus én fælles ekspert. Modellen kan også se på 1 million stykker tekst ad gangen. Det er et kontekstvindue på størrelse med en hel bogserie. Arkitekturen kombinerer flere opmærksomhedsteknikker – måder for modellen at fokusere på det vigtigste i teksten. Blandt dem er Multi-head Latent Attention, DeepSeek Sparse Attention, Gated MLA med lærbare attention sinks (særlige steder i teksten, som modellen altid kan kigge på) og Independent Hyper-Connections. De frigivne filer indeholder også vægte til at forudsige flere stykker tekst ad gangen. Transformers selv bruger dem ikke, men andre programmer kan bruge dem til spekulativ afkodning, hvor modellen gætter flere trin frem og dermed arbejder hurtigere.
Der er også kommet VibeVoice, et system til talesyntese med flere talere. Det forudsiger lydbidder ved gradvist at forfine dem, indtil de lyder naturlige. Det er bygget i en struktur, der ligner en stor sprogmodel. VibeVoice er designet til at fange den naturlige »vibe« i samtaler. Derfor egner det sig godt til podcasts og lydbøger med flere deltagere. NeoMME er en familie af encoder-modeller fra H Company på 260 og 800 millioner parametre. En encoder er den del af en model, der læser inputtet og gør det forståeligt for resten af systemet. NeoMME behandler tekst og billeder i én samlet enhed uden et separat synsmodul. En særlig variant, NeoMME-Retriever, er finjusteret til at finde dokumenter ud fra billeder. Den laver to slags indlejringer – måder at repræsentere indhold på, så det kan sammenlignes. Den ene sammenligner dele af indholdet hver for sig, den anden laver en samlet repræsentation.
Fun-ASR-Nano fra Alibaba er en talegenkendelsesmodel med 800 millioner parametre. Den er blandt de bedste på kinesisk, engelsk og japansk. Den kan også forstå syv kinesiske dialekter og 26 regionale accenter. Den kan håndtere hotwords – bestemte ord, man vil sikre sig bliver genkendt. Og den skriver tegnsætning uden hjælp fra en anden model. KimiLinear fra Moonshot AI er en hybrid lineær opmærksomhedsarkitektur. I de fleste lag bruger den Kimi Delta Attention, hvor hver informationskanal har sin egen glemmeport, der styrer, hvad der skal huskes. Hvert fjerde lag bruger i stedet fuld opmærksomhed med Multi-head Latent Attention. Endelig er der Canary-1B-v2, en model til talegenkendelse og tale-til-tekst-oversættelse. Den genbruger Fast Conformer-encoder'en fra Parakeet.

Hugging Face Transformers 5.17.0 understøtter nu HYV4, en MoE-model med 780 milliarder parametre. Modellen aktiverer kun 49 milliarder parametre per token og har et kontekstvindue på 1 million tokens. HYV4 bruger en blanding af eksperter, hvor hvert token sendes gennem 8 af 256 eksperter plus en delt ekspert. Arkitekturen kombinerer Multi-head Latent Attention, DeepSeek Sparse Attention, Gated MLA med lærbare attention sinks og Independent Hyper-Connections. De frigivne checkpoints indeholder også vægte til multi-token prediction, som Transformers ikke udfører, men som andre runtimes kan bruge til spekulativ afkodning.
Udgivelsen tilføjer også VibeVoice, et framework til talesyntese med flere talere. VibeVoice bruger next-token diffusion i en LLM-struktur og er designet til at fange den naturlige 'vibe' i samtaler. Det er særligt velegnet til podcasts og lydbøger med flere deltagere.
NeoMME er en familie af encoder-modeller på 260 og 800 millioner parametre fra H Company. Modellerne behandler tekst og billeder i én Transformer-encoder uden et separat visionsmodul. NeoMME-Retriever er en finjusteret variant til visuel dokumenthentning, der producerer både late-interaction og dense indlejringer.
Fun-ASR-Nano er en talegenkendelsesmodel fra Alibaba med 800 millioner parametre. Den opnår state-of-the-art-resultater på kinesisk, engelsk og japansk og understøtter syv kinesiske dialekter og 26 regionale accenter. Modellen kan også håndtere hotwords og udskriver tegnsætning uden en separat model.
KimiLinear er en hybrid lineær attention-arkitektur fra Moonshot AI. Den bruger Kimi Delta Attention i de fleste lag, hvor hver nøglekanal har sin egen forget-gate, og hvert fjerde lag bruger fuld attention med Multi-head Latent Attention. Endelig er der Canary-1B-v2, en model til talegenkendelse og tale-til-tekst-oversættelse, der genbruger Fast Conformer-encoder fra Parakeet.
Kilder
- Release 5.17.0 github.com
Produktionshistorie
- Radar Signal ? af 100 · spredning 1 kilder
- Vurdering Nyheds 4/5 — Ny udgivelse af transformers-biblioteket med opdateringer for udviklere.
- Skrevet Model: deepseek-v4-flash · temperatur 0.4
- Overskrift 5 kandidater, valgt af deepseek-v4-flash
- Korrektur 1 zen · 4 rettelser
- Billede Genereret af gemini-2.5-flash-image
- Vedtagelse ainews-auto-v3 · score 0.4408