Tencent udgiver Hy4 Preview med ræsonnement i to niveauer
Hy4 Preview øger modelstørrelsen og kontekstvinduet markant i forhold til forgængeren Hy3.
Læs i dit tempo
Kort
Tencent har lanceret Hy4 Preview, en ny sprogmodel med 770 milliarder parametre (byggesten). Den er markant større end tidligere versioner og kan behandle langt mere tekst ad gangen. Modellen kan nu styre sin logiske tænkning via forskellige indstillinger for ræsonnement.
Begynder
Tencent har præsenteret Hy4 Preview. Det er en såkaldt »open weight«-model, hvilket betyder, at dens indre opskrift er tilgængelig for alle. Modellen er enorm med 770 milliarder parametre. Man kan tænke på parametre som små forbindelser i en hjerne, der gemmer viden. Kun 49 milliarder af disse er aktive ad gangen, ligesom når vi kun bruger en bestemt del af hjernen til en specifik opgave. Den fylder 1,56 terabyte (TB) på platformen Hugging Face. Modellen forstår kun tekst og kan ikke håndtere billeder.
Det er et stort spring fra den tidligere udgave, Hy3, fra juli. Den gamle model havde 295 milliarder parametre, hvoraf 21 milliarder var aktive. Den fyldte også betydeligt mindre med 598 gigabyte (GB). Samtidig er det »kontekstvindue« udvidet markant. Kontekstvinduet fungerer som modellens korttidshukommelse og bestemmer, hvor meget tekst den kan overskue på én gang. Det er steget fra 256.000 til 1 million tokens, som er de små tekststykker, modellen læser og skriver.
Nu kan modellen også ræsonnere, hvilket betyder, at den tænker over tingene, før den svarer. Man kan vælge mellem »high«, som er standarden, og »no_think«, hvor tankevirksomheden slukkes helt. For at være mest mulig effektiv skriver modellen sine skjulte tanker på et forkortet engelsk. Da den skulle lave en Scalable Vector Graphics (SVG)-fil, som er et billede bygget af kode, af en pelikan på en cykel, overvejede den i sin tankeproces at give fuglen en hjelm. Den besluttede dog at lade være, så pelikanens hoved ikke blev dækket.
Vil du have, at jeg forklarer nærmere, hvordan forskellen mellem aktive og totale parametre påvirker modellens hastighed?

Hy4 Preview er en ny open weight-model fra Tencent med 770 milliarder parametre. Modellen fylder 1,56 TB på Hugging Face og har 49 milliarder aktive parametre. Versionen understøtter udelukkende tekstinput og har ingen funktioner til billedbehandling.
Modelstørrelsen er steget betydeligt siden udgivelsen af Hy3 i juli. Den tidligere model havde 295 milliarder parametre, heraf 21 milliarder aktive. Hy3 fyldte 598 GB i sammenligning med den nye models 1,56 TB.
Kontekstvinduet er udvidet til 1 million tokens. Dette er en markant stigning fra Hy3, som understøttede 256.000 tokens.
Der er indført to niveauer for ræsonnement: »high« og »no_think«. »High« er modellens standardindstilling, mens »no_think« deaktiverer ræsonnementet helt.
Ræsonnement-spor i modellen benytter et forkortet engelsk sprog. Dette valg er sandsynligvis truffet for at øge effektiviteten i brugen af tokens i den skjulte tekst.
En test af modellen med en prompt om at generere en SVG-fil af en pelikan på en cykel viser processen i praksis. I den skjulte tankeproces overvejer modellen, om pelikanen skal have hjelm på for at understøtte cykeltemaet, men forkaster senere idéen, da det kan dække for hovedet.
Kilder
- Introducing Hy4 Preview simonwillison.net
Produktionshistorie
- Radar Signal ? af 100 · spredning 1 kilder
- Vurdering Nyheds 5/5 — Lancering af ny model-preview (Hy4).
- Skrevet Model: mimo-v2.5-free · temperatur 0.4
- Overskrift 5 kandidater, valgt af chat.dk
- Korrektur 1 zen · 2 rettelser
- Vedtagelse ainews-auto-v3 · score 0.3642