Hurtig AI-søgning kræver ikke længere enorme serverparker
Ny åben encoder behandler tekst og billeder i ét skridt og halverer behovet for lagerplads til søgning i store dokumentmængder.
Læs i dit tempo
Kort
Der er udviklet en ny AI-model kaldet NeoMME, som kan gennemsøge dokumenter meget hurtigt. Den kombinerer tekst- og billedbehandling, hvilket gør søgninger dobbelt så hurtige og reducerer behovet for lagerplads markant. Projektet er nu udgivet som åben kildekode, så alle kan downloade og bruge det.
Begynder
NeoMME er et nyt værktøj, som man kalder en multimedie-encoder. Det er en slags digital oversætter, der kan forstå både tekst og billeder på samme tid. I stedet for at bruge to forskellige systemer til henholdsvis tekst og billeder, bruger den ét enkelt, tovejs transformer-netværk. Det betyder, at den kan læse information i begge retninger for at forstå sammenhængen bedre, hvilket gør den lettere og mere direkte, når den skal søge i store mængder dokumenter. Den mindste udgave kan gennemskue omkring 51 dokumenter i sekundet på et NVIDIA L40S-grafikkort, hvilket er dobbelt så hurtigt som tidligere modeller.
Modellen er trænet helt fra bunden til at håndtere både bogstaver og rå billedudsnit. Den skaber det, man kalder indlejringer, som fungerer som digitale fingeraftryk af indholdet. Den laver to slags fingeraftryk i ét hug: en tæt repræsentation og en til såkaldt »late interaction« eller sen interaktion. Det svarer til at have både et hurtigt overblik og en detaljeret tjekliste på én gang, hvilket sikrer, at søgningerne både er hurtige og præcise.
Når resultaterne skal gemmes, bruger systemet en kombination af hierarkisk tokensamling og asymmetrisk kvantisering. Man kan forestille sig det som en ekstremt effektiv måde at folde et stort landkort sammen til en lille lommefolder, uden at man mister overblikket over vigtige steder. Det betyder, at pladsen per side kan skæres ned fra 1,5 megabyte til kun 6 kilobyte, hvilket er en reduktion med en faktor på 255.
NeoMME findes i to størrelser med hhv. 260 millioner og 800 millioner parametre, som er de interne indstillinger, der bestemmer modellens kapacitet. Udviklerne forklarer, at begge modeller ligger på den såkaldte Pareto-grænse, hvilket betyder, at de har fundet den perfekte balance mellem modelstørrelse og søgekvalitet. Hele projektet er udgivet under den åbne Apache 2.0-licens og er tilgængeligt i biblioteket Hugging Face Transformers.
Vil du have, at jeg forklarer nærmere, hvad »parametre« egentlig betyder for en AI-models intelligens?

Den mindste af de to NeoMME-modeller gennemskuer omkring 51 dokumenter på ét sekund, når den kører på et NVIDIA L40S-grafikkort. Det er omtrent dobbelt så hurtigt som en sammenlignelig tidligere model. Samtidig reducerer den mængden af data, der skal gemmes for at søge i dokumenterne, med en faktor på 255.
NeoMME er en ny type multimedie-encoder. Den kombinerer tekst- og billedbehandling i ét enkelt, tovejs transformer-netværk i stedet for at bruge separate forudtrænede modeller for tekst og billeder. Det gør arkitekturen lettere og mere direkte til opgaver som at søge efter information på tværs af store dokumentmængder.
Modellen er trænet fra bunden til at håndtere både sproglige tegn og rå billedudsnit. Den leverer to slags indlejringer i ét skridt: en tæt repræsentation og en til sen interaktion (late interaction). Den kombination giver både hurtighed og et godt søgeresultat.
Lagringen af søgeresultaterne gøres mulig ved en kombination af hierarkisk tokensamling og asymmetrisk kvantisering. Det betyder, at den plads, der tidligere krævede 1,5 megabyte per side, kan skæres ned til 6 kilobyte, samtidig med at søgeresultatet bevares.
NeoMME findes i to størrelser på 260 millioner og 800 millioner parametre. Begge modeller ligger ifølge udviklerne på den såkaldte Pareto-grænse for søgeresultat og modelstørrelse. Hele projektet er tilgængeligt i Hugging Face Transformers og udgivet under den åbne Apache 2.0-licens.
Det er uklart: Artiklen baserer sig udelukkende på udgiverens egen præsentation. Uafhængige benchmark-resultater eller sammenligninger med andre modeller er ikke omtalt i kildematerialet.
Kilder
Produktionshistorie
- Radar Signal ? af 100 · spredning 1 kilder
- Skrevet Model: mimo-v2.5-free · temperatur 0.4
- Overskrift 5 kandidater, valgt af chat.dk
- Korrektur 1 zen · 3 rettelser
- Vedtagelse ainews-auto-v3 · score 0.3732