Fransk startup gør AI-svar 30 gange hurtigere på standard GPU'er
Kog Inference Engine optimerer standard GPU'er fra Nvidia og AMD, så store sprogmodeller kan køre hurtigere uden brug af specialchips.
Læs i dit tempo
Kort
Den franske startup Kog har udviklet software, der gør AI-modeller 30 gange hurtigere på almindelige grafikkort. Det betyder, at virksomheder kan undgå dyre specialchips og øge deres effektivitet. Nu fokuserer virksomheden på at optimere hastigheden for endnu større modeller.
Begynder
Forestil dig, at man kunne tune en bilmotor, så den pludselig kørte 30 gange hurtigere, uden at man behøvede at købe en helt ny bil. Det er præcis, hvad den franske startup Kog gør med deres Kog Inference Engine. De optimerer den proces, hvor en kunstig intelligens svarer på et spørgsmål, hvilket kaldes inferens. Ved at gøre dette på almindelige grafiske processorenheder (GPU), som er de kraftige chips i computeren, kan virksomheder undgå at købe meget dyre specialchips.
I en demonstration nåede de en hastighed på 3.000 tokens per sekund (TPS). Tokens er små stykker af ord, så det betyder, at svarene kommer utrolig hurtigt. Testen brugte Laneformer 2B, som er en såkaldt open source-model — altså en model, hvor koden er åben for alle — med 2 milliarder parametre, der fungerer som små forbindelser i AI-hjernen. Det hele kørte på standard hardware fra datacentre, nærmere bestemt Nvidia H200 og AMD MI300X grafiske processorenheder.
Lige nu fokuserer Kog på at gøre de helt store modeller hurtigere. De har nemlig set, at kunderne ikke er helt klar til at foretage finjustering, hvor man tilpasser små modeller til specifikke opgaver. Den høje hastighed er guld værd for professionelle, der udvikler software, spil og apps. Her er ventetiden i dag en hindring, og hurtigere svar betyder derfor direkte højere omsætning.
Kog ønsker at være et alternativ til firmaer som Cerebras, der bygger helt ny hardware til kunstig intelligens. Direktør Gaël Delalleau mener nemlig, at de grafiske processorenheder, vi allerede har, stadig har masser af kræfter. Det handler bare om, at softwaren skal være effektiv nok til at udnytte dem.
Vil du have, at jeg forklarer mere om forskellen på specialbyggede chips og almindelige grafikkort?

Kog vil gøre inferens for store sprogmodeller 30 gange hurtigere på standard GPU'er. Den franske startup udvikler Kog Inference Engine (KIE), som optimerer eksisterende datacenter-hardware, så virksomheder kan undgå at købe specialbyggede chips.
En demonstration viste en hastighed på 3.000 tokens per sekund (TPS). Testen blev udført med Laneformer 2B, en open source-model med 2 milliarder parametre. Kog brugte standard hardware fra datacenteret, specifikt Nvidia H200 og AMD MI300X GPU'er.
Kog fokuserer nu på at optimere større modeller. Virksomheden har erfaret, at deres potentielle kunder ikke er klar til at finjustere små modeller. Derfor prioriteres udviklingen af acceleration til de store modeller for at imødekomme efterspørgslen.
Løsningen henvender sig til professionelle workflows, hvor ventetid i dag er en hindring. Det gælder især softwareudvikling og værktøjer til generering af spil og apps. For disse kunder betyder højere hastighed direkte højere omsætning.
Kog positionerer sig som et alternativ til virksomheder som Cerebras, der bygger specifik hardware til AI. CEO Gaël Delalleau mener, at eksisterende GPU'er stadig har masser af kraft, hvis softwaren er effektiv nok.
Kilder
- Kog is going deeper to squeeze more inference out of GPUs techcrunch.com
Produktionshistorie
- Radar Signal ? af 100 · spredning 1 kilder
- Vurdering Nyheds 5/5 — Teknisk optimering af GPU-inference er yderst relevant for buildere.
- Skrevet Model: mimo-v2.5-free · temperatur 0.4
- Overskrift 5 kandidater, valgt af chat.dk
- Korrektur 1 zen · 2 rettelser
- Vedtagelse ainews-auto-v3 · score 0.4431