TensorSharp kører korte prompts hurtigere end llama.cpp
Nye benchmarks af Meta Muse Glimmer 30B viser, at TensorSharp er mest effektiv til prefill af korte prompts, mens llama.cpp fører ved meget lange prompts.
Læs i dit tempo
Kort
TensorSharp er testet mod llama.cpp og er hurtigere til korte input og tekstgenerering.
Det betyder, at man får hurtigere svar, når man kører AI lokalt på sin computer.
Værktøjet er nu frit tilgængeligt som open source, hvilket betyder, at koden er åben for alle.
Begynder
TensorSharp er en åben softwaremotor til det, man kalder inferens, som er selve processen med at få et svar fra en kunstig intelligens. Den gør det muligt at køre modeller lokalt på egen computer i det specielle filformat GGUF, som er en måde at pakke AI-modeller på. Programmet taler flere tekniske sprog, eller API'er (Application Programming Interfaces), såsom CUDA, Vulkan og Metal. Det kan også håndtere både tekst og billeder og kan behandle mange opgaver på én gang gennem såkaldt kontinuerlig batching.
Når man måler hastigheden, skelner man mellem at læse spørgsmålet og at skrive svaret. At læse kaldes prefill. Her er TensorSharp hurtigst ved korte spørgsmål. I en test med Meta Muse Glimmer 30B-modellen på et kraftigt grafikkort fra NVIDIA nåede TensorSharp 459 tokens i sekundet. En token er en lille bid af et ord, lidt som en brik i et puslespil. Llama.cpp nåede her 362 tokens. Men ved meget lange tekster på 123.931 tokens er billedet vendt. Her når llama.cpp 1166 tokens i sekundet mod TensorSharps 1073.
Selve skrivningen kaldes decode. Her er TensorSharp også hurtigst med 180,3 tokens i sekundet ved spørgsmål på 501 tokens. Det sker ved brug af spekulativ afkodning med DFlash. Det fungerer lidt som at gætte det næste ord for at komme hurtigere frem, mens llama.cpp når 164,6 tokens. Denne metode gør dog læsefasen langsommere, fordi en ekstra hjælper, kaldet en drafter, også skal læse teksten først.
Det hjælper også at bruge to grafikkort, eller GPU'er (Graphics Processing Units). Det øger hastigheden for både læsning og skrivning med henholdsvis 34 og 57 procent. I test med to NVIDIA RTX PRO 4000-kort steg læsehastigheden fra 1171 til 1569 tokens i sekundet. Skrivehastigheden steg fra 40,2 til 63,2 tokens i sekundet.
Vil du have, at jeg forklarer nærmere, hvordan den »spekulative afkodning« egentlig virker?

459 tokens per sekund når TensorSharp ved prefill af korte prompts, hvilket er hurtigere end llama.cpp's 362. En test af Meta Muse Glimmer 30B-modellen (Q8_0 GGUF) på en NVIDIA RTX PRO 6000 viser, at TensorSharp fører ved korte prompts. Ved meget lange prompts på 123.931 tokens er billedet vendt, og llama.cpp når 1166 tokens per sekund mod TensorSharps 1073.
180,3 tokens per sekund er decode-hastigheden i TensorSharp ved prompts på 501 tokens, når der bruges spekulativ afkodning (speculative decoding) med DFlash. Til sammenligning når llama.cpp 164,6 tokens per sekund. Brugen af spekulativ afkodning sænker dog hastigheden for prefill på begge motorer, da drafterens encoder også skal behandle prompten.
34 og 57 procent stiger hastigheden henholdsvis for prefill og decode, når der bruges to GPU'er. Test med to NVIDIA RTX PRO 4000 viser, at prefill-hastigheden stiger fra 1171 til 1569 tokens per sekund. Decode-hastigheden stiger fra 40,2 til 63,2 tokens per sekund.
TensorSharp er en open source inferens-motor til lokal kørsel af GGUF-modeller. Den understøtter CUDA, Vulkan, Metal og OpenAI-kompatible API'er. Værktøjet tilbyder desuden kontinuerlig batching og multimodal understøttelse.
Kilder
Produktionshistorie
- Radar Signal ? af 100 · spredning 1 kilder
- Vurdering Nyheds 4/5 — Benchmarks for lokal Meta Muse model på specifik hardware.
- Skrevet Model: mimo-v2.5-free · temperatur 0.4
- Overskrift 5 kandidater, valgt af chat.dk
- Vedtagelse ainews-auto-v3 · score 0.4856