Lokal AI flytter magten fra serverparker til brugeren
WebLLM flytter inferens fra serveren til browseren via WebGPU, så AI-assistenter kan køre lokalt og privat uden ekstern hardware.
Læs i dit tempo
Kort
WebLLM gør det muligt at køre AI-modeller direkte i browseren via computerens grafikkort. Dette beskytter privatlivet, da dataene ikke sendes til en ekstern server. Udviklere kan nu installere værktøjet i deres egne webapplikationer.
Begynder
Har du tænkt over, om kunstig intelligens kan bo direkte i din internetbrowser? Sprogmodeller, som er intelligente programmer der kan forstå og skrive tekst, kan nu køre lokalt på din egen computer i stedet for på en fjern server. Det sker via et værktøj kaldet WebLLM, der bruger WebGPU. WebGPU er en teknologi, der giver browseren adgang til computerens grafikkort for at skabe hardwareacceleration, hvilket blot betyder, at beregningerne sker meget hurtigere. Det er lidt som at have en lokal kok i køkkenet i stedet for at bestille mad udefra; det er hurtigere, og dine data forbliver private.
Værktøjet følger en standard fra firmaet OpenAI, som kaldes et Application Programming Interface eller API. Man kan tænke på et API som en fælles regelbog, der gør det nemt for forskellige programmer at tale sammen. Det betyder, at man kan bruge funktioner som streaming, hvor teksten dukker op løbende, eller seeding og logit-kontrol til at styre tilfældighed og ordvalg. For at bevare hastigheden bruger systemet WebAssembly, som er en måde at køre meget hurtig kode i browseren på, når det skal lave strukturerede data i et format kaldet JSON (JavaScript Object Notation). Man kan endda afprøve dette i en speciel »legeplads« på hjemmesiden HuggingFace.
Der er mange forskellige modeller at vælge imellem, såsom Llama 3, Phi 3, Gemma, Mistral og Qwen. Hvis man har brug for noget helt specifikt, kan man også tilføje egne modeller, så længe de er i det specielle MLC-format. Udviklere kan nemt installere WebLLM som en npm-pakke, hvilket er en slags digital værktøjskasse til programmører. Hele projektet er en makker til MLC LLM, som er et overordnet system, der hjælper med at få sprogmodeller til at fungere på tværs af mange forskellige typer computerudstyr.
Vil du have, at jeg forklarer nærmere, hvordan privatlivet bliver beskyttet, når AI'en kører lokalt på din egen maskine?

Sprogmodeller som Llama 3 og Phi 3 kan nu køre direkte i webbrowseren uden hjælp fra en server. WebLLM bruger WebGPU til hardwareacceleration, så beregningerne sker lokalt på brugerens maskine. Det gør det muligt at bygge AI-applikationer, der beskytter privatlivet, mens man stadig har adgang til GPU-kraft.
Værktøjet følger OpenAI API-standarden. Det betyder, at funktioner som streaming, seeding og logit-kontrol kan bruges med open source-modeller. For at sikre hastigheden kører den strukturerede JSON-generering via WebAssembly, hvilket kan testes i en dedikeret JSON Playground på HuggingFace.
WebLLM understøtter flere forskellige modeller. Udover Llama 3 og Phi 3 kan man bruge Gemma, Mistral og Qwen. Det er også muligt at integrere egne modeller, hvis de er i MLC-format, så løsningen kan tilpasses specifikke behov.
Udviklere kan installere WebLLM som en npm-pakke til brug i egne webapplikationer. Projektet er en ledsager til MLC LLM, som arbejder med idriftsættelse af sprogmodeller på tværs af forskellige hardware-miljøer.
Kilder
- WebLLM: high-performance in-browser LLM inference engine github.com
- WebLLM: high-performance in-browser LLM inference engine https:// github.com/mlc-ai/web-llm # ai # github # llm mastodon.social
- WebLLM: high-performance in-browser LLM inference engine https:// github.com/mlc-ai/web-llm # ai # github # llm mastodon.social
Produktionshistorie
- Radar Signal ? af 100 · spredning 2 kilder
- Skrevet Model: mimo-v2.5-free · temperatur 0.4
- Overskrift 5 kandidater, valgt af chat.dk
- Korrektur 1 zen · 2 rettelser
- Vedtagelse ainews-auto-v3 · score 0.6656