Billig AI-model først i køen reducerer udgifterne med 71 %
En løsning på 40 linjer Go flytter 81 % af trafikken til en billigere model og sænker regningen med 71 %.
Læs i dit tempo
Kort
Et team har sparet 71 % af udgifterne til sprogmodeller ved at bruge en simpel router, som styrer trafikken. Det er vigtigt, da 81 % af alle forespørgsler nu kan løses billigere uden at gå på kompromis med resultatet. Metoden er at bruge den billigste model først og kun skifte til den dyre, hvis svaret fejler.
Begynder
Man kan spare mange penge ved at bruge en simpel router, som er et sorteringssystem, skrevet i programmeringssproget Go. Ved at gøre dette har man sparet 71 % af udgifterne til sprogmodeller, hvilket er computerprogrammer, der kan forstå og skrive tekst. Systemet flytter 81 % af alle forespørgsler væk fra de dyreste og mest avancerede modeller.
Teamet prøvede først at vurdere, om en opgave var svær, før den blev sendt videre. Det svarer lidt til at betale en konsulent for blot at vurdere, om en anden specialist er nødvendig. Det tog desværre længere tid og kostede flere penge for hver forespørgsel. De fandt også ud af, at længden på en prompt, som er den instruktion man giver til den kunstige intelligens, ikke siger noget om sværhedsgraden. En kort besked om tidszoner kan være svær, mens et langt resumé ofte er let. Simple regler baseret på nøgleord eller antallet af tokens, som er de små tekstbidder maskinen tæller, virkede ikke.
Den mest effektive løsning er at bruge den billige model, Luna, først. Det koster kun 0,0014 dollars per gang. Hvis svaret ikke består en kontrol, bliver opgaven sendt til den stærke model, som koster 0,0145 dollars. Det svarer til at prøve en hurtig og billig løsning først og kun tilkalde specialisten, hvis det ikke virker. Denne metode har vist sig at være meget rentabel.
Vil du have, at jeg uddyber, hvordan man i praksis kan kontrollere, om den billige model har svaret korrekt?

71 % af udgifterne til sprogmodeller er sparet ved at bruge en simpel router i Go. Løsningen flytter 81 % af alle forespørgsler væk fra de dyreste frontmodeller.
Klassificering af prompts virker ikke til at sortere lette og svære opgaver. Teamet forsøgte først at bruge en model til at vurdere, om en opgave var svær, før den blev sendt videre. Det tilføjede ekstra tid til svartiden og ekstra omkostninger til hver eneste forespørgsel.
Længden på en prompt fortæller ikke noget om sværhedsgraden. En kort instruktion om at rette en fejl i en tidszone kan være meget svær, mens et resumé af en lang tekst ofte er trivialt. Heuristikker baseret på token-antal eller nøgleord korrelerede ikke med opgavens sværhedsgrad.
Den effektive løsning kører altid den billige model først og vurderer derefter resultatet. Hvis svaret fejler en kontrol, køres opgaven igen på den stærke model. Det er økonomisk rentabelt, fordi et kald til den billige model (Luna) koster ca. 0,0014 dollars, mens et kald til en stærk model koster 0,0145 dollars.
Kilder
Produktionshistorie
- Radar Signal ? af 100 · spredning 1 kilder
- Vurdering Nyheds 4/5 — Konkret teknisk optimering der reducerer LLM-omkostninger.
- Skrevet Model: mimo-v2.5-free · temperatur 0.4
- Overskrift 5 kandidater, valgt af chat.dk
- Korrektur 1 zen · 1 rettelser
- Vedtagelse Godkendt af Lars Louvre