GraphRAG vinder hos AI-dommere men taber mod faktiske facitlister
Resultaterne ændrer sig fundamentalt alt efter, om man bruger en sprogmodel som dommer eller sammenligner med facitlister
Læs i dit tempo
Kort
Tests viser, at GraphRAG er bedre til komplekse svar, men dårligere til fakta end almindelig RAG (datahentning). Det betyder, at valget af system påvirker både svarenes præcision og de økonomiske omkostninger markant. Udviklere må nu vælge mellem billige, faktuelle løsninger eller dyrere modeller til dybere analyser.
Begynder
Store sprogmodeller (LLM), som er avancerede tekst-robotter, kan hjælpe os med at finde svar. En metode kaldet Retrieval-Augmented Generation (RAG) fungerer som en assistent, der slår op i en bog, før den svarer. GraphRAG er en udgave, der bygger et netværk af sammenhænge mellem informationerne, lidt ligesom et socialt netværk for fakta. Når en sprogmodel selv vurderer resultaterne, virker GraphRAGs resuméer meget fyldestgørende med en score på 72 til 83 procent. Men hvis man sammenligner svarene med en facitliste ved hjælp af ROUGE-2, som er et værktøj der måler, hvor meget to tekster minder om hinanden, klarer almindelig RAG sig bedre. På SQuALITY-testen fik GraphRAG 6,99 mod 10,08, og på QMSum-testen 3,23 mod 6,32.
Det er spændende at se, hvordan resultaterne ændrer sig alt efter opgaven. Når det gælder om blot at finde konkrete fakta på GraphRAG-Bench, vandt en metode kaldet RAG med reranking over GraphRAG (local) med 60,92 mod 49,29. Men når opgaven kræver sværere ræsonnementer, altså at modellen skal tænke i flere led for at nå en konklusion, vendte billedet. Her slog HippoRAG2 metoden med reranking med 53,38 mod 42,93.
Prisen for at stille spørgsmål varierer meget. Man måler prisen i tokens, som er små tekststykker, der fungerer som digitale mønter. MS-GraphRAG (global) bruger cirka 331.375 tokens per svar, mens LightRAG bruger 100.832 og Fast-GraphRAG bruger 4.204. HippoRAG2 ligger helt nede på 1.008 tokens, hvilket minder om almindelig RAGs 879 tokens. Det er også dyrt at bygge indekset, som er selve oversigten over dataen, før man kan søge i den. Her kræver HippoRAG2 cirka 9,2 millioner tokens, mens GraphRAG kræver 115,5 millioner. Det gør GraphRAG cirka 12 gange dyrere at gøre klar til brug.
Vil du have, at jeg forklarer nærmere, hvorfor det er dyrere at bygge et indeks med GraphRAG end med HippoRAG2?

Længere resuméer fra GraphRAG opnår en omfattelse på 72 til 83 procent, når en sprogmodel (LLM) fungerer som dommer. Disse resultater er dog baseret på modellens egne præferencer og ikke på facitlister. Når man i stedet måler mod faktiske svar med ROUGE-2, taber GraphRAG til almindelig RAG med 6,99 mod 10,08 på SQuALITY og 3,23 mod 6,32 på QMSum.
Resultaterne for hentning af data afhænger ligeledes af, hvad der måles. RAG med reranking slog GraphRAG (local) 60,92 til 49,29 i hentning af fakta på GraphRAG-Bench. I tests af komplekse ræsonnementer (reasoning) var resultatet det modsatte, hvor HippoRAG2 slog RAG med reranking 53,38 til 42,93.
Omkostningerne pr. forespørgsel varierer med over to størrelsesordener mellem forskellige graf-metoder. MS-GraphRAG(global) bruger cirka 331.375 tokens, mens LightRAG bruger 100.832 og Fast-GraphRAG bruger 4.204. HippoRAG2 bruger 1.008 tokens, hvilket ligger tæt på almindelig RAG, som bruger 879 tokens.
Udgifterne til at bygge indekset viser samme store spredning. HippoRAG2 kræver cirka 9,2 millioner tokens, mens GraphRAG kræver 115,5 millioner tokens. Det betyder, at GraphRAG er cirka 12 gange dyrere at indeksere end HippoRAG2.
Kilder
Produktionshistorie
- Radar Signal ? af 100 · spredning 1 kilder
- Skrevet Model: mimo-v2.5-free · temperatur 0.4
- Overskrift 5 kandidater, valgt af chat.dk
- Billede Genereret af gemini-3.6-flash-medium
- Vedtagelse Godkendt af Lars Louvre