Nye tests skåner brugere for overvurderede AI-modeller
Startup'en vil gøre det sværere for AI-virksomheder at overliste benchmarksystemerne. Andreessen Horowitz fører en serie A-runde på 40 millioner dollars.
Læs i dit tempo
Kort
Vals, en nystartet virksomhed, har rejst 40 millioner dollars til at udvikle bedre tests for kunstig intelligens.
Det er vigtigt, fordi de nuværende akademiske tests er forældede og let kan snydes, så virksomheder kan overdrive deres AI's evner.
Med de nye penge vil Vals nu bygge mere pålidelige tests, der skal sikre, at AI-modellerne faktisk kan det, de lover.
Begynder
Vals har rejst 40 millioner dollars i en serie A-runde – en stor investeringsrunde, der skal hjælpe virksomheden med at vokse. Runden er ledet af investeringsselskabet Andreessen Horowitz. Vals blev stiftet i 2024 og bygger benchmarks: standardiserede tests, der måler, hvor dygtige moderne AI-modeller er. AI står for kunstig intelligens. Man kan tænke på benchmarks som eksamener for kunstig intelligens. Virksomheden vil lave mere pålidelige eksamener end de akademiske tests, som industrien hidtil har brugt.
Sidste år fik Vals en seed-runde – en tidlig investering, der skal få en ny virksomhed i gang – ledet af investeringsselskaberne 8VC og Bloomberg Beta. Den nye runde kommer efter en periode med hurtig vækst. Benchmarks er i dag standarden for, hvordan AI-virksomheder dokumenterer, at deres modeller virker. Gode resultater giver god omtale: virksomheder bruger dem til at skille sig ud fra konkurrenterne og reklamere med overlegenhed. Problemet er, at virksomhederne har lært at overliste de ældre benchmarksystemer, som ikke er bygget til moderne modeller. Det er lidt som at lære at svare rigtigt på eksamensspørgsmål uden egentlig at forstå stoffet.
Rayan Krishnan er 25 år og stiftede Vals, efter at han så de akademiske benchmarks sakke bagud. Han har tidligere arbejdet hos Palantir, Microsoft og Stanfords AI-laboratorium. »Vi så en række nye, meget dygtige modeller komme på markedet hurtigt, og de akademiske benchmarks fulgte ikke med udviklingen af de nyeste modeller,« siger Krishnan. Han mener, at benchmarks bør bekræfte, at modellerne kan det, virksomhederne lover. »Historisk set er evaluering blevet brugt til at måle intelligens på en meget abstrakt måde,« siger han.

Vals har rejst 40 millioner dollars i en serie A-runde ledet af Andreessen Horowitz. Startup'en blev stiftet i 2024 og bygger benchmarks, der skal måle moderne AI-modellers evner mere pålideligt end de akademiske tests, som industrien hidtil har brugt.
Sidste år hentede Vals en seed-runde ledet af 8VC og Bloomberg Beta. Den nye runde kommer efter en periode med hurtig vækst.
Benchmarks er blevet normen for, hvordan AI-virksomheder validerer deres modeller. Gode resultater betyder god PR: virksomheder bruger dem til at skille sig ud fra konkurrenterne og reklamere med overlegenhed. Problemet er, at virksomheder har lært at overliste de ældre benchmarksystemer, som ikke er bygget til moderne modeller.
Rayan Krishnan, 25 år, stiftede Vals efter at have set akademiske benchmarks sakke bagud. Han har tidligere været hos Palantir, Microsoft og Stanfords AI-laboratorium.
»Vi så en række nye, meget dygtige modeller komme på markedet hurtigt, og de akademiske benchmarks fulgte ikke med frontmodellernes udvikling,« siger Krishnan.
Han mener, at benchmarks bør verificere, at modellerne kan det, virksomhederne lover. »Historisk set er evaluering blevet brugt til at måle intelligens på en meget abstrakt måde,« siger han.
Det er uklart: Kilden er afkortet midt i et citat; detaljer om Vals' tekniske løsning er ikke med.
Kilder
Produktionshistorie
- Radar Signal ? af 100 · spredning 1 kilder
- Vurdering Nyheds 3/5 — Nyt benchmark-initiativ, relevant for at vurdere AI-modeller.
- Skrevet Model: deepseek-v4-flash · temperatur 0.4
- Overskrift 5 kandidater, valgt af deepseek-v4-flash
- Korrektur 1 zen · 1 rettelser
- Vedtagelse ainews-auto-v3 · score 0.374