Google gør videoanalyse billigere med ny dynamisk scanning i Gemini
En ny funktion giver modellerne mulighed for at scanne videoer dynamisk i stedet for at analysere faste billedrater.
Læs i dit tempo
Kort
Google har lanceret en ny, dynamisk metode til videoanalyse i deres Gemini-modeller. Det gør analysen billigere og mere præcis, da der bruges færre tokens (små datamængder). Funktionen kan nu aktiveres af udviklere i Google AI Studio eller Gemini Enterprise.
Begynder
Google har introduceret en ny måde for deres kunstige intelligens at forstå video på, kaldet agentisk videoforståelse. Det betyder, at teknologien nu fungerer mere som en aktiv assistent, der selv kan vurdere, hvad den skal kigge efter. Funktionen findes nu i modellerne Gemini 3.7 Flash, 3.6 Flash og 3.5 Flash-Lite. Det er resultatet af en effektivisering, hvor brugen af tokens — som er de små stykker af information, maskinen læser — er faldet med 88 procent. Det har ført til 66 procent lavere omkostninger. Samtidig viser standard benchmarks, som er faste testmetoder til at måle præcision, at resultaterne er blevet op til 7 procent mere nøjagtige.
Tidligere fungerede videoanalyse som et ur, der tikkede fast; maskinen tog blot ét billede, kaldet en frame, hvert sekund. Nu scanner modellerne i stedet videoen dynamisk. Det minder om agentisk syn, hvor maskinen kombinerer sin evne til at ræsonnere med værktøjer, der kan gennemsøge billeder, lyd og transskriptioner, som er tekstversioner af det talte ord. Man kan forestille sig det som en person, der ser en film og fokuserer ekstra meget på de spændende scener, mens de blot skimmer de mindre vigtige dele.
Denne metode gør det muligt at tælle ting mere præcist, finde fejl og bestemme tidspunkter med en nøjagtighed på under et sekund. Det er især en fordel ved lange videoer, såsom forelæsninger, vejledninger på 10 minutter eller optagelser, der varer i flere timer. Udviklere skal nu ikke længere vælge mellem at betale for mange tokens eller bruge teknikker, hvor vigtige detaljer går tabt.
Funktionen kan aktiveres via konfigurationen af deres Application Programming Interface (API), som er en digital bro, der lader to forskellige softwareprogrammer tale sammen. Det sker i Google AI Studio eller Gemini Enterprise Agent Platform. Systemet understøtter både videoer, man selv uploader, og links fra YouTube.
Vil du have, at jeg forklarer mere om, hvordan tokens påvirker prisen for at bruge kunstig intelligens?

88 procent færre tokens og 66 procent lavere omkostninger er resultatet af Googles nye agentiske videoforståelse (agentic video understanding). Funktionen er nu tilgængelig i Gemini 3.7 Flash, 3.6 Flash og 3.5 Flash-Lite. Ifølge standard benchmarks for videoanalyse stiger præcisionen i resultaterne med op til 7 procent.
Modellerne scanner nu videosegmenter dynamisk i stedet for at analysere billeder med en fast hastighed. Tidligere brugte modellerne en statisk proces, som standard med én frame pr. sekund. Metoden minder om agentisk syn (agentic vision) og kombinerer modellens ræsonnement med værktøjer til at gennemsøge visuelle billeder, lyd og transskriptioner.
Videoanalyse bliver mere præcis ved præcis tælling, detektering af uregelmæssigheder og tidsbestemmelse på under et sekund. Forbedringen er særligt udtalt ved lange videoer, som for eksempel forelæsninger, guides på 10 minutter eller optagelser på flere timer. Her kan udviklere nu undgå at skulle vælge mellem høje token-omkostninger eller teknikker, der går på kompromis med vigtige detaljer.
Funktionen kan aktiveres via API-konfigurationen i Google AI Studio eller Gemini Enterprise Agent Platform. Den understøtter både uploadede videoer og YouTube-links.
Kilder
- Introducing agentic video understanding with Gemini deepmind.google
Produktionshistorie
- Radar Signal ? af 100 · spredning 1 kilder
- Skrevet Model: mimo-v2.5-free · temperatur 0.4
- Overskrift 5 kandidater, valgt af chat.dk
- Korrektur 1 zen · 1 rettelser
- Vedtagelse ainews-auto-v3 · score 0.4407