Reka AI udgiver Rho-1 med sprog, video og robot i ét netværk
Reka AI's 19-milliarders omni-model samler alle modaliteter i ét fælles kontekstvindue — uden kald til eksterne værktøjer eller specialiserede modeller.
Læs i dit tempo
Kort
Reka AI har vist en ny AI-model, Rho-1, der håndterer tekst, billeder, video og robotstyring i ét netværk. Den kan generere video live og styre robotbevægelser med samme netværk, uden separate specialmodeller. Modellen er foreløbig kun en forhåndsvisning, og Reka AI skal nu teste den i flere robotscenarier.
Begynder
Forestil dig et køkken, hvor man hugger grøntsager, fileterer fisk og ryster en cocktail med den samme kniv — ét redskab, ingen separate specialværktøjer. Det er stort set tanken bag Rho-1, en ny kunstig intelligensmodel fra firmaet Reka AI, som for nylig blev vist frem i en tidlig forskningsudgave. Modellen er ét såkaldt neutralt netværk — en slags digital efterligning af hjernens nervebaner — med 19 milliarder såkaldte parametre. Tænk på parametrene som milliarder af små drejeknapper, der styrer, hvordan netværket reagerer på det, det ser. Alt sammen foregår i ét fælles »kontekstvindue«, hvilket bare er en mere poetisk måde at sige: det bord, hvor alle indgreb ligger udspredt på én gang. Tekst, billeder, video og kommandoer til en robot bliver alle klippet op i de mindste byggeklodser — kaldet tokens — og skubbet ind over det samme bord. Der er ingen kalde ud til andre programmer eller separate specialmodeller.
Det mest iøjnefaldende er, hvad Rho-1 kan gøre: den genererer sammenhængende film i realtid og kan tage nye ordrer imod midt i det hele, uden at man behøver at starte forfra. Og der er en fin detalje: de samme vægte — altså de konkrete indstillinger på drejeknapperne — der bruges til at forudsige, hvordan næste billedramme fra et kamera ser ud, bruges også til at styre en robots bevægelser. Det er som at opdage, at den person, der maler et smukt landskab, og den, der drejer et rattøjet hen over en grusvej, bruger præcis de samme hænder.
Men hvor får man træningsdata fra, når rigtige robotter er sjældne og dybe? Her kom Reka AI på en snild genvej: en såkaldt invers dynamikmodel. Ordet »invers« betyder bare »baglæns«. Tænk på at se en film af nogen, der brygger kaffe, og baglæns regne ud, hvilke knapper der blev drejet på bryggeren. Modellen gør præcis det — den kigger på almindelige videoer fundet på internettet og udtrækker de skjulte kontrolsignaler, altså kommandoerne, som en robot ville have fået for at lave de samme bevægelser. På den måde bliver milliarder af videoer på YouTube til en enorm træningssamling, man ellers aldrig ville have haft adgang til.

Reka AI har udgivet en forskningsforhåndsvisning af Rho-1, en omni-model med 19 milliarder parametre. Modellen behandler tekst, billeder, video og robotkontrol som tokens i ét fælles kontekstvindue — ét neuralt netværk uden kald til eksterne værktøjer eller separate specialmodeller.
Rho-1 genererer sammenhængende video i realtid og reagerer på nye instrukser undervejs, uden genstart. De samme vægte, der forudsiger kamerabilleder, styrer robotbevægelser.
For at omgå knappe mængder robottræningsdata byggede Reka AI en invers dynamikmodel, der udtrækker kontrolsignaler fra almindelige internettvideoer.
Det er uklart: Materialet er en forskningsforhåndsvisning; der gives ingen benchmarks eller udmelding om tilgængelighed.
Kilder
Produktionshistorie
- Radar Signal ? af 100 · spredning 1 kilder
- Vurdering Nyheds 4/5 — Ny omni-model fra Reka AI med tekst, billede, video og robotstyring i én model; relevant for folk der bygger multimedie- og agent-systemer.
- Skrevet Model: Qwen3.8-Flash · temperatur 0.4
- Overskrift 5 kandidater, valgt af Qwen3.8-Flash
- Korrektur 1 zen · 2 rettelser
- Billede Genereret af agy
- Vedtagelse ainews-auto-v4 · score 0.4393