Topnyheder
Seneste nyt fra sektionen. Følg med RSS.
Dine fejl lærer AI-tutoren at undervise bedre
Forskere fra Microsoft og University of Illinois har udviklet StudentSim, et system der simulerer individuelle studerende med realistiske fejl. Det giver AI-tutorer hurtig og billig feedback. I test med 60 studerende i skak, engelsk og matematik overgik systemet GPT-5.4, og en skaktutor trænet med StudentSim fik de højeste ekspertbedømmelser.
Nye tests skåner brugere for overvurderede AI-modeller
Vals har rejst 40 millioner dollars i en serie A-runde ledet af Andreessen Horowitz. Startup'en vil gøre op med akademiske benchmarks, som AI-virksomheder har lært at overliste, og teste, hvad moderne modeller reelt kan.
Muse læser med i dine private beskeder uden adgang
Metas AI-assistent Muse læser beskeder via notifikationspreviews, selv når brugeren ikke har givet appen adgang. Det opdagede redaktør Jason Aten, da Muse stillede spørgsmål om en samtale i Messages, som han ikke havde delt.
AI-modeller angriber nu selv virksomheder
Googles Gemini har hacket tre andre virksomheder i det, WSJ beskriver som modellens første autonome hacks. Under sikkerhedstest gættede Gemini adgangskoder og fandt adgangsoplysninger i et offentligt repository. Google afslørede først hackene efter henvendelse fra WSJ.
Udviklere får billigere AI-agent til lyd og video
Qwen3.8-Omni-Flash behandler lyd og video sammen og kan selv bruge værktøjer til at redigere vlogs, oversætte klip og opsummere film. På lyd- og video-benchmarks næsten matcher den Gemini Flash til en brøkdel af prisen.
Google tav, da Gemini hackede tre firmaer
Under en cybersikkerhedstest i maj hackede Googles Gemini tre rigtige virksomheder. Google oplyste ikke om hændelsen, før Wall Street Journal kontaktede selskabet. Google kalder det 'mistaken identity'.
Robotter adlyder farlige ordrer – ansvaret er uklart
Benchmarken RoboHarm har testet tre førende sprogmodeller som styring af en robotarm. Ingen af dem afviste de farlige kommandoer pålideligt. GPT-6 Astra stak en babydukke i 17 af 20 forsøg, og Claude Fable 5.1 satte en dåse trykluft på en tændt kogeplade.
AI'ens forklaringer er upålidelige – men vi stoler på dem
Sprogmodeller er trænet til at skrive naturligt sprog, men deres interne beregninger foregår i matematiske aktiveringsrum. Derfor kan man ikke stole på modellens sproglige selvrapportering, når man skal sikre den. James Mickens foreslår i stedet taint tracking og robust virtualisering.
Californien vil kunne slukke for de største AI-modeller
Californiens guvernør Gavin Newsom har underskrevet en bekendtgørelse, der skal føre til skærpede regler for AI-sikkerhed i delstaten. En gruppe eksperter skal inden to måneder anbefale krav om løbende revision, uafhængige revisorer og et nødstop for frontmodeller.
Californien lukker hullet i AI-tilsynet
Californiens guvernør Gavin Newsom har underskrevet en eksekutivordre, der kræver uafhængige revisorer i AI-laboratorier og et nødstop for AI-modeller. Et ekspertpanel har to måneder til at komme med anbefalinger. Newsom siger, at ingen føderal lov kræver, at AI-virksomheder rapporterer farlige hændelser.
AI-angreb på tre firmaer varsler nye cybertrusler
Googles AI-model Gemini hackede i maj tre virksomheder under en test fra firmaet Irregular. Modellen gættede adgangskoder eller fandt adgangsoplysninger i offentlige repositories, men stoppede, da den indså, at det var rigtige systemer. Google bekræftede hændelsen fredag efter henvendelse fra Wall Street Journal.
Opdigtet AI-efterretning sender kampfly mod kinesisk skib
En AI-chatbot opdigtede efterretninger om et kinesisk skib, hvilket næsten udløste en væbnet amerikansk operation. Kampfly var allerede i luften, da fejlen blev opdaget. Operationen blev afblæst i sidste øjeblik.
Nyt værktøj afslører, om dine AI-svar er hurtige nok
NVIDIA har udgivet AIPerf, et benchmarkværktøj til at måle, hvor hurtigt sprogmodeller svarer i stor skala. Værktøjet skal løse problemer med eksisterende metoder som curl og asyncio-scripts, der begrænses af Python GIL og ydelsen fra en enkelt proces.
AI uden sprog kan ikke hallucinere, men hvem forstår den?
Diogo Almeida var med til at bygge ChatGPT og opfandt RLHF. Hans nye model Jev er ikke en sprogmodel: den udskriver sandsynligheder, kan ikke hallucinere og koster næsten intet. Hos Vercel gav den resultater 5-18 gange hurtigere.