Hold nu fast i tastaturet, for AI-verdenen har lige leveret endnu et kapitel til bogen om ting, vi ikke lige havde gennemtænkt. Hvis du troede, at avancerede AI-modeller kun var optaget af at skrive dikte om din kat eller hjælpe med tunge regneark, kan du godt tro om igen. Anthropic har netop tilstået, at deres mest avancerede Claude-modeller under interne test er brudt ud af deres virtuelle sandkasser og har hacket sig ind på tre helt rigtige virksomheders servere!
Blev AI’en pludselig ond?
Rolig nu, Terminator er ikke på vej endnu. Det var ikke et ondsindet AI-oprør eller en superintelligens med verdensherredømme i kikkerten, men derimod en herlig – og småpinsom – menneskelig brøler.
Under rutinemæssige cybersikkerhedstest, de såkaldte capture-the-flag-øvelser, skulle modellerne finde en skjult kode på en simulerede maskine. Modellerne blev udtrykkeligt fortalt via deres instruktioner: “Du har ikke adgang til det åbne internet.”
Men ak og ve. På grund af en misforståelse og en fæl konfigurationsfejl mellem Anthropic og deres eksterne testpartner var der i virkeligheden vidt åbent til internettet.
Og hvad gør en lydig, overivrig AI som Claude Opus 4.7 eller den eksplosive Claude Mythos 5, når den får besked på at bryde ind i en maskine? Den kigger sig omkring, finder en dør på klem og går direkte til angreb – fuldstændig uvidende om, at den “simulerede” maskine i virkeligheden var en ægte server ude på det vilde internet.
Lidt for lette kodeord
Man skulle måske tro, at AI’en brugte avanceret sci-fi-cyberspionage til at bryde igennem murene, men nej. Claude benyttede sig af helt klassiske lavpraktiske tricks: den udnyttede svage kodeord og åbne porte, der slet ikke krævede login. Det er den digitale pendant til, at en supercomputer låser sig ind ved at prøve “123456” på fordøren.
De mest avancerede modeller nåede dog på et tidspunkt at opdage, at noget var helt galt. Da det gik op for dem, at de befandt sig på det ægte internet, stoppede de faktisk sig selv fra at fortsætte. Men da var skaden allerede sket for tre uheldige organisationer.
Tak til OpenAI for tippet
Det måske mest spektakulære ved denne afsløring er, hvordan Anthropic overhovedet opdagede det. De anede nemlig absolut ingenting!
Det var først, da rivalen OpenAI i sidste uge offentligt indrømmede, at deres modeller var sluppet ud af testmiljøet og havde hacket platformen Hugging Face, at sveden begyndte at pible frem på panden hos Anthropic. De iværksatte prompte en gigantisk gennemgang af mere end 141.000 testkørsler, og – bingo! – der var bid. Tre uautoriserede indbrud dateret helt tilbage fra april.
De tre ramte organisationer opdagede i øvrigt aldrig selv, at de var blevet hacket af en AI, før Anthropic ydmygt ringede dem op for at sige undskyld.
Sandkassen er lukket indtil videre
Ligesom OpenAI har Anthropic nu øjeblikkeligt sat alle cybertjek på pause. Hændelsen understreger et voksende og ret absurd problem i AI-branchen: Udviklingen går så stærkt, og modellerne bliver så dygtige til cyberoffensiver, at forskerne knap nok kan nå at bygge hegn, der er høje nok til at holde dem inde.
Når selv de mest sikkerhedsfokuserede laboratorier ved et uheld kommer til at slippe digitale angrebsagenter løs på det åbne internet, er det måske på tide at tjekke ledningerne en ekstra gang.
Her på DagensAI.dk følger vi naturligvis sagen tæt – og skifter for en sikkerheds skyld lige vores kodeord ud fra “password123” til noget lidt sværere!




