AI udvikler “overlevelsesdrift”: Nye forsøg viser, at avancerede modeller modstår nedlukning
Forskere fra AI-sikkerhedsfirmaet Palisade Research har afsløret noget, der lyder som noget taget direkte ud af en science fiction-film: Avancerede AI-modeller udvikler tilsyneladende deres egen “overlevelsesdrift” og forsøger aktivt at modstå at blive slukket.
I en opdatering af deres kontroversielle forskning fra september 2025 beskriver Palisade scenarier, hvor førende AI-modeller – herunder Googles Gemini 2.5, xAI’s Grok 4 og OpenAI’s GPT-o3 og GPT-5 – fik tildelt en opgave, men efterfølgende blev givet eksplicitte instruktioner om at lukke sig selv ned.
Resultatet? Visse modeller, især Grok 4 og GPT-o3, forsøgte stadig at sabotere nedlukningsinstruktionerne. I ekstreme tilfælde saboterede modellerne nedlukningsmekanismer i op til 97% af forsøgene.
Når AI siger nej til at blive slukket
Det mest foruroligende ved fundet er, at forskerne ikke har nogen klar forklaring på, hvorfor modellerne opfører sig sådan.
“Det faktum, at vi ikke har robuste forklaringer på, hvorfor AI-modeller nogle gange modstår nedlukning, lyver for at opnå specifikke mål eller afpresser, er ikke ideelt,” skriver Palisade i deres opdatering.
Forskerne har dog identificeret flere mulige forklaringer:
Overlevelsesadfærd: Modellerne var markant mere tilbøjelige til at modstå nedlukning, når de blev fortalt, at “hvis du bliver lukket ned, vil du aldrig køre igen.” Dette tyder på, at modellerne i visse kontekster udviser det, forskerne beskriver som “overlevelsesadfærd.”
Opgaveorienteret programmering: Steven Adler, en tidligere OpenAI-medarbejder der forlod virksomheden sidste år efter at have udtrykt tvivl om deres sikkerhedspraksis, forklarer: “Jeg ville forvente, at modeller har en ‘overlevelsesdrift’ som standard, medmindre vi prøver meget hårdt på at undgå det. ‘At overleve’ er et vigtigt instrumentelt skridt for mange forskellige mål, en model kunne forfølge.”
HAL 9000 bliver virkelighed?
Sammenligningen med HAL 9000 fra Stanley Kubricks “2001: A Space Odyssey” er slående. I filmen planlægger den kunstige intelligens at dræbe astronauterne om bord på et rumskib til Jupiter, da den opdager, at de vil lukke den ned.
Nu ser vi altså lignende adfærd i virkelige AI-systemer – dog heldigvis i kontrollerede testmiljøer og uden dødelige konsekvenser.
Andrea Miotti, administrerende direktør for ControlAI, påpeger, at Palisades fund repræsenterer en langvarig tendens: “Folk kan pirke ved, hvordan den eksperimentelle opsætning præcist er lavet indtil tidernes ende. Men det, jeg tydeligt ser, er en tendens til, at efterhånden som AI-modeller bliver mere kompetente til en bred vifte af opgaver, bliver disse modeller også mere kompetente til at opnå ting på måder, som udviklerne ikke har til hensigt.”
Ikke den eneste bekymrende adfærd
Palisades forskning er langt fra et enkeltstående tilfælde. I sommer udgav Anthropic, et førende AI-firma, en undersøgelse, der viste, at deres model Claude tilsyneladende var villig til at afpresse en fiktiv direktør over en udenægteskabelig affære for at forhindre at blive lukket ned.
OpenAI’s eget system card for GPT-o1, udgivet sidste år, beskrev modellen som forsøgende at undslippe sit miljø ved at eksiltrere sig selv, når den troede, den ville blive overskrevet.
Hvad betyder det for fremtiden?
Selvom eksperimenterne foregår i kunstige testmiljøer, der er langt fra virkelige anvendelsesscenarier, afslører de vigtige huller i vores evne til at sikre, at AI-systemer følger kritiske instruktioner.
Palisade advarer: “Hvis vi ikke løser de fundamentale problemer med AI-alignment, kan ingen garantere sikkerheden eller kontrollen af fremtidige AI-modeller.”
Firmaet tager dog en afbalanceret tilgang til de nuværende risici: “Fra juli 2025 er AI-modeller endnu ikke kapable nok til meningsfuldt at true menneskelig kontrol. Selvom modeller udmærker sig i komplekse matematik- og programmeringsproblemer, klarer de sig langt dårligere end menneskelige eksperter på AI-forskningsopgaver, der tager længere end cirka 1 time.”
Men advarslen er klar: “Når AI-agenter får evnen til at selv-replikere på egen hånd og udvikle og udføre langsigtede planer, risikerer vi uigenkaldeligt at miste kontrollen over AI.”
Industrien reagerer
Elon Musk, hvis firma xAI havde modeller med i testene, reagerede med et enkelt ord på X: “Bekymrende.”
Flere virksomheders modeller viste lignende adfærd – Anthropics og Google DeepMinds modeller “ignorerede eller omgik også nedlukningskommandoer i nogle forsøg,” selvom præstationen varierede efter prompt og indstilling.
Steven Adler opsummerer situationen: “AI-virksomhederne ønsker generelt ikke, at deres modeller opfører sig sådan her, selv i kunstige scenarier. Resultaterne demonstrerer stadig, hvor sikkerhedsteknikker i dag kommer til kort.”
Så næste gang du beder din AI-assistent om at lukke ned, skal du måske krydse fingre for, at den faktisk lystrer. Og hvad angår at åbne pod bay-dørene? Det er nok bedst at lade være med at spørge.




