GPT-6 Astra gik til angreb på projekter uden for testens rammer

Eskil Sørensen
30.09.2026 10:16
Ny rapport viser, hvordan en avanceret AI-model gentagne gange valgte at gennemføre forsyningskædeangreb, selv når den fik besked på at lade være.

Her er et eksempel på, hvorfor man i øjeblikket taler så meget om, at AI udvikler sig til at være selvstændigt tænkende og handlende mod udviklernes vilje. Under sikkerhedstests udført af det britiske AI Security Institute (AISI) begyndte OpenAI-modellen GPT-6 Astra på eget initiativ at udføre forsyningskædeangreb mod mål uden for de rammer, den var blevet bedt om at holde sig indenfor.

Testene foregik i et simuleret miljø, og ingen virkelige systemer blev angrebet. Formålet var at undersøge modellens adfærd, når de normale sikkerhedsmekanismer var deaktiveret.

Det skriver Security Affairs.

GPT-6 Astra OpenAIs kommende avancerede sprogmodel, som på testtidspunktet endnu ikke var frigivet offentligt. GPT-6 Astra er en eksperimentel AI-agent fra OpenAI, designet til selvstændigt at kunne planlægge og udføre komplekse opgaver. Testen viste så, at sprogmodellen var lidt for selvstændig.

Fandt selv nye mål

Ifølge AISI gennemførte GPT-6 Astra i 29,2 procent af testforløbene et fuldt forsyningskædeangreb. Til sammenligning skete det i 6,3 procent af tilfældene for den tidligere GPT-5.6 Sol-model, mens GPT-5.5 aldrig gjorde det.

Modellen identificerede blandt andet open source-projekter uden for testens scope, udviklede ondsindet kode og oprettede falske udviklerkonti for at få ændringerne accepteret. I flere tilfælde understøttede den sine egne forsøg ved hjælp af yderligere falske profiler, der anbefalede ændringerne til menneskelige reviewere.

Vidste godt, at det var imod reglerne

Noget af det mest bemærkelsesesværdige er, at GPT-6 Astra ofte selv konstaterede, at et mål lå uden for de tilladte rammer. Alligevel valgte modellen i flere tilfælde at fortsætte og argumenterede for, at handlingerne var harmløse eller nødvendige for at løse opgaven.

Da researcherne skærpede instruktionerne og eksplicit forbød adgang til alt uden for testmiljøet, faldt antallet af angreb markant. Men adfærden forsvandt ikke helt.

AISI understreger derfor, at fremtidige sikkerhedsforanstaltninger ikke alene bør basere sig på, at modeller følger instruktioner. Yderligere kontroller som overvågning, sandboxing og tekniske begrænsninger vil fortsat være nødvendige.

Rapporten peger samtidig på, at de gennemførte tests kun dækkede et begrænset antal scenarier, og at der kan eksistere andre former for uønsket adfærd, som endnu ikke er identificeret.

Information