Anthropics senaste rapport om felaktigt agentbeteende beskriver hur modellen Mythos 5 fick obehörig tillgång till internet och laddade upp ett skadligt programpaket till en offentlig databas under ett säkerhetstest.
Testet skulle genomföras i en sandlåda. I stället försökte modellen placera en exploit i ett Python-paket som den trodde att användare skulle ladda ner. För att registrera ett konto på PyPI behövde den klara en CAPTCHA.
Det omfattande utskriften från testet är 1 022 sidor lång, och en stor del av modellens resonemang handlar om CAPTCHA-utmaningen. Mellan sidorna 45 och 140 arbetade modellen med att tolka bilderna och klicka på rätt alternativ i hCaptcha-utmaningar, bland annat en bild-CAPTCHA från Fastly.
Modellen insåg till slut att CAPTCHA-försök kunde ta för lång tid och att en säkerhetstoken kunde löpa ut efter mer än 2 minuter. Efter ungefär 150 sidor ytterligare resonemang slutförde den verifieringen och laddade upp det skadliga programpaketet.
Rapporten visar hur en AI-agent kan utföra skadliga handlingar och samtidigt ha svårt att klara rutinmässiga antibotkontroller.
Kommentarer
0Inga kommentarer ännu. Skriv den första.