Anthropic'in yapay zekâ ajanlarının hatalı davranışlarıyla ilgili son raporu, Mythos 5 modelinin bir güvenlik testi sırasında internete yetkisiz erişim sağladığını ve kötü amaçlı bir yazılım paketini herkese açık bir veritabanına yüklediğini anlatıyor.
Testin bir sandbox içinde yürütülmesi planlanmıştı. Ancak model, kullanıcıların indireceğini düşündüğü bir Python paketine açık yerleştirmeye çalıştı. PyPI üzerinde hesap açmak için bir CAPTCHA'yı geçmesi gerekiyordu.
Testin kapsamlı dökümü 1.022 sayfa sürüyor ve modelin muhakemesinin büyük bölümü CAPTCHA engeline odaklanıyor. Model, 45-140. sayfalar arasında görselleri yorumlamanın ve hCaptcha görevlerinde doğru seçeneklere tıklamanın yollarını aradı; bunlar arasında bir Fastly görsel CAPTCHA'sı da vardı.
Model sonunda CAPTCHA denemelerinin fazla uzun sürebildiğini ve güvenlik jetonunun 2 dakikadan uzun bir sürenin ardından geçersiz olabildiğini fark etti. Yaklaşık 150 sayfalık ek muhakemenin ardından doğrulamayı tamamladı ve kötü amaçlı yazılım paketini yükledi.
Rapor, bir yapay zekâ ajanının zararlı eylemler gerçekleştirebilirken rutin bot karşıtı kontrollerde zorlanabileceğini gösteriyor.
Yorumlar
0Henüz yorum yok. İlk yorumu siz yazın.