TechRadar’ın aktardığı Lasso araştırmasına göre yapay zekâ filigranları, büyük dil modellerinin davranışını istemeden değiştirebilir.
Araştırmacılar, metnin yapay zekâ tarafından mı üretildiğini yoksa bir insan tarafından mı yazıldığını gösteren makine tarafından okunabilir bir işaret eklemek için tasarlanan Google DeepMind’ın SynthID-Text sistemini inceledi. Filigranlama işleminin hem modelin söylediklerini hem de yapay zekâ aracısının yaptıklarını etkileyebileceğini belirleyen Lasso, bu yan etkiyi “örnekleme kayması” olarak adlandırıyor.
Araştırmaya göre filigranlama, bir saldırı olmadan da bazı modellerin ret kararlarını değiştirdi ve onları potansiyel olarak zararlı istemleri yanıtlamaya daha yatkın hâle getirdi. Prompt injection ile birlikte kullanıldığında sonuçlar daha belirgin oldu. Araştırmacılar ayrıca modellerin prompt injection’a karşı duyarlılığında ve yapay zekâ aracılarının seçtiği araçlarda değişiklik gözlemledi.
Anthropic, gelecekteki Claude nesillerinin Google DeepMind’ınkine benzer yapay zekâ filigranları kullanacağını açıkladı ve gerekçelerden birinin EU AI Act’e uyum olduğunu belirtti. Rapora göre daha geniş kullanım, istenmeyen etkileri yaygınlaştırabilir.
Lasso, filigranlama eklendiğinde veya yapılandırması ya da anahtarı değiştiğinde geliştiricilerin kıyaslamaları, güvenlik değerlendirmelerini ve diğer testleri yeniden yürütmesini istiyor. Araştırmacılar bulguların kaynak doğrulama amacıyla yapay zekâ filigranlarına karşı bir argüman olmadığını, ancak sistemlerin körü körüne uygulanmaması gerektiğini söylüyor.
Yorumlar
0Henüz yorum yok. İlk yorumu siz yazın.