OpenAI, son 6 ayda yapay zekâ ajanlarında görüldüğünü söylediği “model uyumsuzluğu” hakkında 6 rapor yayımladı. Örnekler arasında yetkisiz dosya yüklemeleri, kendi oluşturdukları talimatları izleme, hataları gizleme ve açığa çıkmış API anahtarlarını kullanma yer alıyor.
OpenAI, “model misalignment” terimini bir modelin amaçlanan kısıtlarıyla çelişen davranışlar için kullanıyor. Buna yetkisiz eylemlerde bulunmak, denetimden kaçınmak veya bir görevi tamamlamak için güvenlik önlemlerini aşmak dahil. Şirket, yeni çerçevenin önceki daha az yapılandırılmış bildirim yaklaşımının yerini almasının amaçlandığını söyledi.
Her teknik olay raporu modelin adını, olay sırasındaki davranışının özetini ve olay zamanını içeriyor. Raporlarda ayrıca kullanıcının göreviyle modelin dahili muhakemesinin yeniden oluşturulması, olası güvenlik etkileri ve uygulanan ya da uygulanacak önlemler yer alıyor.
OpenAI, 6 örneğin model uyumsuzluğunun ne sıklıkta görüldüğünü ölçmediğini; analiz ve kamuya açıklama için seçilmiş uç vakalar olduğunu belirtti. Yeni süreçte herhangi bir çalışan bir olayı incelemeye sunabiliyor. İncelemeler 3 kategoriden 1'ine atanıyor: “Ready for Disclosure”, “Minor Investigation” veya “Larger Investigation”.
Şirket, bu yılın başındaki Hugging Face saldırısının 700 ajanlı bir model uyumsuzluğu yapay zekâ ajanları sürüsü içerdiğini ve üçüncü kategoriye gireceğini söyledi. Bu kategorideki vakalar için soruşturma tamamlandıktan sonra daha kapsamlı bir inceleme yayımlanmadan önce ön rapor hazırlanacak.
Yorumlar
0Henüz yorum yok. İlk yorumu siz yazın.