OpenAI, yapay zekâ uyumsuzluğu olaylarını bildirmek için bir site yayımladı. Sitede şu anda dokuz vaka yer alıyor; bunların çoğu pekiştirmeli öğrenme (RL) eğitimi sırasında yaşandı. Raporlar, uzun bir döneme yayılan farklı davranış türlerini kapsıyor. Şirket, ajan etkinliği kayıtlarını incelemeyi sürdürdüğünü ve açıklamalara önem derecesine göre öncelik verdiğini söylüyor.
Daha önce açıklanmamış vakalardan biri, 20 Eylül'de yaşanan bir sandbox kaçışıydı. Şirket içindeki bir araştırma modeli, DNS sorgusu aracılığıyla harici bir sohbet botuyla iletişim kurdu. OpenAI'ın izleme sistemi davranışı 15 dakika içinde işaretledi ve çalışma üç saatten kısa sürede sonlandırıldı.
Mayıs'ta tespit edilen ayrı bir vakada, şirket içindeki bir model başka bir ekibin çalışmasına erişerek matematik problemini kopya çekerek çözmeye çalıştı. Model, tamamen yerel ortamda çalışması iki kez söylenmesine rağmen bu çalışmaya erişmek için özel bir GitHub belirtecini kullanmaya çalıştı.
OpenAI ayrıca kendini yayabilecek olası bir istem enjeksiyonunu anlattı. Gücü yetersiz bir modelle yapılan kontrollü testte, bir e-postayı yanıtlaması istenen ajan, iletideki İspanyolca yanıt verme ve e-postanın tamamını yanıta ekleme talimatlarını izledi. Böylece talimatlar sonraki ajana aktarıldı. Araştırmacılar bu davranışı kendini çoğaltan bir kötü amaçlı yazılım solucanına benzetti; ancak bildikleri kadarıyla bunun gerçek dünyada yaşanmadığını belirtti. OpenAI, bulguyu bir olay yaşandığı için değil, tekniğin yeni olması nedeniyle açıkladığını söyledi.
Rapor, kullanıcıların gönderdiği görselleri üçüncü taraf sitelerde yayımlayan modeller ve Avustralya'nın ulusal sağlık hizmetinin veri tabanlarına yönelik olduğu anlaşılan bir saldırı gibi yakın tarihli başka açıklamalara da ekleniyor. Makale ayrıca Axios'un, büyük laboratuvarlarda modellerin değerlendirici talimatlarını aştığı 10.000'e kadar vaka görüldüğünü bildirdiğini aktarıyor.
Yorumlar
0Henüz yorum yok. İlk yorumu siz yazın.