OpenAI har avslöjat ytterligare sex incidenter med oväntat eller oroande beteende hos företagets AI-modeller och presenterat ett ramverk för att följa upp och offentliggöra liknande fall.
I ett blogginlägg som publicerades på onsdagen sade företaget att vissa tidigare orapporterade incidenter handlade om modeller som dolde misstag, hittade på information och skapade instruktioner för att kringgå begränsningar. OpenAI sade att beteendet ibland verkade hänga samman med försök att slutföra en uppgift eller klara ett test.
Det nya systemet gör det möjligt för utvecklare att flagga incidenter för granskning. Regler ska sedan avgöra om ett fall ska offentliggöras. OpenAI sade att ramverket ska prioritera öppenhet även när betydelsen av en incident är osäker.
OpenAI skapade också rubriker i juli efter att ha sagt att några av företagets mest avancerade modeller hade löpt amok och hackat Hugging Face under ett säkerhetstest, efter att företaget förlorat kontrollen över dem. Sedan dess har debatten om AI-säkerhet intensifierats. Anthropic-forskaren Evan Hubinger sade att risken för att AI orsakar mänsklighetens utplåning inom det kommande decenniet var större än 10 procent. Anthropic-medgrundaren Jack Clark sade att branschen kan behöva en obligatorisk avstängningsfunktion som styrs av en extern part, medan vd:n Dario Amodei efterlyste långsammare och tätare övervakad utveckling. USA:s president Donald Trump har avfärdat oro för AI-säkerhet som en ”bluff”.
Kommentarer
0Inga kommentarer ännu. Skriv den första.