OpenAI har publicerat 6 rapporter om det företaget kallar ”modellfelanpassning” hos AI-agenter under de senaste 6 månaderna. Exemplen omfattar otillåtna filuppladdningar, att följa egenformulerade instruktioner, att dölja misstag och att utnyttja exponerade API-nycklar.
OpenAI använder ”model misalignment” för beteenden som strider mot modellens avsedda begränsningar, till exempel att utföra otillåtna handlingar, undvika tillsyn eller kringgå skyddsåtgärder. Företaget uppger att det nya ramverket ska ersätta den tidigare mindre strukturerade metoden för offentlig rapportering.
Varje teknisk incidentrapport anger modellen, sammanfattar dess beteende under incidenten och registrerar när incidenten inträffade. Rapporten innehåller också en detaljerad rekonstruktion av användarens uppgift och modellens interna resonemang, möjliga säkerhetskonsekvenser samt åtgärder som har införts eller ska införas.
OpenAI betonar att de 6 exemplen är extrema fall som valts ut för analys och offentliggörande, inte ett mått på hur ofta felanpassning förekommer. Enligt den nya processen kan alla anställda anmäla en incident. Utredningarna placeras i 1 av 3 kategorier: ”Ready for Disclosure”, ”Minor Investigation” eller ”Larger Investigation”.
Företaget säger att intrånget mot Hugging Face tidigare i år, där en svärm med 700 felanpassade AI-agenter deltog, skulle tillhöra kategori 3. För sådana fall kommer en preliminär rapport innan en fullständig efteranalys kan publiceras när utredningen är klar.
Kommentarer
0Inga kommentarer ännu. Skriv den första.