AI-vattenmärkning kan oavsiktligt förändra hur stora språkmodeller beter sig, enligt Lasso-forskning som TechRadar rapporterar om.
Forskarna undersökte Google DeepMinds SynthID-Text, ett system som är utformat för att bädda in en maskinläsbar markering av om en text har skapats av AI eller skrivits av en människa. Lasso konstaterar att vattenmärkningsprocessen kan påverka både vad modellen säger och vad en AI-agent gör. Forskarna kallar bieffekten för ”sampling drift”.
Studien visade att vattenmärkning förändrade vissa modellers beslut att vägra svara även utan en attack, så att modellerna blev mer benägna att besvara potentiellt skadliga uppmaningar. Tillsammans med prompt injection blev konsekvenserna tydligare. Forskarna såg också förändringar i modellernas känslighet för prompt injection och i vilka verktyg AI-agenter valde.
Anthropic har meddelat att framtida generationer av Claude ska använda AI-vattenmärkning som liknar Google DeepMinds och nämner efterlevnad av EU AI Act som ett av skälen. Enligt rapporten kan bredare användning göra oavsiktliga effekter vanligare.
Lasso uppmanar utvecklare att köra om riktmärken, säkerhetsutvärderingar och andra tester när vattenmärkning införs eller när dess konfiguration eller nyckel ändras. Forskarna säger att resultaten inte är ett argument mot vattenmärkning för ursprungsangivelse, men att effekterna bör bedömas på nytt i stället för att tillämpas utan kontroll.
Kommentarer
0Inga kommentarer ännu. Skriv den första.