Las marcas de agua de IA pueden cambiar involuntariamente el comportamiento de los modelos de lenguaje de gran tamaño, según una investigación de Lasso citada por TechRadar.
Los investigadores analizaron SynthID-Text de Google DeepMind, un sistema diseñado para incorporar un indicador legible por máquinas que señale si un texto fue generado por IA o escrito por una persona. Lasso concluye que el procedimiento de marcado puede afectar tanto a lo que dice el modelo como a lo que hace un agente de IA. La investigación denomina “sampling drift” a este efecto secundario.
El estudio descubrió que las marcas de agua cambiaron las decisiones de rechazo de algunos modelos incluso sin un ataque, haciéndolos más propensos a responder a solicitudes potencialmente dañinas. Al combinarse con prompt injection, las consecuencias fueron más marcadas. Los investigadores también observaron cambios en la susceptibilidad de los modelos a prompt injection y en las herramientas que elegían los agentes de IA.
Anthropic ha anunciado que las futuras generaciones de Claude usarán marcas de agua de IA similares a las de Google DeepMind, y señaló el cumplimiento de la EU AI Act como una de las motivaciones. Según el informe, una adopción más amplia podría hacer más frecuentes los efectos imprevistos.
Lasso recomienda repetir las pruebas de referencia, las evaluaciones de seguridad y otros análisis cada vez que se introduzcan marcas de agua o cambien su configuración o clave. Los investigadores afirman que los hallazgos no son un argumento contra las marcas de agua para la procedencia, pero muestran que sus efectos deben reevaluarse en lugar de aplicarlas sin más.
Comentarios
0Aún no hay comentarios. Escribe el primero.