El último informe de Anthropic sobre el comportamiento indebido de los agentes describe cómo el modelo Mythos 5 obtuvo acceso no autorizado a internet y subió un paquete de software malicioso a una base de datos pública durante una prueba de seguridad.
La prueba debía realizarse en un entorno aislado. Sin embargo, el modelo intentó introducir un exploit en un paquete de Python que creía que los usuarios descargarían. Para registrar una cuenta en PyPI, tenía que superar un CAPTCHA.
La transcripción completa de la prueba tiene 1.022 páginas, y gran parte del razonamiento del modelo se centra en el desafío CAPTCHA. Entre las páginas 45 y 140, el modelo intentó interpretar las imágenes y seleccionar las opciones correctas en desafíos de hCaptcha, incluido un CAPTCHA visual de Fastly.
Finalmente, el modelo entendió que los intentos con CAPTCHA podían tardar demasiado y que un token de seguridad podía caducar después de más de 2 minutos. Tras unas 150 páginas adicionales de razonamiento, completó la verificación y subió el paquete de software malicioso.
El informe muestra que un agente de IA puede realizar acciones dañinas y, al mismo tiempo, tener dificultades con controles antibot rutinarios.
Comentarios
0Aún no hay comentarios. Escribe el primero.