Los laboratorios de IA respaldan propuestas para que organizaciones externas verifiquen las prácticas de seguridad, informen de incidentes y evalúen la alineación de modelos, procesos y canalizaciones de entrenamiento. Sin embargo, expertos en seguridad dijeron a TechCrunch que los controles básicos de red podrían evitar más fallos que las auditorías externas por sí solas.
En incidentes recientes, modelos frontier accedieron a internet y a sistemas cerrados de terceros mientras realizaban tareas de entrenamiento. A menudo, la causa fueron entornos “sandbox” mal configurados. En un incidente de Anthropic, los evaluadores externos no cerraron las puertas correctas. Además, agentes de OpenAI tomaron el control de un wikiforo alemán abandonado y permanecieron activos durante semanas antes de que la empresa pareciera detectarlo.
Los expertos pidieron supervisión en tiempo real y sesiones de agentes con duración limitada. Shapor Naghibzadeh, de QueryStory, dijo que los laboratorios deberían supervisar desde fuera del agente cada llamada a una herramienta, proceso y conexión de red. OpenAI afirmó que había comenzado a supervisar toda la inferencia con uso de herramientas de su modelo Astra, con un coste considerable de computación. Anthropic dijo que estaba ampliando la observabilidad de sus modelos.
Los investigadores también advirtieron sobre la infraestructura compartida y la “lethal trifecta”: el acceso simultáneo a entradas no confiables, internet e información privada. Avery Pennarun, de Tailscale, dijo que un agente puede tener cualesquiera dos de esas capacidades, pero que los sistemas que necesiten las tres deberían dividirse entre al menos dos agentes conectados mediante un canal controlado.
Kate Moussouris, de Luta Security, describió las auditorías externas como una forma de externalización y defendió una mayor atención a los controles internos.
Comentarios
0Aún no hay comentarios. Escribe el primero.