Microsoft afirma que un análisis de 8,2 millones de registros de chats de Copilot encontró pocas pruebas de que el chatbot reprodujera partes sustanciales de artículos de noticias o libros.
Los registros se entregaron a un experto contratado por varios editores durante la fase de descubrimiento de un litigio por derechos de autor en el que participan Microsoft, OpenAI, The New York Times, Center for Investigative Reporting y autores de libros. Microsoft afirma que las conversaciones se seleccionaron porque coincidían con palabras clave relacionadas con los sitios web de los editores y, por tanto, tenían más probabilidades de contener sus obras.
Según Microsoft, 59.545 conversaciones contenían al menos 16 palabras en común con contenido periodístico utilizado para fundamentar el modelo de IA. Un experto de Center for Investigative Reporting identificó 51 casos de “superposición sustancial” con trabajos de CIR. En el caso de los autores, Microsoft afirma que solo 24 de los 8,2 millones de conversaciones contenían respuestas con al menos 30 palabras coincidentes. Solo 10 de los 212 libros evaluados tenían alguna coincidencia, según la empresa.
Microsoft sostiene que los resultados respaldan su postura de que usar material protegido por derechos de autor en conjuntos de datos para entrenar IA puede considerarse fair use. La empresa afirma que Copilot se utiliza con fines significativamente distintos de los de las obras originales y que la reproducción ocasional de texto no socava el propósito transformador del entrenamiento de modelos de lenguaje de gran tamaño.
Microsoft presentó el escrito el viernes mientras solicitaba summary judgment. Si el juez rechaza la solicitud, el caso continuará en los tribunales.
Comentarios
0Aún no hay comentarios. Escribe el primero.