En 2024, la empresa de inteligen cia artificial (IA) Anthropic puso en marcha una estrategia consistente en adquirir millones de libros, des hojarlos, escanearlos y utilizar su contenido para alimentar modelos de IA. Los detalles de la iniciativa, lla mada Proyecto Panamá, se mantu vieron en secreto hasta que un juez de distrito en Estados Unidos hizo públicos más de 4 mil páginas de documentos de una demanda por derechos de autor. En entrevista con La Jornada, Ismael Everardo Bárcenas Pati ño, responsable del Laboratorio de Inteligencia Artificial Microsoft de la Universidad Nacional Autó noma de México (UNAM), explicó que modelos de IA, como los que dan soporte a chatbots, necesitan grandes cantidades de informa ción para responder consultas de ámbitos de la salud, la educación y otros. “Si lo entrenamos con un libro sobre medicina, todos esos datos se cargan en el modelo y entonces es capaz de utilizar esa información para inferir sobre alguna consulta”, explicó el especialista. En busca de nuevas fuentes de entrenamiento En entrevista por separado, Rocío Aldeco Pérez, especialista en cripto grafía, cadena de bloques y sistemas distribuidos, considera que lo ocu rrido con Anthropic es un síntoma de que para entrenar a la IA están buscando nuevas fuentes de infor mación más allá de los contenidos disponibles en Internet. “Hay libros antiguos que nunca fueron digitalizados; entonces su información nunca se usó para ese entrenamiento, recurrir a ellos es una manera de ver si esos datos me jorarían el modelo de aprendizaje que ya se tiene.” Los documentos legales hechos públicos y revisados por The Wa Anthropic destruyó millones de libros con los que alimentó su IA Es una consecuencia de la competencia acelerada de esa tecnología // Especialistas instan a universidades y gobierno a debatir en la materia con el de profesores que enseñan a escribir bien. Sin embargo, el juez dejó abierta la disputa sobre los libros obtenidos de fuentes que infringían derechos de autor. Lejos de nuestra realidad Para Bárcenas Patiño, México está lejos de ver una operación como Proyecto Panamá, debido a que el país no cuenta con la infraestruc tura necesaria para emprender un proceso como ése, que requiere centros de datos de alta potencia, equipos especializados y grandes capacidades de cómputo. Sin embargo, dijo que el país tiene grandes volúmenes de información que podrían ser de interés para em presas extranjeras que desarrollan modelos de IA. Entre ellos, mencio nó la producción editorial, los con tenidos disponibles públicamente en Internet, la información que los usuarios generan en plataformas shington Post revelaron que Anthro pic había recurrido a libros y otros contenidos de sitios que distribuían contenidos sin respetar derechos de autor. Según esos registros, Anthro pic compró millones de libros usa dos. El plan contemplaba cortar los lomos de los ejemplares para escanear sus páginas y, posterior mente, entregarlos a una empresa de reciclaje. Aldeco Pérez y Bárcenas Patiño coincidieron en que, en medio de la competencia acelerada por de sarrollar modelos de IA, uno de los principales desafíos es el uso de obras protegidas por derechos de autor. “Cuando escribes un libro es peras venderlo y ganar dinero para seguir escribiendo. Aquí se usa de maneras que no puedo decir ilega les, pero que tampoco son legales. Es algo que sucede en un espacio gris de la legislación”, apuntó Al deco Pérez. “Estos modelos basados princi palmente en redes neuronales ne cesitan mucha información para entrenarse. El tema aquí es que es tos modelos eventualmente lucran; ▲ Imagen captada en una librería de viejo de la Ciudad de México. Foto Sergio Hernández entonces, sería pertinente evaluar si se tendría que pagar derecho de autor”, agregó Bárcenas Patiño. El juez de distrito William Alsup dictaminó que Anthropic podía uti lizar libros adquiridos legalmente para entrenar a sus modelos de IA, ya que éstos usaban el material de forma transformadora. Comparó el proceso de entrenamiento de IA digitales y datos gubernamentales de acceso público. Tanto Bárcenas Patiño como Aldeco Pérez plantean que, en el contexto de la competencia por la IA generativa, México debe apostar por desarrollar tecnología propia y crear una regulación que establezca límites claros para el uso de obras y datos en entrenamiento de modelos de inteligencia artificial. “Cómo vamos a legislar y cómo vamos a proteger la soberanía de nuestros países frente a esta situa ción son las conversaciones que debemos dar en universidades, empresas y gobierno”, concluyó Aldeco Pérez.
No hay comentarios:
Publicar un comentario