Un hilo sobre la demanda de escritores contra OpenAI y Microsoft fue ayer, domingo 27 de septiembre, una de las publicaciones más comentadas de Hacker News: más de 600 puntos y más de 600 comentarios. Los documentos se habían hecho públicos unos días antes, pero el fin de semana llegaron a mucha más gente. Muestran algo incómodo: dentro de las empresas se sabía que entrenar modelos con libros sin permiso tenía riesgos legales y podía dejar sin trabajo a muchos autores.

Imagen ilustrativa del artículo Foto: Ron Lach / Pexels

Imagen ilustrativa del artículo Foto: Andrea Piacquadio / Pexels

Qué pasó

  • La Authors Guild y 16 escritores, entre ellos George R.R. Martin, John Grisham y Jonathan Franzen, demandaron a OpenAI y Microsoft en un tribunal federal de Nueva York. El caso forma parte de un litigio que agrupa varias demandas por derechos de autor contra ambas empresas.
  • El 21 de septiembre se publicaron escritos judiciales que antes estaban censurados. Según la versión de los demandantes, OpenAI usó libros de LibGen, una biblioteca pirata, desde antes de abril de 2019, y Microsoft lo sabía.
  • Los escritos también citan mensajes internos de 2020 en los que un directivo de políticas de OpenAI dice que la compañía esperaba desplazar a escritores de ficción de género y que probablemente seguiría adelante aunque hubiera protestas.
  • Según los demandantes, en 2022 OpenAI borró esos archivos en una iniciativa interna llamada "Project Clear".
  • Días antes, el 17 de septiembre, se habían revelado documentos parecidos en la demanda de The New York Times. Allí aparecen advertencias internas de Microsoft sobre un posible círculo vicioso: las respuestas generadas por IA reducen las visitas a los sitios que produjeron la información original.
  • Microsoft sostiene que esas frases reflejan opiniones personales de empleados y no una política de la empresa. OpenAI no hizo comentarios, pero mantiene que entrenar modelos está protegido por el uso legítimo (fair use). El caso está en la fase de juicio sumario y todavía no hay sentencia. Una audiencia se espera para principios de 2027.

Algo importante: estas son acusaciones de una de las partes, basadas en documentos elegidos por ella. No son hechos probados por un juez.

Por qué importa

Para cualquier persona que crea contenido en español, sea periodista, bloguero, autor independiente o marca con estrategia de contenidos, este caso importa más de lo que parece:

  • Define quién paga por el conocimiento con el que se entrena la IA. Si un tribunal de Estados Unidos concluye que usar obras pirateadas no es uso legítimo, cambian las reglas para todas las empresas del sector y para los contenidos que publicamos en internet.
  • Confirma lo que muchos medios ya notan en sus estadísticas. Los documentos del caso del Times describen, con palabras de las propias empresas, un escenario en el que las respuestas de la IA sustituyen la visita a la fuente. Para un blog o un medio latinoamericano que vive del tráfico de búsqueda, eso es un riesgo directo para el negocio.
  • Abre preguntas para las empresas que usan IA. Si generas textos para tu marca con herramientas de IA, te conviene saber qué pasa si los datos de entrenamiento terminan en disputa legal.

Nuestro análisis

Lo más llamativo no es que OpenAI haya usado libros sin permiso; esa sospecha ya existía en la industria. Lo nuevo es la supuesta evidencia de que la decisión se tomó con conocimiento de causa. En derecho de autor eso pesa: una cosa es equivocarse sobre si algo es uso legítimo y otra muy distinta es asumir el riesgo porque conviene. Si el juez da peso a esos mensajes, las posibles indemnizaciones pueden crecer mucho.

También hay que ver el otro lado. Las empresas de IA van a insistir en que entrenar un modelo es transformar la información, no copiarla. En otros juicios de este tipo los jueces ya han separado dos preguntas: si entrenar con obras compradas legalmente puede ser uso legítimo, y si descargar copias piratas lo es. El caso contra OpenAI podría seguir ese camino. La tecnología en sí puede quedar protegida, mientras que la forma de conseguir los datos se castiga.

Para Latinoamérica, la lectura práctica es otra. La mayoría de nuestros creadores no puede demandar a una empresa estadounidense, pero sí se ve afectada por lo que ahí se decida. Si el resultado obliga a pagar licencias, veremos más acuerdos entre empresas de IA y grandes editoriales o medios. Los contenidos en español de medios pequeños corren el riesgo de quedar fuera de esas negociaciones: se usan, pero no se pagan. Por eso es importante organizarse (asociaciones de medios, gremios de autores) antes de que se cierre la ventana.

Por último, el caso deja una lección de reputación que sirve para cualquier empresa: lo que escribes en un chat interno puede terminar en un expediente público. El debate en Hacker News no fue tanto sobre la ley como sobre la ética: la sensación de que se priorizó llegar primero por encima de los creadores. Esa percepción daña la confianza en la marca, se gane o no el juicio.

Qué hacer ahora

  1. Revisa los términos de tu sitio. Decide si quieres bloquear a los rastreadores de IA (como GPTBot) en tu archivo robots.txt o si prefieres permitirlos para aparecer en sus respuestas. Tómalo como una decisión de negocio, no por defecto.
  2. Mide cuánto tráfico pierdes por las respuestas de IA. Compara impresiones y clics en Search Console. Si las impresiones suben y los clics bajan, ya estás viviendo el círculo vicioso que describen los documentos.
  3. Diversifica tus canales. Boletines por correo, comunidades propias y redes donde controlas la relación con tu audiencia dependen menos de que un buscador o chatbot te envíe visitas.
  4. Elige herramientas de IA con garantías. Si tu empresa produce contenido con IA, prefiere proveedores que ofrezcan protección legal por derechos de autor en sus planes empresariales y documenta cómo usas esos textos.
  5. Sigue el caso. La audiencia de principios de 2027 puede marcar el precedente más importante sobre IA y derechos de autor de los próximos años.

Fuentes