Saltar al contenido
← Todos los artículos
Noticias Musicales
12,320,916 canciones de YouTube ya están entrenando una IA. Búscate.
Foto · Foto base: Tom Majric vía Pixabay. Tratamiento: BCKSTG.

12,320,916 canciones de YouTube ya están entrenando una IA. Búscate.

Por BCKSTG EditorialÚltima revisión:

12,320,916 canciones de YouTube ya están en LAION-DISCO-12M, el dataset que entrena modelos de IA. Búscate. Lee lo que Google argumentó.

Los últimos dieciocho meses, los laboratorios de inteligencia artificial vinieron juntando música por todos lados. Algunos anunciaron sus datasets. Otros dejaron que aparecieran en línea por su cuenta. La regla es simple. Si tu música está publicada en público, alguien la considera material para entrenar un modelo.

El recibo más grande que existe ahora se llama LAION-DISCO-12M. La metodología arrancó con un paper de NeurIPS 2023 llamado DISCO-10M, de un equipo de ETH Zürich. La organización alemana LAION corrió la misma receta a escala mayor y publicó el resultado en Hugging Face en noviembre de 2024. Una lista de 12,320,916 canciones referenciadas por ID de YouTube, con título, artista, conteo de vistas y duración para cada una. Unos 91 años de música. Cerca de 750 MB de archivos parquet, licenciados bajo Apache 2.0.

DISCO-12M no es el único dataset público de música en circulación. SLEEPING-DISCO 9M usa la misma receta a escala menor. El buscador AI Watchdog de The Atlantic cubre ambos, y otros más. Si no apareces en uno, podrías estar en otro.

El dataset no contiene el audio. Contiene los recibos que apuntan al audio en YouTube. Cualquiera con los IDs puede bajar las canciones y entrenar un modelo con ellas. La diferencia importa para los abogados. Para el artista cuyas canciones están en la lista, importa menos. La pista ya está señalada.

Busca tu nombre en AI Watchdog de The Atlantic

Quién carga el golpe

Los artistas independientes. Los sellos grandes tienen departamentos legales. Tú no.

DISCO-12M se armó desde YouTube, que también es la plataforma de distribución, el motor de descubrimiento y la salida real de la mayoría de la música independiente. No hay una manera práctica de salirte.

AI Watchdog de The Atlantic viene siguiendo este tipo de lanzamientos según van saliendo. La cobertura, hasta ahora, está toda en inglés. Su buscador cubre varios datasets en un solo lugar.

Lo que Google acaba de argumentar en corte

El caso tiene un trasfondo que vale la pena conocer. En noviembre de 2023, Google DeepMind presentó Lyria y dio crédito a cuatro investigadores como contribuidores principales. En pocos meses los cuatro dejaron Google, fundaron Udio, y la RIAA los demandó en junio de 2024. Udio cerró acuerdo con Universal Music Group en octubre de 2025, comprometiéndose a reconstruir el modelo solo con música licenciada. Google vio cómo demandaban a los mismos que armaron su IA musical por exactamente eso, y aun así lanzó Lyria 3 el 18 de febrero de 2026, dentro de la app Gemini con sus 750 millones de usuarios mensuales.

De esa cronología se cuelga la demanda. Según las citas a pie de página de la demanda a la investigación publicada por Google (principalmente el paper de MusicLM de Google Research), al menos 44 millones de clips y 280,000 horas de música se usaron para entrenar los modelos musicales de Google, y según la demanda, el dataset real es bastante mayor.

El lunes 8 de junio de 2026, Google presentó una moción para desestimar la demanda colectiva que un grupo de artistas independientes le interpuso en la Corte de Distrito de los Estados Unidos para el Distrito Norte de Illinois (Kogon v. Google LLC, No. 1:26-cv-02582, presentada el 6 de marzo de 2026 por el bufete Loevy & Loevy). La demanda acusa a Google de usar sus canciones sin permiso para entrenar Lyria 3, su modelo de generación musical. Music Business Worldwide reportó la moción el 10 de junio de 2026, en una nota firmada por Mandy Dalugdug.

El argumento central de Google cabe en una línea. Cuando los demandantes subieron sus canciones a YouTube, le otorgaron a Google una licencia que cubre, entre otras cosas, el entrenamiento de inteligencia artificial. Si el tribunal le da la razón, ese mismo argumento se vuelve la plantilla para cualquiera que entrene un modelo sobre música subida a una plataforma con términos amplios. No solo para DISCO-12M. Para todo lo que venga después.

La discusión legal puede tardar meses. Lo material no. Las canciones ya están en la lista.

¿Qué partes de la letra pequeña en los términos de plataformas como YouTube deberían revisar con más cuidado los artistas independientes para evitar ceder, sin darse cuenta, permisos que permitan usar su música en el entrenamiento o desarrollo de modelos de IA, especialmente cuando esas plataformas son casi indispensables para crecer una carrera musical?

Lo que piensa un abogado

“Lo primero que cualquier artista necesita saber sobre los datasets SLEEPING-DISCO y LAION-DISCO es que YouTube no estuvo involucrado de ninguna manera. Los armaron grupos de investigación sin fines de lucro, que ensamblaron metadatos de código abierto para que terceros los usaran después en el desarrollo de modelos generativos de IA.

La demanda de YouTube / Lyria 3 plantea otro tema interesante. Los artistas modernos que quieren darse la mejor oportunidad de crecer y construir una base de fans no sienten que tengan opción. Necesitan estar donde están los fans, sin importar lo malos que sean los términos. Para el entrenamiento de IA, revisa qué dicen las políticas y los términos de cada plataforma y, cuando sea posible, actualiza tu configuración para optar por no participar en el entrenamiento.”

Ryan Schmidt, Esq. Abogado de música. Representa a artistas, compositores y productores en contratos discográficos, acuerdos de publicación y transacciones de catálogo. Fue artista de grabación y gira antes de ejercer derecho. Respuesta traducida del inglés.

Lo que piensa un productor

"Si tu mayor miedo es que alguien escriba un prompt en una computadora y reemplace toda tu producción artística, tu competencia no es la IA. Tu competencia es ser aburrido."

Gino The Ghost. Productor ganador de 6 Grammys. CA7RIEL & Paco Amoroso, Saweetie, Nathy Peluso.
Vía @ginotheghost / ginotheghost.com. Un take que vale la pena masticar.

"La IA se robó mi música. Una herramienta de búsqueda se hizo viral cuando los artistas descubrieron que podían buscar dentro de los datasets masivos de entrenamiento de IA y ver si su música estaba incluida. Cientos de canciones que he escrito y producido en los últimos diez años aparecieron en ese dataset. ¿Y cómo me siento al respecto? Vamos a desglosarlo.

La historia que circula es que a Suno lo agarraron con un disco duro gigante etiquetado 'música robada', y no es necesariamente lo que está pasando aquí. Estar en uno de estos datasets no prueba que ninguna compañía haya entrenado con él. La palabra clave es entrenado. En realidad hay dos conversaciones completamente distintas pasando al mismo tiempo, y si vamos a tener esta conversación, hay que tener la correcta.

Conversación número uno: no me gusta que mi música haya sido usada sin mi permiso. Eso es justo. Podemos tener esa conversación. Pero conversación número dos: esto es violación de copyright, voy a demandar. Eso está mal.

Cada artista es la suma de miles de artistas que vinieron antes. Si yo escucho diez mil canciones y escribo una inspirada en lo que aprendí, eso es arte. ¿Si una computadora escucha diez mil canciones para generar música, eso es robo? ¿Qué lo hace robo?

Tú eres dueño del copyright. Eres dueño de la melodía y de las palabras. Pero no eres dueño del vibe. ¿Recuerdas la demanda entre Ed Sheeran y Marvin Gaye? La perdieron. Porque si la inspiración se vuelve infracción, la música simplemente deja de existir.

Ahora lo que viene va a sonar duro, pero hay que decirlo. Si tu mayor miedo es que alguien escriba un prompt en una computadora y reemplace toda tu producción artística, tu competencia no es la IA. Tu competencia es ser aburrido.

Los grandes artistas tienen valor porque tienen gusto, tienen perspectiva, tienen personalidad, tienen una historia. Cosas que no encajan limpiamente en un dataset. Cuando sacas esa canción, la sueltas al mundo para inspirar a otros. No decides realmente a quién. ¿Entonces voy a demandar a mis colegas que también se inspiraron en mi canción? ¿Timbaland está demandando a todos los que usan 808? No. A mí no me amenazan los modelos generativos."

Búscate

Usa AI Watchdog de The Atlantic. Busca en LAION-DISCO-12M, SLEEPING-DISCO 9M y otros datasets públicos de entrenamiento musical en un solo lugar. Escribe el nombre del artista ahí.

Mientras reporteábamos esta nota, montamos brevemente nuestro propio espejo de LAION-DISCO-12M. Un sitio pequeño como el nuestro no puede alojar de forma responsable un índice de 793,000 artistas a largo plazo, y una búsqueda de un solo dataset siempre iba a cubrir menos terreno que la de The Atlantic. La de ellos es la mejor. Úsala.

Antes de que el caso Lyria 3 produzca cualquier respuesta legal, hay tres movimientos concretos.

Uno. Documenta. Captura la búsqueda de The Atlantic con la fecha. Si una demanda colectiva avanza, ese conteo es prueba útil.

Dos. Pide la baja directo al host. La página del dataset en Hugging Face tiene un botón de community report y un correo de contacto. La remoción se gestiona ahí, no con LAION ni con Google.

Tres. Sigue el caso. Lo que resuelva el tribunal sobre la licencia de YouTube va a marcar la plantilla para el próximo dataset, no para este.

Preguntas Frecuentes

¿Qué es LAION-DISCO-12M?

LAION-DISCO-12M es un dataset público publicado en Hugging Face en noviembre de 2024 por LAION, una organización alemana sin fines de lucro conocida sobre todo por haber compilado los datasets de imágenes detrás de Stable Diffusion. El dataset lista 12,320,916 canciones por ID de video de YouTube, con título, nombre del artista, conteo de vistas y duración para cada pista. Unos 91 años de audio continuo si se reprodujera de corrido. El paquete pesa cerca de 750 MB en archivos parquet, licenciado bajo Apache 2.0, lo cual permite a cualquiera usarlo, modificarlo y redistribuirlo con fines comerciales sin pagarle nada a los artistas cuyas canciones lista. El dataset en sí no contiene los archivos de audio. Contiene los IDs de YouTube que apuntan a las canciones, lo cual es suficiente para que cualquier laboratorio de IA con un script de descarga baje el audio y entrene un modelo generativo musical con él. La metodología arrancó con un paper de NeurIPS 2023 llamado DISCO-10M de investigadores en ETH Zürich; LAION corrió la misma receta a escala mayor.

¿Mi música se usó para entrenar IA?

Abre AI Watchdog de The Atlantic, escribe cualquier variación de escritura de tu nombre de artista que aparezca en YouTube, y verás cuántas pistas aparecen en varios datasets de entrenamiento de IA musical junto con títulos de muestra. Aparecer no prueba que una empresa de IA específica entrenó su modelo con tus canciones. Los datasets están alojados públicamente en Hugging Face y se usan abiertamente en la comunidad de investigación de IA, pero ningún laboratorio de IA está obligado a revelar qué datasets usó para entrenar. Lo que sí confirma una coincidencia: tu obra está en una lista empaquetada y descargable, construida específicamente para entrenamiento de IA musical.

¿Cómo pido que saquen mi música de DISCO-12M?

La remoción se gestiona en el host del dataset, Hugging Face, no en LAION (la organización sin fines de lucro que lo compiló) ni en Google (que aloja los videos originales de YouTube). Abre la página del dataset LAION-DISCO-12M en Hugging Face, baja a la sección de comunidad, y envía un community report señalando las filas que contienen tus pistas. La página del dataset también lista un correo de contacto para solicitudes de remoción directas. Documenta tu caso primero capturando el resultado de tu búsqueda en AI Watchdog con la fecha visible. Esa marca temporal es potencialmente prueba útil si avanza una demanda colectiva y te sumas como demandante. La remoción en Hugging Face detiene la distribución adicional de tus IDs de YouTube a través de ese dataset, pero no saca el audio de YouTube en sí, y no deshace el entrenamiento que ya ocurrió. Existen otros datasets públicos; podrías necesitar enviar takedowns en cada uno por separado.

¿Qué argumenta exactamente la moción de Google en el caso Kogon?

Google argumenta que cuando los demandantes subieron sus canciones a YouTube, aceptaron los términos de servicio de YouTube, y esos términos le otorgaron a Google una licencia que cubre, entre otras cosas, el entrenamiento de modelos de IA con el contenido subido. Si el tribunal le da la razón, ese mismo argumento se vuelve la plantilla para cualquier empresa que entrene un modelo sobre música subida a cualquier plataforma con términos amplios. No solo DISCO-12M, sino todo lo que venga después. El caso en la Corte del Distrito Norte de Illinois es Kogon v. Google LLC, número de caso 1:26-cv-02582, presentado el 6 de marzo de 2026 por el bufete de Chicago Loevy & Loevy. La moción para desestimar se presentó el 8 de junio de 2026 y fue reportada por primera vez por Music Business Worldwide el 10 de junio. Un fallo puede tardar meses. Los demandantes incluyen once artistas independientes nombrados representando una clase propuesta de artistas similarmente situados.

¿Qué significa esto para los artistas independientes que dependen de YouTube?

YouTube es la plataforma de distribución, el motor de descubrimiento y la salida real de la mayoría de la música independiente. Los términos de servicio de la plataforma los escribe Google y se actualizan unilateralmente; subir una pista se trata como aceptación legal de lo que digan esos términos en ese momento. Si el tribunal acepta la lectura de Google en Kogon, salirte del entrenamiento de IA y quedarte en YouTube como plataforma de carrera empiezan a parecer mutuamente excluyentes. La elección no es realmente una elección si irse significa perder la superficie de descubrimiento que alimentó la carrera en primer lugar. Esa es la pregunta de fondo que los artistas en Kogon están probando: si un acuerdo clickwrap unilateral es cobertura legal suficiente para que una empresa de 2 billones de dólares extraiga un producto comercial derivado del trabajo subido por creadores independientes. La respuesta marca la plantilla para el próximo dataset, y el siguiente.

Abre AI Watchdog de The Atlantic

← Leer másBCKSTG Playback

¿Tienes una historia para Playback? Mándanos el ángulo.

Propón una Historia