Un piratage a révélé le secret de Suno : il a extrait des données de YouTube pour entraîner son modèle musical IA

Une attaque de la chaîne d'approvisionnement en novembre 2025 contre Suno, générateur de musique IA, a révélé bien plus qu'un incident de sécurité — elle a montré exactement comment l'entreprise a construit son modèle. Un acteur non autorisé a obtenu des identifiants d'employé, accédé au code source de Suno et trouvé des preuves que la startup extrayait systématiquement de l'audio de YouTube Music, Deezer, Genius, des bibliothèques de musique libre de droits et des flux RSS de podcasts depuis des années, comme l'a rapporté 404 Media en premier, suivi par TechCrunch.
Ce que le piratage a révélé
L'attaquant a accédé aux systèmes internes de Suno en utilisant un identifiant d'employé compromis lors d'une intrusion classique de la chaîne d'approvisionnement. Dans le code source, ils ont trouvé l'infrastructure que Suno utilise pour extraire et traiter l'audio à grande échelle — ciblant spécifiquement les plateformes avec des catalogues suffisamment grands pour couvrir un large éventail de styles musicaux, de genres et de techniques de production. YouTube Music, avec sa combinaison de sorties officielles et de contenu téléchargé par les utilisateurs, semble avoir été la source principale.
C'est important car Suno a publiquement affirmé s'entraîner sur des "fichiers musicaux accessibles au public" sous la doctrine du fair use. La documentation de la brèche suggère que l'entreprise contournait activement les protections anti-scraping de YouTube, ce qui est une affirmation totalement différente — et qui contredit directement les conditions d'utilisation de Google et pourrait violer la loi américaine sur le droit d'auteur (DMCA).
La bataille sur le droit d'auteur devient plus difficile à défendre
Les maisons de disques — dont Universal Music Group, Sony Music et Warner Music Group — poursuivent déjà Suno devant un tribunal fédéral pour violation de droits d'auteur. Les preuves de la brèche sont le genre de documentation interne dont les avocats rêvent : elles montrent non seulement que le modèle a été entraîné sur de l'audio protégé, mais que l'entreprise a construit des outils spécifiques pour l'extraire de plateformes qui interdisent le scraping.
Le concurrent Udio fait face à des accusations similaires, et Google lui-même fait face à des poursuites pour droits d'auteur de la part de grands éditeurs concernant ses pratiques d'entraînement IA. Mais le dossier de Suno semble plus difficile à défendre maintenant que des outils internes confirmant le scraping de YouTube ont fait surface en dehors de l'entreprise.
Les données des clients ont également été volées — et personne n'a été informé
La brèche n'a pas seulement exposé la méthodologie d'entraînement de Suno. L'attaquant a également accédé aux données des clients : adresses e-mail, numéros de téléphone et numéros partiels de cartes de crédit stockés via Stripe. Suno a qualifié l'incident d'"incident de sécurité limité rapidement contenu" — mais n'a pas informé directement les clients concernés. En vertu de réglementations comme le RGPD et la plupart des lois américaines sur la notification des brèches, cette omission pourrait elle-même constituer un problème de conformité selon la portée et le calendrier.
Pour les utilisateurs qui se sont inscrits avec une carte de crédit ou un vrai numéro de téléphone, la brèche est une préoccupation concrète pour la vie privée, pas seulement un litige d'entreprise abstrait. Suno n'a pas divulgué publiquement combien de comptes ont été affectés.
Pourquoi cela continue
Les entreprises d'IA sont confrontées à un problème structurel d'incitation : les modèles qui gagnent commercialement sont entraînés sur les ensembles de données les plus diversifiés et de haute qualité. Obtenir une licence pour cet audio à grande échelle auprès des ayants droit est coûteux et lent. Le scraping est rapide et bon marché — jusqu'à ce qu'une brèche, un procès, ou les deux, fassent s'effondrer la structure de coûts. Suno est le dernier exemple, mais ce ne sera presque certainement pas le dernier.
Originally reported by TechCrunch. Read the original article for additional details.
View original source