grolektif

MusicGen : test complet, prix et droits

MusicGen est gratuit en local, mais ses poids sont non commerciaux. Test, prix, qualité, français, export et droits.

MusicGen sert au producteur qui cherche une boucle, une idée d’arrangement ou une texture instrumentale à prolonger localement. Il convient moins à qui veut une chanson chantée en français, des paroles personnalisées ou une licence commerciale nette.

Cette page est publiée par la rédaction de grolektif.com, magazine musical indépendant, dans la rubrique IA et création musicale.

Que faut-il retenir de MusicGen en bref ?

MusicGen est une bibliothèque de Meta AI et un ensemble de modèles que l’on peut lancer avec Python, Transformers, des notebooks ou une interface Gradio. La création depuis un texte, la mélodie et la continuation sont documentées. Le prix Meta, les droits commerciaux des poids et la propriété des sorties demandent, eux, une lecture attentive.

PointCe que précisent les sources consultées
Usage principalGénérer de la musique instrumentale depuis une description, sans condition textuelle, avec guidage mélodique ou en continuation d’un audio. La documentation AudioCraft cite les genres, les instruments et les ambiances. MusicGen-Style ajoute une référence audio stylistique.
Formule gratuiteLa page GitHub officielle présente une bibliothèque, des modèles téléchargeables et des démonstrations, pas un abonnement gratuit nommé. Le code est sous MIT. Les poids publiés sont sous CC BY-NC 4.0, avec restriction non commerciale selon la licence des poids.
Prix des plansMeta n’affiche aucun plan mensuel ou annuel MusicGen dans les ressources officielles consultées le 17 septembre 2026. La page Replicate affiche environ 0,033 USD par exécution, avec un coût variable selon les entrées. Ce montant n’est ni un abonnement Meta ni un prix garanti par minute musicale.
Droits commerciaux par planIl n’existe pas de grille de plans Meta à comparer. Le code relève de la licence MIT, qui autorise notamment la modification, la redistribution et la vente de copies sous conditions. Les poids relèvent de CC BY-NC 4.0. L’éditeur ne précise pas une autorisation générale de vendre ou de monétiser chaque sortie.
Formats d’exportLes modèles produisent un audio à 32 kHz, en mono ou en stéréo selon la variante. Dans AudioCraft, audio_write prend en charge WAV, MP3, OGG et FLAC. Le WAV est en PCM 16 bits par défaut et le MP3 à 320 kbit/s par défaut, selon le code d’écriture audio.
LanguesLa fiche officielle indique un entraînement sur des descriptions anglaises et des performances inférieures dans les autres langues. La prise en charge garantie du français est non précisée par l’éditeur. La fiche indique aussi que les modèles publiés ne génèrent pas de voix réalistes.
Ce qui manquePlan payant, crédits, quota quotidien, priorité de file, attribution expresse des sorties, autorisation commerciale des morceaux, garantie Content ID, politique MusicGen de conservation des prompts, tatouage appliqué à chaque sortie, application mobile officielle et Studio commercial : l’éditeur ne précise pas ces points dans les pages consultées.

Ce tableau sépare le logiciel et les poids. Un code libre d’usage ne transforme pas automatiquement un modèle entraîné en outil commercial sans restriction.

MusicGen est-il gratuit ?

MusicGen n’est pas présenté comme un service avec une formule gratuite. Meta publie du code, des poids et des démonstrations. Le code est sous MIT, mais les poids sont sous CC BY-NC 4.0. Un hébergement tiers peut facturer l’exécution, comme Replicate, qui affichait environ 0,033 USD par lancement le 17 septembre 2026.

La page GitHub d’AudioCraft ressemble donc davantage à la page d’un projet logiciel qu’à celle d’une application avec un bouton « Pro ». Meta y documente l’installation, les modèles et la démonstration. Les ressources officielles consultées ne présentent pas de prix mensuel ou annuel MusicGen, pas de crédits renouvelés et pas de quota contractuel de téléchargements.

Il faut compter avec deux accès différents. En local, vous téléchargez la bibliothèque et les poids, puis vous fournissez le calcul. Dans le cloud, vous payez éventuellement l’hébergeur. Replicate affiche un coût estimatif d’environ 0,033 dollar américain par exécution pour meta/musicgen. La page précise que le coût varie selon les entrées. Elle n’affiche pas de forfait mensuel ou annuel propre à MusicGen.

Le script officiel de démonstration contient MAX_BATCH_SIZE=12 et configure une file avec 8*4. Ces valeurs décrivent le code de la démo. Elles ne garantissent ni la disponibilité de l’interface publique, ni un délai, ni un quota quotidien pour chaque visiteur. Le même raisonnement vaut pour le WAV et la prolongation : ils sont documentés dans le projet, pas présentés comme des déblocages premium.

Le code MIT autorise l’utilisation, la modification, la redistribution et la vente de copies du logiciel, avec conservation de la notice de copyright et de la licence dans les copies ou portions substantielles. La licence contient aussi une exclusion de garantie. Ces permissions portent sur le code couvert par le fichier LICENSE, pas sur les poids.

Comment MusicGen fonctionne-t-il ?

MusicGen transforme une description en séquence de représentations audio discrètes. Un Transformer autorégressif produit cette séquence, puis EnCodec la décode en son. L’article scientifique décrit une génération en une étape. Dans la pratique, la documentation propose aussi un guidage par mélodie, une continuation et, avec MusicGen-Style, une référence audio courte.

Le texte peut indiquer un genre, des instruments ou une ambiance. Le mode sans condition textuelle permet d’explorer sans prompt. Le guidage mélodique s’appuie sur des caractéristiques harmoniques extraites de l’audio. Il ne promet pas de recopier exactement un enregistrement.

La documentation distingue Small, avec 300 millions de paramètres, Medium et Melody, avec 1,5 milliard, puis Large et Melody-Large, avec 3,3 milliards. Des variantes stéréo correspondent à ces cinq modèles. Le mot « Large » désigne une taille de modèle. Il ne désigne pas un abonnement supérieur. Pour Medium, AudioCraft recommande une carte graphique de 16 Go de mémoire.

MusicGen-Style suit une autre logique. La fiche Hugging Face et la documentation AudioCraft indiquent une référence de 1,5 à 4,5 secondes, combinable avec une description textuelle. Le modèle extrait des caractéristiques stylistiques et documente des générations jusqu’à 30 secondes. Cela règle la couleur d’une idée. Cela ne constitue pas une fonction documentée de clonage de chanteur.

Les dates du projet demandent aussi un peu de précision. L’article « Simple and Controllable Music Generation » a été déposé sur arXiv le 8 juin 2023. Le changelog d’AudioCraft date la première version publique, 0.0.1, du 9 juin 2023. Meta a annoncé AudioCraft le 2 août 2023. L’annonce générale ne remplace donc pas les deux premières dates.

Le changelog consulté commence par la génération prolongée de la version 0.0.2 du 1er août 2023, puis documente le code d’entraînement en 1.0.0, la lecture et l’écriture audio en 1.1.0, les modèles stéréo en 1.2.0 et des modèles distincts comme MAGNeT et JASCO. Ces numéros appartiennent à la bibliothèque AudioCraft. Ils ne décrivent pas une série commerciale « MusicGen 1, 2, 3 ».

Que valent les voix en français ?

Pour une voix chantée en français, MusicGen est un mauvais point de départ. La fiche de modèle indique que l’entraînement utilise des descriptions anglaises, que les résultats baissent dans les autres langues et que les voix ont été retirées des données des modèles publiés. La prise en charge garantie du français n’est pas précisée par l’éditeur.

La conséquence est concrète. Pour les voix, la fiche va plus loin : MusicGen ne génère pas de voix réalistes. Il ne faut donc pas lire « Melody » comme un modèle de chant. Ici, le mot renvoie au conditionnement mélodique.

MusicGen-Style accepte une courte référence de style, mais une référence de style ne devient pas une identité vocale parce qu’elle contient une voix.

Je réserverais donc MusicGen aux parties instrumentales. Si votre demande commence par un couplet à faire chanter en français, comparez le besoin avec YuE, avis, prix, droits et limites en 2026 dans la même rubrique. Cette page MusicGen ne transforme pas une limite documentée en promesse de chant.

La question des références audio reste ouverte. L’éditeur déconseille les générations volontairement hostiles, offensantes ou porteuses de stéréotypes. La licence Creative Commons ne donne pas automatiquement de droits sur la personnalité ou la vie privée d’un tiers. Une consigne de style ne règle donc pas, à elle seule, le droit d’utiliser l’enregistrement ou l’identité d’une personne.

Quelle qualité audio et quelles durées peut-on attendre ?

La sortie documentée est de 32 kHz, en mono ou en stéréo selon le modèle. Transformers parle d’une fenêtre allant jusqu’à 30 secondes, contexte audio compris. AudioCraft prolonge par fenêtres successives, et la démo Meta montre deux minutes. MusicGen peut donc dépasser 30 secondes, mais une longue forme reste une suite de continuations, pas un morceau garanti cohérent du début à la fin.

Les durées changent selon l’interface. La documentation Transformers indique qu’un extrait initial de 20 secondes laisse au maximum 10 secondes de génération supplémentaire dans sa fenêtre. La démonstration longue d’AudioCraft conserve 20 secondes de contexte et avance par tranches de 10 secondes. Le script Gradio propose 15 secondes en configuration par lots et un réglage de 1 à 120 secondes dans l’interface complète.

Un extrait bref peut donner une idée propre, puis une continuation perdre son motif ou changer de texture. Les pages officielles ne donnent pas de taux de réussite musical. C’est une valeur de réglage dans une interface.

Sur le format, AudioCraft sait écrire WAV, MP3, OGG et FLAC. Le code fixe par défaut le WAV en PCM 16 bits et le MP3 à 320 kbit/s. Le débit MP3 décrit l’encodage du fichier. Il ne transforme pas la sortie du modèle en master de studio. Pour un créateur vidéo, ce sera un fichier exploitable. Pour une mise en ligne musicale, il faudra encore écouter, monter et contrôler.

Meta présente MultiBandDiffusion comme un décodeur capable de réduire certains artefacts, avec davantage de calcul. Ce mot compte pour une installation locale. Le résultat dépend du modèle, de la machine et de la continuation choisie. La page Matériel et home studio de grolektif.com est plus adaptée si votre question devient celle de la carte graphique ou du suivi d’écoute, car MusicGen ne fournit pas ici de fiche de configuration complète pour chaque variante.

Les tests publiés donnent une réception partagée. Dans son comparatif d’écoute du 16 juin 2023, MusicRadar a confronté MusicGen et MusicLM sur cinq demandes. MusicGen remporte le face-à-face 3 à 2. Le journal le juge prometteur pour des idées et des boucles, pas encore convaincant comme remplacement de morceaux produits par des humains.

TechCrunch le décrit comme mélodieux sans remplacer les musiciens. Clubic juge ses résultats avancés face à MusicLM, mais encore courts et répétitifs. Ces articles datent de 2023 et ne testent pas toutes les variantes disponibles en 2026. Ils éclairent la réception du lancement. Ils ne constituent pas un benchmark actuel de Small, Medium, Large et MusicGen-Style.

Les témoignages d’utilisateurs vont dans les deux directions. Dans un fil Reddit du 11 juin 2023, plusieurs commentaires jugent les générations fades ou proches d’une musique d’ambiance. Dans un autre fil du 12 juin, un utilisateur signale des débuts et des fins abrupts. Sur Audiofanzine, Drumfish dit avoir attendu 10 à 15 minutes sans résultat et critique l’interface. Un témoignage Reddit du 28 février 2024 décrit au contraire une génération locale de deux minutes, avec mélodie maintenue et variations de batterie et de dynamique.

À qui appartiennent les morceaux générés ?

Les textes officiels de MusicGen ne disent pas que l’utilisateur devient automatiquement propriétaire de chaque sortie. Ils ne réservent pas non plus toutes les sorties à Meta en échange d’un accès gratuit. Ce qu’ils établissent clairement concerne le code et les poids : MIT pour le premier, CC BY-NC 4.0 pour les seconds. La sortie elle-même reste juridiquement à examiner.

La licence MIT permet l’utilisation, la modification, la redistribution et la vente de copies du code, avec maintien de la notice de copyright et du texte de licence. Elle ne décrit pas une propriété des morceaux générés. Lire « MIT » dans le dépôt puis conclure « je peux vendre l’audio » mélange donc deux objets de licence.

La licence CC BY-NC 4.0 des poids contient une restriction non commerciale. Le texte français définit cette notion par l’absence de recherche principale d’un avantage commercial ou d’une compensation financière. En cas de partage du matériel couvert ou d’une adaptation, il faut respecter l’attribution, indiquer la licence et signaler les modifications.

Cette obligation ne signifie pas, sur la seule base du texte, qu’il faut afficher Meta dans le générique de chaque morceau généré. Elle concerne le matériel couvert et ses adaptations selon la licence. En revanche, les mêmes documents ne donnent pas de clause claire attribuant les sorties à l’utilisateur. C’est la partie qui empêche une réponse simple à « à qui appartient le morceau ? ».

MusicGen-Style conserve cette séparation. Sa fiche Hugging Face indique du code MIT et des poids CC BY-NC 4.0. Elle ne présente pas de licence commerciale alternative liée à un paiement. Le fait de payer un hébergeur ne change donc pas, dans les textes consultés, le statut de la licence des poids.

La fiche de modèle donne aussi une information sur les données d’entraînement. Meta y déclare 20 000 heures de musique sous licence, issues de Meta Music Initiative Sound Collection, Shutterstock et Pond5. Les contrats correspondants ne sont pas reproduits dans la fiche. Cette déclaration ne vaut pas autorisation automatique pour chaque référence audio que vous fourniriez à l’outil.

Enfin, le script de démonstration imprime les textes soumis dans la sortie console. Pour un prompt confidentiel, l’exécution locale réduit une dépendance au service, mais les pages relues ne promettent pas un traitement précis des données.

Peut-on vendre ou diffuser ce qu’on génère ?

La réponse prudente est non pour un usage commercial fondé sur les poids publiés, car leur licence est CC BY-NC 4.0. Les textes MusicGen n’autorisent pas expressément la vente, Spotify, une publicité ou une chaîne YouTube. Payer Replicate ne lève pas cette restriction dans les documents consultés. Le code MIT ne change pas la licence des poids.

Pour un créateur vidéo, la distinction entre une maquette privée et une vidéo monétisée est donc décisive. Le tarif d’exécution d’un hébergeur règle le calcul, pas le droit d’auteur.

YouTube Content ID ajoute un autre filtre. La documentation YouTube demande des droits exclusifs sur les éléments utilisés comme références dans les territoires revendiqués et exclut notamment certains contenus sous licence non exclusive. La licence du modèle et l’admissibilité d’un enregistrement sont deux questions différentes.

Le streaming change surtout la visibilité, pas la licence du modèle. Deezer annonce depuis le 20 juin 2025 l’étiquetage des albums contenant des morceaux entièrement générés par IA. L’étiquette n’affecte pas les royalties selon cette page. Cela doit être séparé de l’exclusion des écoutes frauduleuses.

Spotify a renforcé le 25 septembre 2025 ses règles contre l’imitation vocale non autorisée, le spam et les déclarations trompeuses. Son annonce du 11 août 2026 prévoit des badges AI Persona à partir de la mi-septembre pour certaines identités artificielles d’artistes, avec exclusion par défaut de certaines recommandations. Ces règles ne nomment pas MusicGen et le badge concerne l’identité présentée, pas le simple emploi d’une IA.

Que disent les procès des majors ?

Les procès cités dans les sources concernent Suno et Udio, pas MusicGen. Le 24 juin 2024, des maisons de disques liées notamment à Universal, Sony et Warner ont engagé deux actions soutenues par la RIAA. Suno a été assigné devant le tribunal fédéral du district du Massachusetts, et Uncharted Labs, développeur d’Udio, devant le district sud de New York.

Le 29 octobre 2025, Universal Music Group et Udio ont annoncé un règlement et des accords couvrant les enregistrements et l’édition musicale. Leur communiqué annonce une nouvelle plateforme fondée sur des contenus autorisés pour 2026. Les montants ne sont pas publiés.

Le 25 novembre 2025, Warner Music Group a annoncé un partenariat avec Suno réglant le litige antérieur. Le communiqué prévoit de nouveaux modèles sous licence en 2026 et un contrôle des artistes et auteurs sur l’utilisation de leur nom, de leur image, de leur voix et de leurs compositions. Le montant n’est pas publié. Ces dispositions concernent Suno, pas les poids MusicGen.

Reuters rapporte aussi une décision allemande du 31 juillet 2026. Un tribunal régional de Munich a donné raison à la GEMA dans une affaire contre Suno pour violations de droits d’auteur. Suno doit communiquer des informations sur les revenus concernés, tandis que les dommages restent à chiffrer. Suno dit envisager un appel.

La SACEM apporte un contexte plus large. Son rapport annuel 2024 indique une opposition à l’utilisation de son répertoire auprès de plus de 250 entreprises dans le monde. Le rapport ne nomme pas spécifiquement MusicGen. Meta, de son côté, déclare un entraînement à partir de 20 000 heures de musique sous licence. Les contrats ne figurent pas dans la fiche de modèle, donc leur portée exacte n’est pas détaillée.

Comment MusicGen se compare-t-il à ACE-Step, YuE, Stable Audio Open et Suno ?

MusicGen garde un profil d’outil local centré sur l’instrumental, la mélodie et la continuation. ACE-Step 1.5 va plus loin sur la chanson et les paroles. Stable Audio Open vise des échantillons et des boucles. MusicRadar a comparé MusicGen à MusicLM sur cinq demandes. YuE et Suno ont chacun leur propre review dans la rubrique.

OutilUsage documentéGratuit et prix d’entréeDroits indiqués par les sources
MusicGenInstrumental depuis texte, guidage mélodique, continuation. Audio à 32 kHz, mono ou stéréo selon le modèle.Pas de plan Meta nommé. Replicate affichait environ 0,033 USD par exécution le 17 septembre 2026, coût variable, sans abonnement MusicGen.Code MIT. Poids CC BY-NC 4.0. L’autorisation commerciale des morceaux n’est pas précisée par l’éditeur.
ACE-Step 1.5Générations de 10 secondes à 10 minutes, paroles dans plus de 50 langues, reprise et remplacement de passages, selon le dépôt officiel.Le dépôt 1.5 présente ACEMusic comme « 100% free ». Prix mensuel, devise, crédits et quotas cloud : non précisés par l’éditeur.Le dépôt 1.5 affiche MIT. La fiche des poids autorise l’utilisation commerciale de la musique générée. Le dépôt original ACE-Step affiche Apache 2.0.
Stable Audio Open 1.0Échantillons, boucles, percussions, riffs, bruitages et effets. Jusqu’à 47 secondes, à 44,1 kHz en stéréo. L’éditeur dit que le modèle n’est pas optimisé pour les chansons complètes, les mélodies longues ou les voix.La licence autorise certains usages commerciaux gratuits sous 1 million de dollars de chiffre d’affaires annuel, avec enregistrement auprès de Stability AI. Prix d’entrée d’un service : non précisé par l’éditeur.Usage commercial conditionnel sous le seuil prévu. Au-delà, une autre licence doit être demandée. Cette condition diffère de la restriction CC BY-NC des poids MusicGen.
MusicLMMusicRadar l’a comparé à MusicGen dans un test d’écoute sur cinq demandes. Les sources consultées ne documentent pas ici une fiche fonctionnelle complète.Prix et formule gratuite : non précisés par les sources consultées.Licence des sorties et autorisation commerciale : non précisées par les sources consultées.
SunoService en ligne de chansons complètes par prompt, détaillé dans notre test de Suno.Voir le test.Voir le test.

Si le besoin principal est une chanson longue avec paroles, ACE-Step 1.5 est mieux armé sur le papier, avec une plage annoncée de 10 secondes à 10 minutes et plus de 50 langues. Si le besoin est une boucle ou un riff court, Stable Audio Open est conçu pour cet usage et produit jusqu’à 47 secondes à 44,1 kHz en stéréo. Si vous hésitez entre deux services commerciaux, la page Suno vs Udio traite ce cas séparément.

Pour un lecteur qui cherche spécifiquement YuE, la page YuE : avis, prix, droits et limites en 2026 fournit un autre point d’entrée dans la rubrique.

Pour quel usage je recommande MusicGen, et pour lequel non ?

Je recommande MusicGen pour chercher une idée instrumentale, produire une boucle de travail ou prolonger un motif avant de le rejouer soi-même. Je ne le recommande pas pour livrer une chanson chantée, une publicité ou un titre de catalogue sans vérification des droits. La combinaison poids non commerciaux, voix absentes et sorties non attribuées suffit à poser cette limite.

Le bon scénario ressemble à celui-ci : vous avez une progression de piano, une couleur rythmique ou une scène de montage à habiller. Vous écrivez une description, fournissez une mélodie si besoin, puis vous récupérez une piste à écouter et à retravailler. MusicGen peut alors accélérer le premier jet. La reprise humaine reste au centre, surtout lorsque la forme dépasse une courte fenêtre.

Le modèle peut aussi être utilisé dans Audacity par l’intégration OpenVINO fournie par Intel. Cette extension utilise MusicGen Small et Small Stereo pour générer ou prolonger de la musique. La séparation en pistes dans cette même extension relève de Demucs v4, pas de MusicGen. Cette séparation des rôles évite d’attendre un export multipiste natif que la documentation MusicGen ne décrit pas.

Pour un producteur bedroom, la machine compte. AudioCraft recommande 16 Go de mémoire graphique pour Medium. Il vaut mieux commencer par comprendre la variante réellement chargée que promettre une installation identique sur toutes les configurations.

Pour un créateur vidéo, le point bloquant n’est pas seulement la qualité. C’est la licence. Un fond musical destiné à une vidéo monétisée, à une publicité ou à un catalogue demande une autorisation commerciale que les textes MusicGen consultés ne fournissent pas. Le fait qu’un fichier sorte en WAV ou en MP3 ne répond pas à cette question.

MusicGen est une bonne porte d’entrée pour comprendre la génération audio locale et produire des esquisses instrumentales. Il devient un mauvais choix dès que le besoin est une voix crédible, un texte chanté, une exploitation commerciale sécurisée ou un envoi automatique vers Content ID.

Quelles questions reviennent sur MusicGen ?

Les questions ci-dessous reprennent les points que les pages officielles et les tests cités permettent de trancher.

MusicGen, c’est quoi ?

MusicGen est un ensemble de modèles développé par l’équipe FAIR de Meta AI, documenté dans AudioCraft et intégré à Transformers. Il peut créer de l’audio à partir de texte, d’une mélodie ou d’une continuation. Il ne faut pas le confondre avec une application mobile ou un abonnement Meta.

MusicGen va-t-il remplacer les musiciens ?

Les tests cités ici ne permettent pas de prédire la disparition de la création. MusicRadar parle d’idées et de boucles, tandis que TechCrunch dit que MusicGen ne remplace pas les musiciens. Les sources décrivent un outil de génération, pas une disparition mesurable du travail musical.

Comment gérer les droits d’auteur avec MusicGen ?

Il faut commencer par distinguer le code MIT des poids CC BY-NC 4.0. Les textes MusicGen n’attribuent pas expressément les sorties à l’utilisateur et n’autorisent pas une vente générale des morceaux. Pour une diffusion commerciale, demandez une base contractuelle adaptée au projet. Le prix d’un hébergeur ne suffit pas.

Le résultat convainc-t-il à l’écoute ?

La réception publiée est mixte. MusicRadar donne trois demandes sur cinq à MusicGen, Clubic relève des résultats courts et répétitifs, et un témoignage Reddit de 2024 décrit favorablement une génération locale de deux minutes.