Pour créer de la musique avec une IA locale open source, choisissez d’abord la contrainte que vous refusez de perdre : confidentialité, contrôle musical ou liberté d’exploitation. Une carte de 16 Go ouvre déjà ACE-Step 1.5 en 2B, mais YuE2 documente 24 Go. La licence des poids peut changer le verdict.
La rédaction de grolektif.com, magazine musical indépendant, a préparé ce guide comme un point d’entrée de la rubrique IA et création musicale. Il ne remplace pas les pages consacrées à chaque outil. Il aide à choisir une machine, une famille de modèles et une méthode de travail avant de télécharger quoi que ce soit.
Quelle IA musique locale choisir selon votre projet ?
Si vous voulez une chanson structurée, commencez par ACE-Step 1.5 ou HeartMuLa. YuE2 vise un contrôle plus explicite par mélodie et accords, avec une contrainte matérielle plus haute. MusicGen et Stable Audio Open conviennent mieux aux instrumentaux courts. Magenta RealTime 2 prend une autre direction : l’instrument génératif piloté en direct.
| Votre besoin | Modèle à examiner | Ce que les sources établissent |
|---|---|---|
| Chanson avec paroles et retouche de passages | ACE-Step 1.5 | Le dépôt documente la génération depuis une description et des paroles, la reprise stylistique, la régénération de segments, le mode Repaint et des versions 2B ou XL. Le code principal et les poids concernés sont sous MIT, selon le fichier de licence 1.5. |
| Chanson avec paroles, mélodie et accords inspectables | YuE2 | Le dépôt décrit une planification symbolique puis une génération audio. La mélodie et les accords peuvent être inspectés et modifiés. Le README documente Linux, un GPU NVIDIA compatible BF16 avec 24 Go de VRAM et une sortie stéréo à 48 kHz. Les poids YuE2-3B sont sous CC BY-NC 4.0, tandis que le code reste sous Apache 2.0. |
| Chanson depuis des paroles et une description | HeartMuLa | Le projet recommande depuis le 13 février 2026 HeartMuLa-oss-3B-happy-new-year avec HeartCodec-oss-20260123. Le codec produit un audio stéréo à 48 kHz. Le dépôt annonce le code et les poids sous Apache 2.0, avec un chargement différé pour réduire l’occupation simultanée de la mémoire GPU. Source : README de HeartMuLa. |
| Boucle ou texture instrumentale depuis un texte ou une mélodie | MusicGen | Meta documente les familles Small 300M, Medium 1,5B et Large 3,3B, ainsi que des variantes conditionnées par une mélodie. La représentation audio est à 32 kHz. Les poids sont sous CC BY-NC 4.0 et le code sous MIT. La fiche du modèle précise que les voix réalistes ne sont pas l’objectif. |
| Instrument génératif piloté par texte, audio ou MIDI | Magenta RealTime 2 | Google décrit les configurations Small 230M et Base 2,4B. Le système génère un audio musical continu en stéréo à 48 kHz. Le code est sous Apache 2.0 et les poids sous CC BY 4.0. La fiche officielle vise surtout la musique instrumentale, avec des vocalisations généralement non lexicales. |
| Samples, textures et génération plus longue selon la machine | Stable Audio 3 ou Stable Audio Open 1.0 | Le dépôt Stable Audio 3 indique 120 secondes pour Small, exécutable sur CPU, et 380 secondes pour Medium avec GPU CUDA. Stable Audio Open 1.0 est une branche séparée, documentée jusqu’à 47 secondes en stéréo 44,1 kHz. La comparaison ne doit pas mélanger ces deux versions : la review de Stable Audio Open reste la page dédiée. |
Ce tableau donne une direction, pas un classement. La qualité des chansons en français n’est pas établie par un essai indépendant commun aux versions de septembre 2026. Le comparatif publié par IT-JIM utilise trois couples style et paroles, une graine par modèle et un GPU distant. C’est un corpus consultable, pas une mesure suffisante pour départager toutes les machines et toutes les langues.
Quel matériel faut-il pour faire tourner une IA musicale en local ?
Pour une première station locale, 8 à 16 Go de mémoire vidéo donnent le choix le plus raisonnable avec ACE-Step 1.5 en 2B et certains modèles instrumentaux. 24 Go de VRAM deviennent le seuil documenté par YuE2. En dessous, il faut accepter la quantification, le transfert vers la RAM ou des composants désactivés. Ces repères viennent des configurations publiées, pas d’une promesse de vitesse.
| Mémoire GPU disponible | Configuration publiée | Conséquence pratique |
|---|---|---|
| Jusqu’à 6 Go | ACE-Step 1.5, 2B Turbo, sans modèle de langage auxiliaire, avec quantification INT8 et transfert vers le CPU. | Le modèle tourne dans une configuration allégée. Il ne faut pas extrapoler ce seuil à la version XL ni à tous les workflows. |
| De 6 à 8 Go | 2B Turbo avec un petit modèle de langage de 0,6B. | Le composant auxiliaire est possible, mais la mémoire reste comptée. Le choix du modèle et la taille des lots ont un effet direct. |
| De 8 à 16 Go | ACE-Step 1.5 en 2B Turbo ou SFT, avec choix du modèle auxiliaire selon la mémoire. | C’est la zone la plus souple pour démarrer des chansons et tester la retouche sans viser l’XL. |
| De 12 à moins de 20 Go | ACE-Step 1.5 XL avec mesures d’économie de mémoire, transfert CPU et quantification selon le niveau. | Le mot XL ne suffit pas à décrire l’expérience. La configuration mémoire fait partie du modèle réellement utilisé. |
| De 20 à 24 Go et plus | ACE-Step 1.5 XL avec moins de contraintes de transfert. Les configurations auxiliaires les plus volumineuses sont proposées aux niveaux supérieurs. | La marge est meilleure pour le contrôle, mais elle ne prouve ni un temps de génération ni une qualité supérieure. |
Ces seuils sont ceux du guide de compatibilité d’ACE-Step 1.5. Son guide d’installation indique Python 3.11 à 3.12, environ 10 Go de disque pour les modèles de base, CUDA recommandé, et des chemins pour MPS ou MLX, ROCm, Intel XPU et CPU. Le minimum universel de mémoire vive système n’est pas chiffré dans cette documentation.
Un exemple concret aide à éviter une confusion fréquente. ASUS indique pour la DUAL-RTX5060TI-O16G 16 Go de GDDR7, 4 608 coeurs CUDA, un bus mémoire de 128 bits, des dimensions de 229 × 120 × 50 mm, 2,5 emplacements, un connecteur de 8 broches et une alimentation système recommandée de 550 W, dans sa fiche constructeur. LDLC et Materiel.net l’affichaient à 819,95 € et en stock le 18 septembre 2026, pour cette référence 16 Go, pas pour la variante 8 Go. Aucun de ces relevés ne mesure ses temps de génération musicale.
La taille de la carte ne résout pas tout. YuE2 documente 24 Go de VRAM et une compatibilité NVIDIA BF16. HeartMuLa utilise des précisions numériques différentes pour le générateur et le codec, et avertit qu’abaisser la précision du codec peut dégrader le résultat. Pour MuLaCover, le dépôt documente Linux, Python 3.10 et un GPU NVIDIA, avec un environnement testé sur une NVIDIA B300. Le minimum grand public pour tous les scénarios n’est pas établi.
Comment lire la licence d’un modèle musical open source ?
Commencez par séparer le code, les poids, les données d’entraînement, les entrées et les sorties. L’Open Source AI Definition 1.0 de l’Open Source Initiative demande des libertés d’utilisation, d’étude, de modification et de partage, ainsi que le code, les paramètres et des informations assez détaillées sur les données pour reconstruire un système substantiellement équivalent. Un dépôt public ou des poids téléchargeables ne suffisent donc pas, à eux seuls, à établir cette conformité.
| Modèle ou composant | Licence documentée | Ce que cela change avant publication |
|---|---|---|
| ACE-Step 1.5 | MIT pour le code principal et les poids concernés, selon les ressources 1.5. Le dépôt historique ACE-Step affiche Apache 2.0. | Il faut vérifier la branche et les poids téléchargés. Le nom ACE-Step ne suffit pas à identifier la licence utilisée. |
| MusicGen | Code MIT, poids CC BY-NC 4.0, selon la fiche MusicGen et la licence Creative Commons. | Le code et les poids n’ont pas la même permission. La restriction non commerciale des poids empêche de traiter la pile comme un outil commercial libre. |
| YuE v1 et YuE2 | YuE v1 annonce Apache 2.0, y compris pour les poids. YuE2 conserve Apache 2.0 pour le code, mais sa fiche YuE2-3B affiche CC BY-NC 4.0 pour les poids. | La version est décisive. YuE2 prévoit une permission particulière pour la publication et la monétisation par un créateur individuel, tandis que l’exploitation commerciale des poids par une entreprise demande une licence à discuter. |
| HeartMuLa | Le README annonce le code et les poids sous Apache 2.0, après l’annonce initiale du 14 janvier 2026 et le passage indiqué au 20 janvier 2026. | Le codec reste un composant à télécharger selon les instructions du projet. Sa licence doit être relue avec le reste de la pile au moment du déploiement. |
| MuLaCover | Code Apache 2.0, poids CC BY-NC 4.0 avec conditions particulières, selon le texte de licence MuLaCover. | La licence interdit l’exploitation commerciale des sorties sans autorisation écrite, notamment la vente, la monétisation, la publicité et l’intégration dans un produit payant. |
| Magenta RealTime 2 | Code Apache 2.0, poids CC BY 4.0, selon la fiche officielle. | Google ne revendique pas de droits sur les sorties, mais rend l’utilisateur responsable de leur utilisation. Cette clause ne nettoie pas les droits des fichiers et références fournis en entrée. |
Un usage commercial demande donc une lecture par composant. Stable Audio 3 illustre une autre situation : Stability AI annonce une licence Community gratuite pour une personne ou une organisation sous 1 million de dollars de revenus annuels, tous revenus confondus, et une offre Enterprise au-delà. Les fiches Small-Music et Medium demandent une connexion et l’acceptation de conditions pour accéder aux fichiers. Gratuité, ouverture du code et absence d’inscription restent trois questions séparées. Sources : licence Stability AI et fiche Stable Audio 3 Medium.
Quel workflow local protège vraiment les morceaux ?
Un workflow local protège mieux les paroles, les maquettes et les prises de référence quand les fichiers restent sur votre machine après le téléchargement des composants. Cela ne se déduit pas du mot « Studio ». Il faut distinguer le serveur local, les vérifications de mise à jour, les modèles récupérés au premier lancement et un partage public activé volontairement.
- Définissez la sortie avant de choisir le modèle. Pour une chanson, préparez les paroles et la forme souhaitée. Pour un contrôle plus précis, préparez une mélodie ou des accords. MusicGen montre bien la différence entre décrire un style et fournir une contrainte musicale : sa démonstration officielle utilise un chromagramme pour guider la génération indépendamment du timbre. MuLaCover accepte un enregistrement de référence ou des fichiers MIDI de mélodie et d’accords, mais sa commande documentée écrit un fichier WAV.
- Téléchargez les versions et les poids dans un espace identifié. Notez le nom exact du dépôt, la branche, le modèle auxiliaire et la licence. ACE-Step 1.5 permet ensuite de réappliquer les paramètres d’une génération à l’interface. YuE2 peut sauvegarder l’audio, la partition, les paramètres et les informations sur les modèles utilisés. Ces traces évitent de chercher quelle version a produit une maquette six semaines plus tard.
- Fermez le chemin réseau après l’installation quand la confidentialité l’exige. ACE-Step utilise par défaut 127.0.0.1, mais l’option
--sharecrée un lien Gradio public. Ses scripts vérifient aussi les mises à jour au démarrage par défaut ; la documentation indiqueCHECK_UPDATE=falsepour désactiver ce comportement. Hugging Face documenteHF_HUB_OFFLINE=1pour interdire les appels HTTP au Hub etHF_HUB_DISABLE_TELEMETRY=1pour désactiver la télémétrie prise en charge par cette bibliothèque. - Générez plusieurs variantes, puis retouchez une seule zone à la fois. ACE-Step documente la génération de variantes, la réutilisation d’une sortie comme source et le mode Repaint pour remplacer une plage temporelle. La page officielle reconnaît des transitions parfois artificielles pendant la retouche ou l’extension. Gardez donc la version précédente, le prompt, la graine et les réglages avant chaque remplacement.
- Terminez dans votre station audionumérique. Le MIDI peut guider une génération sans devenir une session MIDI multipiste. Magenta RealTime 2 place le MIDI du côté du pilotage de l’audio. MuLaCover accepte mélodie et accords MIDI, puis écrit un WAV. Si vous avez besoin de notes éditables, demandez-vous où elles sortent réellement avant de bâtir votre arrangement autour du modèle.
Magenta RealTime 2 rappelle aussi qu’une application locale peut avoir besoin du réseau au premier démarrage. La page officielle indique que les poids sont téléchargés lors de ce lancement. Google fournit Jam, Collider, le plug-in MRT2 et des extensions pour Max/MSP, Pure Data et SuperCollider. La documentation demande de régler l’application ou la station à 48 kHz. Une installation locale prête à jouer hors ligne demande donc une préparation distincte.
Quel modèle choisir si la confidentialité passe avant la vitesse ?
Je commencerais par une installation qui reste sur 127.0.0.1, avec les modèles déjà présents et un pare-feu qui bloque les sorties pendant les essais. C’est une position de prudence, pas la preuve d’un audit réseau. Les réglages hors ligne de Hugging Face concernent cette bibliothèque et ne vérifient pas toutes les dépendances, extensions ou applications tierces.
ACE-Step 1.5 est pratique pour ce scénario parce que sa documentation réunit génération, paramètres musicaux et retouche dans une même interface. Il faut accepter de surveiller les mises à jour et de désactiver le partage public. Pour des voix et des paroles, le choix est plus cohérent que MusicGen, dont Meta indique que les voix réalistes ne sont pas produites et que l’entraînement repose sur des descriptions anglaises, avec des performances moins bonnes dans les autres langues.
Si le morceau doit être commercialisé, la priorité change. HeartMuLa ou ACE-Step 1.5 peuvent sembler plus simples à examiner sur le papier, grâce aux licences annoncées dans leurs ressources. MusicGen demande une lecture de la restriction CC BY-NC des poids. YuE2 demande de distinguer créateur individuel et entreprise. MuLaCover sort du choix commercial courant à cause de l’autorisation écrite exigée pour exploiter ses sorties.
Quelles erreurs éviter avant de télécharger les poids ?
- Confondre un dépôt public avec une licence open source complète. L’OSI demande aussi des informations sur les données et les paramètres.
- Lire la licence du code et oublier celle des poids. MusicGen et YuE2 montrent que les deux lignes peuvent mener à des permissions opposées.
- Prendre 4 Go de VRAM comme un seuil universel. ACE-Step documente ce type de configuration allégée, pas tous ses modèles.
- Appeler « local » une application qui télécharge encore ses poids ou vérifie ses mises à jour. Magenta et ACE-Step documentent ces étapes.
- Attribuer les 47 secondes de Stable Audio Open 1.0 à Stable Audio 3. Le dépôt 3 sépare Small à 120 secondes et Medium à 380 secondes.
- Promettre un morceau libre de droits parce que le modèle est permissif. Les enregistrements, paroles, compositions et interprétations fournis en entrée gardent leurs propres questions de droits.
Quelle configuration simple retenir en septembre 2026 ?
Pour une première station de création de chansons, je retiendrais une carte avec 16 Go de VRAM et assez de disque pour les environ 10 Go de modèles de base annoncés par l’installation ACE-Step 1.5. Je commencerais avec le 2B, puis je passerais à XL seulement si le contrôle supplémentaire justifie la mémoire et les transferts. Le prix de la carte ASUS citée plus haut est un repère daté, pas un budget universel.
Pour une machine Apple Silicon dédiée à l’interaction, Magenta RealTime 2 est le candidat à examiner en premier. Le tableau matériel de son dépôt valide Small sur plusieurs MacBook Air Apple Silicon et Base sur des configurations M4 Pro, M2 Max, M3 Max et M5 Max. Il distingue l’exécution en temps réel de l’inférence non temps réel, proposée aussi sur Apple Silicon et GPU NVIDIA via Python.
Pour YuE2, ne construisez pas votre achat autour d’une estimation trouvée dans un tutoriel. Le README principal documente 24 Go de VRAM, mais ses instructions d’installation consultées ne sont pas parfaitement synchronisées avec la fiche Hugging Face sur Python et la version du paquet d’inférence. La fiche indique Python 3.10+ et 0.1.5, tandis que le README principal indique Python 3.12 et 0.1.6. Une procédure unique mélangeant les deux n’est pas établie.
Enfin, si votre but est un instrument de scène, ne choisissez pas sur la seule promesse de chanson. Magenta RealTime 2 accepte texte, exemples audio et MIDI pour produire un flux musical continu. Si votre but est la retouche d’une chanson existante, ACE-Step 1.5 apporte une logique plus adaptée avec Repaint, mais ses propres sources préviennent que le raccord peut rester artificiel. Le bon choix dépend de l’opération que vous voulez refaire demain matin.
Questions fréquentes sur la musique IA locale
Un modèle open source peut-il être utilisé commercialement ?
Pas automatiquement. Le code peut être sous MIT ou Apache 2.0 tandis que les poids sont sous CC BY-NC 4.0. Vérifiez aussi la licence des entrées et les conditions propres aux sorties. YuE v1 et YuE2 n’ont pas la même situation, et MuLaCover exige une autorisation écrite pour l’exploitation commerciale de ses sorties.
Faut-il 24 Go de VRAM pour tous les modèles ?
Non. Les 24 Go sont documentés par YuE2. ACE-Step 1.5 publie des configurations 2B jusqu’à 6 Go, avec transfert CPU et quantification, puis des niveaux distincts pour 8, 16 et 24 Go.
Une application locale fonctionne-t-elle sans internet ?
Elle peut fonctionner hors ligne une fois les fichiers présents, mais le premier lancement peut télécharger des poids et ACE-Step vérifie les mises à jour par défaut. L’application Magenta télécharge aussi les poids au premier démarrage. Utilisez les réglages hors ligne documentés et vérifiez le trafic de votre propre installation avant de lui confier des morceaux non publiés.
Le MIDI produit-il une session éditable ?
Pas d’après les exemples documentés ici. Magenta RealTime 2 utilise le MIDI pour piloter la génération audio. MuLaCover accepte des fichiers MIDI de mélodie et d’accords, puis sa commande d’exemple écrit un WAV. Entrée MIDI et sortie MIDI sont deux capacités différentes.
Stable Audio Open est-il limité à 47 secondes ?
Stable Audio Open 1.0 est documenté jusqu’à 47 secondes en stéréo 44,1 kHz. Stable Audio 3 est une branche distincte : son dépôt indique 120 secondes pour Small et 380 secondes pour Medium. Il faut donc vérifier le nom exact du modèle avant de reprendre une limite.
