grolektif

Séparer voix et instruments IA : quel outil choisir ?

Séparer voix, batterie ou basse avec l’IA : guide 2026 pour choisir un outil selon remix, répétition, transcription, restauration et catalogue.

Quel outil choisir pour séparer voix et instruments par IA ?

Le choix se fait selon la sortie attendue. Pour répéter, Moises est pratique grâce au tempo, à la tonalité, aux accords et aux boucles documentés par son offre Premium. Pour remixer, Logic Pro, LALAL.AI ou UVR donnent plus de contrôle. Basic Pitch sert à la transcription, RX 12 à la restauration, Spleeter ou Demucs au traitement local d’un catalogue.

Quel outil correspond à votre usage ?

Avant de comparer les modèles, nommez ce que vous voulez faire du fichier obtenu. Une acappella pour un DJ, une basse à ralentir pour travailler un passage et une archive à traiter en série ne demandent pas les mêmes fonctions. Le tableau donne un premier choix, avec la limite qui risque de vous arrêter.

UsagePoint de départPourquoiLimite à connaître
Remix dans un DAWLogic Pro, LALAL.AI plugin ou UVRCatégories d’instruments, modèles ou traitement localLe résultat reste une estimation issue du mix
Remix DJ et acappellaLALAL.AIVoix, instrumental, batterie, basse, piano et guitares sont documentésLe plan Starter ne permet pas de télécharger les résultats
RépétitionMoisesTempo, transposition, accords, métronome, paroles et bouclesLe plan gratuit limite les fichiers et les catégories
TranscriptionUn stem isolé puis Basic PitchAudio vers MIDI, avec variations de hauteurLa correction des notes reste nécessaire
Restauration musicaleRX 12 Music RebalanceVoix, basse, percussions et autres éléments musicauxQuatre groupes documentés, pas chaque instrument
Bande-son audiovisuelleRX 12 Scene RebalanceDialogue, musique et effets sonoresCe découpage ne remplace pas une extraction de batterie ou de piano
Catalogue localSpleeter, Demucs ou UVRCommande, modèles et traitement de plusieurs fichiersIl faut conserver le modèle, les réglages et la licence de chaque étape

Qu’est-ce qu’un stem, exactement ?

Un stem est un groupe de pistes déjà réuni, par exemple les microphones d’une batterie exportés dans un fichier stéréo. Les multitracks sont les pistes individuelles utilisées pour mixer. La distinction rappelée par iZotope évite une confusion courante : un fichier produit par une IA à partir d’un morceau fini est une estimation, pas la récupération des prises originales.

Une voix isolée peut garder une cymbale, une basse ou une réverbération. Un accompagnement peut conserver des syllabes. Écoutez les fichiers séparés avant de les présenter comme le contenu d’une session d’enregistrement.

Comment préparer un remix sans confondre extraction et multipiste ?

Pour un remix, cherchez d’abord l’intégration dans votre station de travail et le nombre de catégories réellement utiles. Logic Pro pour Mac documente six catégories : chant, batterie, basse, guitare, piano et autres instruments. Le séparateur demande un Mac équipé d’une puce M1 ou ultérieure, selon Apple Support. Les catégories écartées peuvent être réunies dans un sous-mixage.

Le plugin LALAL.AI vise un autre confort. Son modèle local s’appelle Lyra et reste distinct des modèles cloud de la marque, nommés Andromeda, Perseus et Orion dans la FAQ du plugin. L’éditeur documente la voix, l’instrumental, la batterie, la basse, le piano et les guitares acoustique et électrique. Le format principal est VST3 sur Windows, macOS et Linux. AU est indiqué en bêta et AAX n’est pas proposé.

Le fonctionnement hors ligne du plugin suppose une activation et des vérifications périodiques d’abonnement. Il ne vaut pas autorisation de lancer un service partagé sur serveur.

UVR, pour Ultimate Vocal Remover, est une interface gratuite et open source pour Windows, macOS et Linux. Son dépôt donne accès à plusieurs moteurs et modèles. Notez le modèle et les réglages utilisés avec chaque export.

Le comparatif de MusicRadar, publié le 7 janvier 2026, confronte onze outils aux mêmes morceaux. Les versions comprennent RX 11 et Logic 11.2.2, et les réglages UVR et Demucs les plus exigeants n’ont pas été employés. Il n’y a pas de vainqueur universel à recopier.

Si vous hésitez entre deux services en ligne pour un usage ponctuel, le comparatif LALAL.AI ou Moises selon l’usage aide à séparer la question du remix de celle de la répétition. Ce sont deux besoins proches dans la recherche, mais leurs fonctions autour du fichier ne sont pas les mêmes.

Comment choisir un outil pour répéter avec un morceau connu ?

Pour répéter, l’isolation n’est qu’un point de départ. Moises Free propose la configuration voix et accompagnement, ou voix, batterie, basse et autres. L’aide officielle, actualisée le 1er septembre 2026, indique cinq fichiers par mois, avec cinq minutes au maximum par fichier. Le choix supplémentaire d’instruments relève des offres payantes.

L’offre Premium documente le changement de tempo, la transposition, la reconnaissance d’accords, le métronome intelligent, les paroles et les boucles de sections. Pour travailler un passage, ces fonctions peuvent peser davantage que la propreté d’une cymbale. Le prix public actuel n’est pas précisé par la page de tarification consultée.

Une réserve concerne Moises Pro. L’aide sur la durée des fichiers, actualisée le 1er septembre 2026, indique 20 minutes pour Premium et Pro. La fiche Android officielle, actualisée le 4 septembre 2026, annonce 180 minutes pour Pro. Vérifiez la limite sur votre plateforme avant de préparer un long fichier de répétition.

Le forum Zikinf donne une image plus terre à terre du problème. Dans le message 24 d’un fil consacré à StemTube, zeetoon rapporte qu’après un essai sur « Arsalein » de Corpo-Mente, de la basse restait audible pendant quelques secondes dans la piste vocale. Il rappelle simplement de contrôler les fuites avant de distribuer un backing track.

  1. Importez un fichier dont vous avez le droit de traiter la source, puis écoutez le mix original.

  2. Choisissez la configuration minimale. Deux groupes suffisent pour chanter sur l’accompagnement.

  3. Réglez le tempo, la tonalité et la boucle de section. Ne corrigez pas une fuite avec le tempo.

  4. Écoutez les stems seuls. Si une caisse claire ou une consonne reste trop présente, gardez le mix complet comme référence.

Pour une analyse consacrée à l’extraction et au travail audio, consultez notre avis sur AudioShake. Pour répéter, la vitesse de travail et les outils de pratique comptent autant que le stem isolé.

Comment transcrire une ligne de basse ou de guitare ?

La transcription commence après la séparation. Isolez la basse ou la guitare, envoyez cet audio dans Basic Pitch, puis exportez le MIDI vers un éditeur. Le démonstrateur officiel de Spotify permet ce parcours. Le dépôt précise que le modèle accepte la polyphonie, mais qu’il fonctionne mieux avec un seul instrument à la fois.

Il faut donc séparer les tâches. Spleeter produit des signaux audio séparés. Basic Pitch transforme de l’audio en événements MIDI et prend en charge les variations de hauteur. L’un ne remplace pas l’autre. Le dépôt Basic Pitch est sous licence Apache 2.0 et sa démonstration prévoit la correction du MIDI obtenu.

Dans la pratique, une attaque mal isolée peut créer une note fantôme, tandis qu’une note tenue peut être découpée de manière peu musicale. Le workflow « stem de basse, puis MIDI, puis correction » est une application logique des deux outils, pas un résultat de test réalisé par Grolektif. Gardez l’audio au-dessus du piano roll pour vérifier chaque entrée.

Quand la restauration demande-t-elle RX 12 ?

RX 12 devient pertinent quand vous devez rééquilibrer un mix sans disposer des pistes originales. Music Rebalance traite quatre groupes : voix, basse, percussions et autres éléments musicaux. Il peut donc aider à diminuer une voix ou une basse avant un nouveau travail, mais sa documentation ne décrit pas une extraction séparée de chaque instrument de l’orchestre.

Scene Rebalance répond à une autre situation. Dans la présentation publiée par iZotope le 14 mai 2026, les catégories sont le dialogue, la musique et les effets sonores. Cette répartition convient à une bande-son audiovisuelle quand vous devez faire passer une parole, atténuer une musique ou intervenir sur des effets. Elle n’a pas le même objectif qu’un remix de batterie.

Les prix affichés dans les sources officielles lors du relevé sont de 399 USD pour RX Standard et 1 399 USD pour RX Advanced. Ce sont des montants en dollars, pas une conversion en euros ni un devis TTC français. Vérifiez aussi l’édition, car les fonctions de Music Rebalance et de Scene Rebalance ne doivent pas être déduites d’un tableau commercial ancien.

Le test de RipX peut aussi servir de point de comparaison si votre priorité est l’édition directe dans le morceau. Cette page reste distincte du choix RX 12 : ici, la question porte sur les familles de restauration documentées et sur la destination du fichier.

Comment traiter un catalogue sans envoyer chaque fichier ?

Pour un catalogue, privilégiez un traitement local que vous pouvez relancer avec les mêmes modèles et les mêmes réglages. Spleeter fournit une bibliothèque Python, une ligne de commande et des modèles préentraînés. Son dépôt propose deux sources, quatre sources voix, batterie, basse et autres, ou cinq sources avec ajout du piano. Le code est sous licence MIT.

Spleeter convient à un premier pipeline parce que la commande peut être intégrée à une série de fichiers. La release officielle v1.4.0 affiche 69,7 MB pour deux sources, 140 MB pour quatre sources et 174 MB pour cinq sources.

Modèle SpleeterSources annoncéesTaille affichéeAccès
Deux sourcesVoix et accompagnement69,7 MBArchive publique GitHub
Quatre sourcesVoix, batterie, basse, autres140 MBArchive publique GitHub
Cinq sourcesVoix, batterie, basse, piano, autres174 MBArchive publique GitHub

Demucs v4 propose une architecture hybride qui combine représentations temporelle et spectrale avec un Transformer. Le dépôt Meta documente quatre catégories usuelles et un modèle expérimental à six catégories. Il accepte plusieurs fichiers en ligne de commande. Mais le dépôt d’origine a été archivé le 1er janvier 2025. Le code reste accessible, la maintenance active n’est pas acquise.

UVR peut servir à tester plusieurs modèles sur un poste de travail. Dans les trois cas, conservez un journal avec fichier, modèle, réglages et date. Cette discipline vaut mieux qu’une étiquette vague comme « meilleure IA de stems ».

Le catalogue pose aussi une question de licence. L’EULA du plugin LALAL.AI autorise l’automatisation locale contrôlée par l’utilisateur, mais réserve les déploiements serveur, les services partagés et certains traitements pour des tiers à un accord distinct.

Quels chiffres permettent de comparer une séparation ?

Un chiffre de qualité n’a de sens qu’avec son corpus, son modèle et son protocole. MUSDB18-HQ contient 150 morceaux, répartis entre 100 morceaux d’entraînement et 50 morceaux de test, avec des références voix, batterie, basse et autres. Les fichiers sont des WAV stéréo non compressés à 44,1 kHz. La fiche Zenodo affiche une archive de 22,7 Go et précise un usage éducatif.

Les auteurs de Demucs annoncent 9,00 dB de SDR pour HT Demucs dans leur protocole MUSDB-HQ. Le chiffre de 9,20 dB concerne une variante avec attention parcimonieuse et affinage dont ils indiquent ne pas distribuer le modèle.

La fiche MUSDB18-HQ sur Zenodo sert à construire un protocole avec des sources de référence. La démonstration HT Demucs proposée par Honu AI permet aussi d’écouter des mélanges et plusieurs variantes. Une écoute publique ne vaut pas autorisation de republier les fichiers.

Un test de recombinaison peut vérifier que la somme des fichiers reconstitue le mix, mais il ne prouve pas que chaque son se trouve dans la bonne source. Un premier fichier qui contient tout le mix et trois fichiers silencieux donnerait une recombinaison parfaite. Pour juger un outil, écoutez donc la source recherchée et les résidus, pas seulement l’annulation globale.

Peut-on publier un remix après avoir séparé un morceau ?

La séparation ne donne pas les droits sur l’œuvre ni sur l’enregistrement. En France, l’article L122-4 du Code de la propriété intellectuelle encadre la reproduction, la représentation et l’adaptation d’une œuvre sans consentement. L’article L213-1 prévoit les droits du producteur sur le phonogramme, selon Légifrance. Isoler une voix ne supprime aucun de ces deux niveaux.

L’exception de copie privée, également décrite par Légifrance à l’article L122-5, suppose notamment une source licite et un usage strictement privé, non collectif. Elle ne constitue pas une autorisation générale de publier un remix. Le statut commercial ou gratuit de l’outil ne change pas la question des droits sur le morceau traité.

Pour un morceau dont vous êtes l’auteur ou dont vous avez les autorisations, gardez les éléments qui permettent de retracer la chaîne de travail. Pour une archive confiée par un tiers, clarifiez qui peut envoyer le fichier, qui peut conserver les résultats et où le traitement s’exécute.

Quelles erreurs faut-il éviter avant d’exporter ?

  • Appeler « pistes originales » des fichiers estimés depuis un mix. Écrivez plutôt le nom du modèle et la catégorie produite.

  • Choisir six sources parce que six paraît supérieur à quatre. Le dépôt Demucs signale des fuites et des artefacts sur la catégorie piano de son modèle expérimental à six sources.

  • Confondre WAV et justesse. Demucs exporte par défaut en WAV stéréo 44,1 kHz et 16 bits, et sa documentation avertit qu’un redimensionnement automatique contre l’écrêtage peut modifier les niveaux relatifs.

  • Prendre une préécoute gratuite pour un export gratuit. LALAL.AI Starter autorise l’évaluation, mais ne permet pas le téléchargement des résultats.

  • Comparer deux marques sans nommer leurs moteurs. Chez LALAL.AI, Lyra est local, tandis qu’Andromeda, Perseus et Orion sont des modèles cloud.

  • Mettre en ligne un catalogue inédit sans lire les conditions du service. L’accord d’utiliser le logiciel ne vaut pas autorisation de traiter les contenus d’un tiers sur un serveur.

Quelle offre LALAL.AI correspond à un usage ponctuel ou régulier ?

Le relevé officiel du 18 septembre 2026 donne un exemple de barème exploitable, avec des limites qui changent la décision. Starter est gratuit, mais offre 10 minutes en file Relaxed, sans téléchargement des résultats, avec un fichier limité à 200 Mo. Il sert à écouter avant de payer, pas à constituer une bibliothèque d’accompagnements.

OffrePrix constatéTraitement cloud inclusLimite déterminante
StarterGratuit10 minutes en file RelaxedPas de téléchargement, fichier de 200 Mo maximum
Lite81 €/an, affichés comme 6,75 €/moisRelaxed illimité, 90 minutes Fast par moisFichier de 2 Go maximum
Pro162 €/an, affichés comme 13,50 €/mois, ou 17,99 €/mois dans la FAQ du pluginRelaxed illimité, 250 minutes Fast par moisAccès au plugin et à l’API

Les équivalents mensuels affichés pour Lite et Pro correspondent aux abonnements annuels. LALAL.AI indique aussi que les minutes sont décomptées selon la durée du fichier multipliée par le nombre de types de séparation. Fast et Relaxed utilisent la même qualité de séparation, la différence portant sur la priorité de traitement.

Quelle checklist utiliser avant de choisir ?

Recopiez cette liste dans la fiche de chaque morceau ou de chaque lot. Une réponse vague à l’une des lignes signale un risque à vérifier avant l’export.

  • Usage final : remix, répétition, transcription, restauration ou catalogue local.

  • Source : morceau licite, session dont vous avez les droits, ou fichier confié par un tiers.

  • Sortie : voix, instrumental, batterie, basse, piano, guitare, ou groupe audiovisuel.

  • Traitement : local, cloud, plugin dans le DAW, commande ou application mobile.

  • Reprise : modèle, version, réglages, profondeur de sortie et niveau de normalisation conservés.

  • Contrôle : écoute du stem recherché, écoute des fuites, puis comparaison avec le mix complet.

  • Licence : droit de traiter, droit de conserver et droit de publier le résultat final.

Quelles questions fréquentes reviennent sur la séparation par IA ?

L’IA récupère-t-elle les pistes originales du studio ?

Non. Elle estime des sources à partir du mix fourni. Les pistes individuelles de la session, les stems exportés depuis cette session et les fichiers séparés par IA sont trois objets différents, comme le rappelle la distinction iZotope entre stems et multitracks.

Le format WAV garantit-il un bon résultat ?

Non. Un WAV peut conserver un format non compressé tout en contenant des fuites ou des artefacts. La documentation Demucs indique un export par défaut en WAV stéréo 44,1 kHz et 16 bits, et avertit qu’un redimensionnement automatique contre l’écrêtage peut changer les niveaux relatifs.

Six stems valent-ils mieux que quatre ?

Non. Le modèle expérimental à six catégories de Demucs ajoute notamment le piano, mais son dépôt signale des fuites et des artefacts sur cette catégorie. Une sortie supplémentaire est utile seulement si elle reste exploitable sur votre morceau.

LALAL.AI gratuit permet-il de télécharger un instrumental ?

Le plan Starter permet l’évaluation avec 10 minutes en file Relaxed, mais le tableau officiel relevé le 18 septembre 2026 indique qu’il ne permet pas le téléchargement des résultats. Il faut donc distinguer l’écoute d’essai de l’export récupérable.

Peut-on obtenir une partition après avoir isolé une basse ?

Oui, avec un workflow en deux temps : stem de basse, puis Basic Pitch pour générer un MIDI. Le démonstrateur Spotify prévoit ensuite une correction dans un éditeur. Le dépôt précise que le modèle fonctionne mieux avec un seul instrument, et aucune exactitude intégrale n’est promise.

À écouter

Le dépôt Spleeter propose « Slow Motion Dream » de Steven M Bryant pour entendre une séparation voix et accompagnement à partir d’un exemple attribué. Pour une comparaison avec des sources de référence, écoutez aussi les variantes proposées par la démonstration HT Demucs.