ACE-Step 1.5 : Avis et Comparaison 2026
Un aperçu d'ACE-Step 1.5 étayé par des sources : plongée dans l'architecture, comparaison spécification par spécification avec HeartMuLa et Suno, tutoriel d'installation et notes sur l'ajustement LoRA — le tout issu des articles et dépôts officiels
ACE-Step 1.5 est le modèle open source qui bouscule la génération musicale par IA en 2026. Ce guide décortique son architecture à partir de l'article officiel, compare ses spécifications publiées à celles de HeartMuLa et Suno, détaille l'installation locale à l'aide des commandes officielles, et explique sa prise en charge de l'ajustement LoRA. Chaque chiffre ci-dessous renvoie à une source de première main.
Comprendre l'Architecture d'ACE-Step 1.5
ACE-Step 1.5 est un modèle de musique IA open source publié sous licence MIT par ACE Studio et StepFun (arXiv 2602.00744). Au lieu d'un seul passage de bout en bout, il sépare la planification de la synthèse : un modèle de langage raisonne d'abord sur la chanson, puis un transformeur de diffusion produit l'audio. Voici les piliers de son architecture, chacun tiré de l'article officiel.
Planificateur par Modèle de Langage
ACE-Step 1.5 utilise un modèle de langage de la famille Qwen3 (0.6B, 1.7B ou 4B) comme planificateur. À partir de votre prompt, il raisonne étape par étape (chaîne de pensée) pour synthétiser des métadonnées structurées, des paroles et une description caractérisant la chanson cible avant qu'aucun audio ne soit généré.
Synthèse par Transformeur de Diffusion (DiT)
Le plan élaboré conditionne un transformeur de diffusion (DiT) qui génère l'audio proprement dit. Le DiT 2B vise les configurations à faible VRAM, tandis que la variante XL plus grande (DiT 4B) — publiée en April 2026 — augmente la qualité au prix d'une empreinte mémoire supérieure.
Apprentissage par Renforcement Intrinsèque
Plutôt que de dépendre d'un modèle de récompense externe, ACE-Step 1.5 aligne ses sorties grâce à un apprentissage par renforcement intrinsèque, améliorant la contrôlabilité et la musicalité directement à partir des propres signaux du modèle.
Stack Open Source (MIT)
L'ensemble de la stack — poids, code et une interface Gradio — est sous licence MIT et hébergé sur GitHub et Hugging Face. ACE-Step 1.5 prend en charge 50+ langues, l'ajustement LoRA à partir de quelques chansons seulement, ainsi que des workflows d'édition tels que la génération de reprises, le repainting et la conversion voix-vers-BGM.
ACE-Step 1.5 vs HeartMuLa vs Suno : Comparaison des Spécifications
Une comparaison objective et étayée par des sources des spécifications publiées — et non des scores de qualité subjectifs
| Propriété | ACE-Step 1.5 | HeartMuLa oss-3B | Suno |
|---|---|---|---|
| Licence | MIT | Apache 2.0 | Proprietary |
| Article | arXiv 2602.00744 | arXiv 2601.10547 | — |
| VRAM Minimale | <4GB (2B) / ≥12GB (XL) | Non publié | Cloud (N/A) |
| Vitesse | <2s (A100), <10s (RTX 3090) | RTF ≈ 1.0 | Cloud (N/A) |
| Durée Maximale | Jusqu'à 10 min | 240s (par défaut) | — |
| Langues | 50+ | Multilingue | — |
| Déploiement Local | Oui | Oui | Non |
| Ajustement LoRA | Oui (quelques échantillons) | Non publié | Non |
| Édition | reprise / repaint / voix-vers-BGM | — | — |
Sources : ACE-Step 1.5 — arXiv 2602.00744 et github.com/ACE-Step/ACE-Step-1.5 ; HeartMuLa — arXiv 2601.10547 et github.com/HeartMuLa/heartlib. Les champs marqués « Not published » ne sont pas précisés dans la documentation officielle. Vérifié le 2026-07-16.
Guide d'Installation Locale d'ACE-Step 1.5
Guide étape par étape pour exécuter ACE-Step 1.5 sur votre machine locale, en suivant le dépôt officiel
Vérifier la Configuration Requise
Choisissez un modèle adapté à votre GPU : le modèle 2B fonctionne avec moins de 4GB de VRAM, tandis que le modèle XL (DiT 4B) nécessite au moins 12GB (20GB+ recommandé). L'interface sélectionne automatiquement la meilleure configuration pour votre GPU.
Cloner le Dépôt
git clone https://github.com/ACE-Step/ACE-Step-1.5.git && cd ACE-Step-1.5
Installer les Dépendances
uv sync — installe le projet et ses dépendances avec le gestionnaire de paquets uv.
Lancer l'Application
uv run acestep démarre l'interface Gradio à l'adresse http://localhost:7860. Les checkpoints du modèle se téléchargent automatiquement depuis Hugging Face au premier lancement.
Générer de la Musique
Saisissez un prompt et des paroles facultatives dans l'interface, puis lancez la génération. Pour utiliser plutôt l'API REST, exécutez uv run acestep-api (http://localhost:8001).
Problèmes Courants et Solutions
CUDA Mémoire Insuffisante
Passez à un modèle plus petit (la variante turbo 2B), activez l'offload ou baissez le préréglage de qualité. Le modèle XL nécessite plus de VRAM que le 2B.
Conflit de Port Gradio
Si le port 7860 est occupé, définissez un PORT différent dans votre fichier .env, ou libérez le processus existant (par exemple, lsof -i :7860).
Problèmes de Téléchargement du Modèle
Les checkpoints se téléchargent automatiquement au premier lancement depuis Hugging Face ou ModelScope. Si un téléchargement se bloque, vérifiez votre réseau ou définissez un chemin de configuration personnalisé via le fichier .env.
Problèmes Spécifiques à Windows
Utilisez WSL2 avec Ubuntu pour la meilleure compatibilité. Un GPU NVIDIA compatible CUDA avec un pilote correspondant est requis.
Guide d'Ajustement LoRA pour ACE-Step 1.5
LoRA (Low-Rank Adaptation) vous permet d'affiner ACE-Step 1.5 sur un style musical spécifique sans réentraîner le modèle complet. Selon le dépôt officiel, vous pouvez entraîner un LoRA à partir de quelques chansons seulement en injectant de petites matrices entraînables dans le transformeur de diffusion — apprenant au modèle un nouveau genre, un timbre vocal ou une esthétique de production avec bien moins de calcul qu'un ajustement complet.
Préparation de Votre Dataset
Un dataset bien préparé compte davantage qu'un grand dataset — une poignée de morceaux propres et bien étiquetés peut suffire à infléchir le style du modèle.
- Rassemblez quelques échantillons audio de haute qualité dans votre style cible (format WAV, 44.1kHz)
- Transcrivez les paroles et étiquetez les métadonnées (genre, ambiance, tempo) pour chaque échantillon
- Divisez en ensembles d'entraînement et de validation
Notes d'Entraînement
Conseils généraux pour l'entraînement LoRA d'ACE-Step 1.5 (à ajuster selon vos données et votre matériel) :
- LoRA rank : un rang plus élevé ajoute de la capacité mais consomme plus de VRAM
- Taux d'apprentissage : commencez bas et utilisez un planificateur cosinus
- Époques : surveillez la perte de validation pour éviter le surapprentissage
- Taille de batch : adaptez-la à votre VRAM (l'accumulation de gradients aide sur les GPU plus modestes)
HeartTranscriptor : Préparation Automatisée du Dataset
L'outil open source HeartTranscriptor de HeartMuLa vous aide pour la partie la plus fastidieuse de la préparation du dataset. Au lieu de transcrire manuellement les paroles et d'étiqueter chaque fichier audio, il s'appuie sur la reconnaissance vocale et la recherche d'informations musicales pour générer les métadonnées plus rapidement.
- Téléchargez vos fichiers audio vers HeartTranscriptor pour la transcription et l'étiquetage automatiques
- Révisez et modifiez les métadonnées, paroles et étiquettes de style générées
- Exportez le dataset prêt pour l'entraînement LoRA
Pourquoi Choisir HeartMuLa
Qualité Prête pour la Production
HeartMuLa fournit un audio de qualité production avec des voix claires, un style cohérent et une sortie masterisée prête à la publication.
Aucune Configuration Requise
Pas de GPU, pas de Python, pas de dépendances. La plateforme cloud de HeartMuLa vous permet de générer de la musique instantanément depuis n'importe quel navigateur. Inscrivez-vous et créez votre première chanson en moins de 60 secondes.
Développement Actif et Support
HeartMuLa est activement développé avec des mises à jour régulières, une communauté grandissante et un support dédié. Obtenez de l'aide quand vous en avez besoin, pas seulement via les GitHub Issues.
Prêt pour l'Usage Commercial
Licence Apache 2.0 avec des conditions commerciales claires. Utilisez la musique générée dans n'importe quel projet — YouTube, podcasts, jeux, publicités — sans ambiguïté juridique.
FAQ ACE-Step 1.5
Qu'est-ce qu'ACE-Step 1.5 ?
ACE-Step 1.5 est un modèle de musique IA open source (licence MIT) qui associe un planificateur par modèle de langage à un transformeur de diffusion pour créer de la musique à partir de prompts textuels et de paroles. Il peut s'exécuter localement sur des GPU grand public.
ACE-Step 1.5 est-il meilleur que Suno ?
Ils répondent à des besoins différents. Suno est un service cloud abouti et propriétaire, tandis qu'ACE-Step 1.5 est sous licence MIT et s'exécute localement avec un contrôle total. HeartMuLa est une autre option open source qui propose également une plateforme cloud prête à l'emploi.
De combien de VRAM ACE-Step 1.5 a-t-il besoin ?
Cela dépend de la taille du modèle : le modèle 2B fonctionne avec moins de 4GB de VRAM, tandis que le modèle XL (DiT 4B) nécessite au moins 12GB (20GB+ recommandé). L'interface sélectionne automatiquement une configuration pour votre GPU.
ACE-Step 1.5 peut-il générer des voix avec des paroles ?
Oui. ACE-Step 1.5 génère des voix avec des paroles et prend en charge 50+ langues, selon l'article officiel.
ACE-Step 1.5 prend-il en charge l'ajustement LoRA ?
Oui. Le dépôt officiel indique que vous pouvez entraîner un LoRA à partir de quelques chansons seulement, ce qui vous permet d'adapter le modèle à des genres ou styles spécifiques sans ajustement complet.
Comment ACE-Step 1.5 se compare-t-il à HeartMuLa ?
Selon les spécifications publiées : ACE-Step 1.5 est sous licence MIT, prend en charge 50+ langues et peut produire des boucles allant jusqu'à ~10 minutes ; HeartMuLa oss-3B est sous Apache 2.0. Les deux sont open source et s'exécutent localement. Consultez le tableau comparatif étayé par des sources ci-dessus pour plus de détails.
Puis-je utiliser ACE-Step 1.5 commercialement ?
Oui, ACE-Step 1.5 est publié sous licence MIT, qui autorise l'usage commercial. Assurez-vous que vos données d'entraînement et votre contenu généré respectent les lois sur le droit d'auteur applicables dans votre juridiction.
Quels sont les principaux compromis d'ACE-Step 1.5 ?
Les principaux compromis sont l'effort d'installation locale et les exigences matérielles plus élevées du modèle XL plus grand. La qualité et la vitesse dépendent de la taille du modèle et du GPU que vous utilisez.
Existe-t-il un workflow ComfyUI pour ACE-Step 1.5 ?
Des nœuds ComfyUI communautaires existent pour ACE-Step. Pour HeartMuLa, un nœud personnalisé ComfyUI communautaire (benjiyaya/HeartMuLa_ComfyUI) est disponible.
Devrais-je utiliser ACE-Step 1.5 ou HeartMuLa ?
Choisissez ACE-Step 1.5 pour un contrôle local maximal, l'option 2B à faible VRAM, 50+ langues et l'ajustement LoRA. Choisissez HeartMuLa si vous préférez une plateforme cloud prête à l'emploi et sans tracas aux côtés d'un modèle open source.
Experience HeartMuLa
Generate your first AI song for free — no setup, no GPU required
0/3000