ACE-Step 1.5 Test & Vergleich 2026
Ein quellengestützter Überblick über ACE-Step 1.5: Architektur im Detail, ein Vergleich Spezifikation für Spezifikation mit HeartMuLa und Suno, eine Installationsanleitung und Hinweise zum LoRA-Finetuning — alles auf Grundlage offizieller Paper und Repositories
ACE-Step 1.5 ist das Open-Source-Modell, das die KI-Musikgenerierung 2026 aufmischt. Dieser Leitfaden schlüsselt die Architektur anhand des offiziellen Papers auf, vergleicht die veröffentlichten Spezifikationen mit HeartMuLa und Suno, führt anhand der offiziellen Befehle durch die lokale Installation und erklärt die Unterstützung für LoRA-Finetuning. Jede Kennzahl unten verweist auf eine Primärquelle.
Die Architektur von ACE-Step 1.5 verstehen
ACE-Step 1.5 ist ein Open-Source-KI-Musikmodell, das von ACE Studio und StepFun unter der MIT-Lizenz veröffentlicht wurde (arXiv 2602.00744). Statt eines einzigen End-to-End-Durchlaufs trennt es Planung von Synthese: Zuerst denkt ein Sprachmodell über den Song nach, dann rendert ein Diffusionstransformer das Audio. Nachfolgend die Grundpfeiler seiner Architektur, jeweils dem offiziellen Paper entnommen.
Sprachmodell-Planer
ACE-Step 1.5 verwendet ein Sprachmodell aus der Qwen3-Familie (0.6B, 1.7B oder 4B) als Planer. Ausgehend von Ihrem Prompt denkt es Schritt für Schritt (Chain-of-Thought), um strukturierte Metadaten, Liedtexte und eine Beschreibung des Zielsongs zu synthetisieren, bevor überhaupt Audio erzeugt wird.
Diffusionstransformer (DiT)-Synthese
Der geplante Entwurf konditioniert einen Diffusionstransformer (DiT), der das eigentliche Audio erzeugt. Der 2B-DiT ist auf Setups mit wenig VRAM ausgelegt, während die größere XL-Variante (4B-DiT) — veröffentlicht im April 2026 — die Qualität zu höheren Speicherkosten steigert.
Intrinsisches Reinforcement Learning
Statt sich auf ein externes Belohnungsmodell zu verlassen, richtet ACE-Step 1.5 seine Ausgaben mittels intrinsischem Reinforcement Learning aus und verbessert Steuerbarkeit und Musikalität direkt aus den eigenen Signalen des Modells.
Open-Source-Stack (MIT)
Der komplette Stack — Gewichte, Code und eine Gradio-UI — steht unter MIT-Lizenz und wird auf GitHub und Hugging Face gehostet. ACE-Step 1.5 unterstützt 50+ Sprachen, LoRA-Finetuning aus nur wenigen Songs sowie Bearbeitungs-Workflows wie Cover-Generierung, Repainting und Vocal-to-BGM.
ACE-Step 1.5 vs HeartMuLa vs Suno: Spezifikationsvergleich
Ein objektiver, quellengestützter Vergleich veröffentlichter Spezifikationen — keine subjektiven Qualitätsbewertungen
| Eigenschaft | ACE-Step 1.5 | HeartMuLa oss-3B | Suno |
|---|---|---|---|
| Lizenz | MIT | Apache 2.0 | Proprietary |
| Paper | arXiv 2602.00744 | arXiv 2601.10547 | — |
| Minimaler VRAM | <4GB (2B) / ≥12GB (XL) | Nicht veröffentlicht | Cloud (k. A.) |
| Geschwindigkeit | <2s (A100), <10s (RTX 3090) | RTF ≈ 1.0 | Cloud (k. A.) |
| Maximale Dauer | Bis zu 10 Min. | 240s (Standard) | — |
| Sprachen | 50+ | Mehrsprachig | — |
| Lokale Bereitstellung | Ja | Ja | Nein |
| LoRA-Finetuning | Ja (wenige Samples) | Nicht veröffentlicht | Nein |
| Bearbeitung | Cover / Repaint / Vocal-to-BGM | — | — |
Quellen: ACE-Step 1.5 — arXiv 2602.00744 und github.com/ACE-Step/ACE-Step-1.5; HeartMuLa — arXiv 2601.10547 und github.com/HeartMuLa/heartlib. Mit "Not published" gekennzeichnete Felder sind in der offiziellen Dokumentation nicht angegeben. Geprüft am 2026-07-16.
ACE-Step 1.5 Lokale Installationsanleitung
Schritt-für-Schritt-Anleitung zum Ausführen von ACE-Step 1.5 auf Ihrem lokalen Rechner, gemäß dem offiziellen Repository
Systemanforderungen prüfen
Wählen Sie ein Modell passend zu Ihrer GPU: Das 2B-Modell läuft mit unter 4GB VRAM, während das XL-Modell (4B-DiT) mindestens 12GB benötigt (20GB+ empfohlen). Die UI wählt automatisch die beste Konfiguration für Ihre GPU.
Repository klonen
git clone https://github.com/ACE-Step/ACE-Step-1.5.git && cd ACE-Step-1.5
Abhängigkeiten installieren
uv sync — installiert das Projekt und seine Abhängigkeiten mit dem Paketmanager uv.
App starten
uv run acestep startet die Gradio-UI unter http://localhost:7860. Die Modell-Checkpoints werden beim ersten Start automatisch von Hugging Face heruntergeladen.
Musik generieren
Geben Sie einen Prompt und optionale Liedtexte in der UI ein und generieren Sie. Um stattdessen die REST-API zu verwenden, führen Sie uv run acestep-api aus (http://localhost:8001).
Häufige Probleme und Lösungen
CUDA-Speicher erschöpft
Wechseln Sie zu einem kleineren Modell (der 2B-Turbo-Variante), aktivieren Sie Offloading oder senken Sie die Qualitätsvoreinstellung. Das XL-Modell benötigt mehr VRAM als das 2B.
Gradio-Port-Konflikt
Wenn Port 7860 belegt ist, setzen Sie einen anderen PORT in Ihrer .env-Datei oder geben Sie den bestehenden Prozess frei (zum Beispiel lsof -i :7860).
Probleme beim Modell-Download
Checkpoints werden beim ersten Start automatisch von Hugging Face oder ModelScope heruntergeladen. Falls ein Download hängt, prüfen Sie Ihr Netzwerk oder legen Sie über die .env-Datei einen benutzerdefinierten Konfigurationspfad fest.
Windows-spezifische Probleme
Verwenden Sie WSL2 mit Ubuntu für die beste Kompatibilität. Eine CUDA-fähige NVIDIA-GPU mit passendem Treiber ist erforderlich.
ACE-Step 1.5 LoRA-Finetuning-Anleitung
LoRA (Low-Rank Adaptation) ermöglicht es Ihnen, ACE-Step 1.5 auf einen bestimmten Musikstil feinabzustimmen, ohne das vollständige Modell neu zu trainieren. Laut dem offiziellen Repository können Sie ein LoRA aus nur wenigen Songs trainieren, indem Sie kleine trainierbare Matrizen in den Diffusionstransformer einfügen — und dem Modell so ein neues Genre, eine Gesangsfarbe oder eine Produktionsästhetik mit weit weniger Rechenaufwand als beim vollständigen Finetuning beibringen.
Datensatz vorbereiten
Ein gut vorbereiteter Datensatz zählt mehr als ein großer — eine Handvoll sauberer, gut beschrifteter Tracks kann ausreichen, um den Stil des Modells zu verschieben.
- Sammeln Sie einige wenige hochwertige Audio-Samples in Ihrem Zielstil (WAV-Format, 44.1kHz)
- Transkribieren Sie Liedtexte und taggen Sie Metadaten (Genre, Stimmung, Tempo) für jedes Sample
- Teilen Sie in Trainings- und Validierungssets auf
Trainingshinweise
Allgemeine Hinweise für das LoRA-Training von ACE-Step 1.5 (an Ihre Daten und Hardware anpassen):
- LoRA-Rank: Ein höherer Rank bringt mehr Kapazität, benötigt aber mehr VRAM
- Lernrate: Klein beginnen und einen Kosinus-Scheduler verwenden
- Epochen: Den Validierungsverlust beobachten, um Überanpassung zu vermeiden
- Batch-Größe: An Ihren VRAM anpassen (Gradientenakkumulation hilft bei kleineren GPUs)
HeartTranscriptor: Automatisierte Datensatzvorbereitung
Das Open-Source-Tool HeartTranscriptor von HeartMuLa hilft beim mühsamsten Teil der Datensatzvorbereitung. Statt Liedtexte manuell zu transkribieren und jede Audiodatei zu taggen, nutzt es Spracherkennung und Music Information Retrieval, um Metadaten schneller zu erzeugen.
- Laden Sie Ihre Audio-Dateien in HeartTranscriptor für automatische Transkription und Tagging hoch
- Überprüfen und bearbeiten Sie die generierten Metadaten, Liedtexte und Stil-Tags
- Exportieren Sie den fertigen, für das LoRA-Training bereiten Datensatz
Warum HeartMuLa wählen
Produktionsreife Qualität
HeartMuLa liefert Audio in Produktionsqualität mit klarem Gesang, konsistentem Stil und gemastertem Output, der veröffentlichungsbereit ist.
Keine Einrichtung erforderlich
Keine GPU, kein Python, keine Abhängigkeiten. Die Cloud-Plattform von HeartMuLa ermöglicht sofortige Musikgenerierung von jedem Browser aus. Registrieren Sie sich und erstellen Sie Ihren ersten Song in unter 60 Sekunden.
Aktive Entwicklung und Support
HeartMuLa wird aktiv entwickelt mit regelmäßigen Updates, einer wachsenden Community und dediziertem Support. Erhalten Sie Hilfe, wenn Sie sie brauchen, nicht nur über GitHub Issues.
Kommerziell einsatzbereit
Apache 2.0-lizenziert mit klaren kommerziellen Bedingungen. Verwenden Sie generierte Musik in jedem Projekt — YouTube, Podcasts, Spiele, Werbung — ohne rechtliche Unklarheiten.
ACE-Step 1.5 FAQ
Was ist ACE-Step 1.5?
ACE-Step 1.5 ist ein Open-Source-KI-Musikmodell (MIT-Lizenz), das einen Sprachmodell-Planer mit einem Diffusionstransformer kombiniert, um Musik aus Textprompts und Liedtexten zu erstellen. Es kann lokal auf Consumer-GPUs ausgeführt werden.
Ist ACE-Step 1.5 besser als Suno?
Sie bedienen unterschiedliche Bedürfnisse. Suno ist ein ausgefeilter, closed-source Cloud-Dienst, während ACE-Step 1.5 MIT-lizenziert ist und mit voller Kontrolle lokal läuft. HeartMuLa ist eine weitere Open-Source-Option, die zusätzlich eine sofort einsatzbereite Cloud-Plattform bietet.
Wie viel VRAM benötigt ACE-Step 1.5?
Das hängt von der Modellgröße ab: Das 2B-Modell läuft mit unter 4GB VRAM, während das XL-Modell (4B-DiT) mindestens 12GB benötigt (20GB+ empfohlen). Die UI wählt automatisch eine Konfiguration für Ihre GPU.
Kann ACE-Step 1.5 Gesang mit Liedtexten generieren?
Ja. ACE-Step 1.5 generiert Gesang mit Liedtexten und unterstützt laut dem offiziellen Paper 50+ Sprachen.
Unterstützt ACE-Step 1.5 LoRA-Finetuning?
Ja. Das offizielle Repository gibt an, dass Sie ein LoRA aus nur wenigen Songs trainieren können, wodurch Sie das Modell ohne vollständiges Finetuning an bestimmte Genres oder Stile anpassen können.
Wie schneidet ACE-Step 1.5 im Vergleich zu HeartMuLa ab?
Nach veröffentlichten Spezifikationen: ACE-Step 1.5 ist MIT-lizenziert, unterstützt 50+ Sprachen und kann Loops von bis zu ~10 Minuten erzeugen; HeartMuLa oss-3B ist Apache 2.0. Beide sind Open Source und laufen lokal. Details finden Sie in der quellengestützten Vergleichstabelle oben.
Kann ich ACE-Step 1.5 kommerziell nutzen?
Ja, ACE-Step 1.5 wird unter der MIT-Lizenz veröffentlicht, die kommerzielle Nutzung erlaubt. Stellen Sie sicher, dass Ihre Trainingsdaten und generierten Inhalte den Urheberrechtsgesetzen in Ihrer Gerichtsbarkeit entsprechen.
Was sind die wichtigsten Kompromisse bei ACE-Step 1.5?
Die wichtigsten Kompromisse sind der Aufwand der lokalen Einrichtung und die höheren Hardwareanforderungen des größeren XL-Modells. Qualität und Geschwindigkeit hängen davon ab, welche Modellgröße und GPU Sie verwenden.
Gibt es einen ComfyUI-Workflow für ACE-Step 1.5?
Für ACE-Step existieren von der Community erstellte ComfyUI-Knoten. Für HeartMuLa ist ein von der Community erstellter ComfyUI-Custom-Node (benjiyaya/HeartMuLa_ComfyUI) verfügbar.
Sollte ich ACE-Step 1.5 oder HeartMuLa verwenden?
Wählen Sie ACE-Step 1.5 für maximale lokale Kontrolle, die 2B-Option mit wenig VRAM, 50+ Sprachen und LoRA-Finetuning. Wählen Sie HeartMuLa, wenn Sie eine unkomplizierte, sofort einsatzbereite Cloud-Plattform neben einem Open-Source-Modell bevorzugen.
Experience HeartMuLa
Generate your first AI song for free — no setup, no GPU required
0/3000