ACE-Step 1.5: Análise e Comparação 2026
Uma visão geral do ACE-Step 1.5 fundamentada em fontes: mergulho profundo na arquitetura, comparação especificação por especificação com HeartMuLa e Suno, tutorial de instalação e notas sobre ajuste fino LoRA — tudo extraído de artigos e repositórios oficiais
O ACE-Step 1.5 é o modelo de código aberto que está revolucionando a geração de música por IA em 2026. Este guia detalha sua arquitetura a partir do artigo oficial, compara suas especificações publicadas com HeartMuLa e Suno, orienta a instalação local usando os comandos oficiais e explica seu suporte a ajuste fino LoRA. Cada dado abaixo remete a uma fonte de primeira mão.
Entendendo a Arquitetura do ACE-Step 1.5
O ACE-Step 1.5 é um modelo de música por IA de código aberto lançado sob a licença MIT pela ACE Studio e pela StepFun (arXiv 2602.00744). Em vez de uma única passagem de ponta a ponta, ele separa o planejamento da síntese: primeiro um modelo de linguagem raciocina sobre a música, e então um diffusion transformer renderiza o áudio. Abaixo estão os pilares de sua arquitetura, cada um extraído do artigo oficial.
Planejador com Modelo de Linguagem
O ACE-Step 1.5 usa um modelo de linguagem da família Qwen3 (0.6B, 1.7B ou 4B) como planejador. A partir do seu prompt, ele raciocina passo a passo (chain-of-thought) para sintetizar metadados estruturados, letras e uma legenda que descrevem a música-alvo antes de qualquer áudio ser gerado.
Síntese com Diffusion Transformer (DiT)
O plano projetado condiciona um Diffusion Transformer (DiT) que gera o áudio propriamente dito. O DiT 2B é voltado a configurações com pouca VRAM, enquanto a variante maior XL (DiT 4B) — lançada em April 2026 — eleva a qualidade a um custo de memória mais alto.
Aprendizado por Reforço Intrínseco
Em vez de depender de um modelo de recompensa externo, o ACE-Step 1.5 alinha suas saídas usando aprendizado por reforço intrínseco, melhorando a controlabilidade e a musicalidade diretamente a partir dos próprios sinais do modelo.
Stack de Código Aberto (MIT)
A stack completa — pesos, código e uma interface Gradio — é licenciada sob MIT e hospedada no GitHub e no Hugging Face. O ACE-Step 1.5 suporta 50+ idiomas, ajuste fino LoRA a partir de apenas algumas músicas e fluxos de edição como geração de cover, repintura e vocal-to-BGM.
ACE-Step 1.5 vs HeartMuLa vs Suno: Comparação de Especificações
Uma comparação objetiva e fundamentada em fontes de especificações publicadas — não pontuações subjetivas de qualidade
| Propriedade | ACE-Step 1.5 | HeartMuLa oss-3B | Suno |
|---|---|---|---|
| Licença | MIT | Apache 2.0 | Proprietary |
| Artigo | arXiv 2602.00744 | arXiv 2601.10547 | — |
| VRAM Mínima | <4GB (2B) / ≥12GB (XL) | Não publicado | Nuvem (N/A) |
| Velocidade | <2s (A100), <10s (RTX 3090) | RTF ≈ 1.0 | Nuvem (N/A) |
| Duração Máxima | Até 10 min | 240s (padrão) | — |
| Idiomas | 50+ | Multilíngue | — |
| Implantação Local | Sim | Sim | Não |
| Ajuste Fino LoRA | Sim (poucas amostras) | Não publicado | Não |
| Edição | cover / repintura / vocal-to-BGM | — | — |
Fontes: ACE-Step 1.5 — arXiv 2602.00744 e github.com/ACE-Step/ACE-Step-1.5; HeartMuLa — arXiv 2601.10547 e github.com/HeartMuLa/heartlib. Campos marcados como "Not published" não são indicados na documentação oficial. Verificado em 2026-07-16.
Guia de Instalação Local do ACE-Step 1.5
Guia passo a passo para executar o ACE-Step 1.5 na sua máquina local, seguindo o repositório oficial
Verificar os Requisitos do Sistema
Escolha um modelo compatível com sua GPU: o modelo 2B roda com menos de 4GB de VRAM, enquanto o modelo XL (DiT 4B) precisa de pelo menos 12GB (20GB+ recomendado). A interface seleciona automaticamente a melhor configuração para sua GPU.
Clonar o Repositório
git clone https://github.com/ACE-Step/ACE-Step-1.5.git && cd ACE-Step-1.5
Instalar as Dependências
uv sync — instala o projeto e suas dependências com o gerenciador de pacotes uv.
Iniciar o Aplicativo
uv run acestep inicia a interface Gradio em http://localhost:7860. Os checkpoints do modelo são baixados automaticamente do Hugging Face na primeira execução.
Gerar Música
Digite um prompt e letras opcionais na interface e gere. Para usar a API REST em vez disso, execute uv run acestep-api (http://localhost:8001).
Problemas Comuns e Soluções
CUDA Sem Memória
Mude para um modelo menor (a variante 2B turbo), ative o offload ou reduza a predefinição de qualidade. O modelo XL precisa de mais VRAM do que o 2B.
Conflito de Porta do Gradio
Se a porta 7860 estiver ocupada, defina uma PORT diferente no seu arquivo .env, ou libere o processo existente (por exemplo, lsof -i :7860).
Problemas no Download do Modelo
Os checkpoints são baixados automaticamente na primeira execução do Hugging Face ou do ModelScope. Se um download travar, verifique sua rede ou defina um caminho de configuração personalizado através do arquivo .env.
Problemas Específicos do Windows
Use WSL2 com Ubuntu para melhor compatibilidade. É necessária uma GPU NVIDIA compatível com CUDA e com o driver correspondente.
Guia de Ajuste Fino LoRA do ACE-Step 1.5
LoRA (Low-Rank Adaptation) permite ajustar o ACE-Step 1.5 a um estilo musical específico sem retreinar o modelo completo. Segundo o repositório oficial, você pode treinar um LoRA a partir de apenas algumas músicas, injetando pequenas matrizes treináveis no diffusion transformer — ensinando ao modelo um novo gênero, timbre vocal ou estética de produção com muito menos computação do que um ajuste fino completo.
Preparando seu Dataset
Um dataset bem preparado importa mais do que um grande — um punhado de faixas limpas e bem rotuladas pode ser suficiente para mudar o estilo do modelo.
- Colete algumas amostras de áudio de alta qualidade no estilo desejado (formato WAV, 44.1kHz)
- Transcreva as letras e marque metadados (gênero, humor, andamento) para cada amostra
- Divida em conjuntos de treinamento e validação
Notas de Treinamento
Orientação geral para o treinamento LoRA do ACE-Step 1.5 (ajuste conforme seus dados e hardware):
- Rank LoRA: um rank maior adiciona capacidade, mas usa mais VRAM
- Taxa de aprendizado: comece pequeno e use um agendador cosseno
- Épocas: monitore a perda de validação para evitar overfitting
- Tamanho do batch: dimensione conforme sua VRAM (a acumulação de gradientes ajuda em GPUs menores)
HeartTranscriptor: Preparação Automatizada do Dataset
A ferramenta de código aberto HeartTranscriptor do HeartMuLa ajuda na parte mais tediosa da preparação do dataset. Em vez de transcrever letras manualmente e marcar cada arquivo de áudio, ela usa reconhecimento de fala e recuperação de informação musical para gerar metadados mais rapidamente.
- Faça upload dos seus arquivos de áudio no HeartTranscriptor para transcrição e marcação automáticas
- Revise e edite os metadados, letras e tags de estilo gerados
- Exporte o dataset pronto para o treinamento LoRA
Por Que Escolher o HeartMuLa
Qualidade Pronta para Produção
O HeartMuLa entrega áudio de qualidade profissional com vocais nítidos, estilo consistente e saída masterizada pronta para lançamento.
Nenhuma Configuração Necessária
Sem GPU, sem Python, sem dependências. A plataforma na nuvem do HeartMuLa permite gerar música instantaneamente de qualquer navegador. Cadastre-se e crie sua primeira música em menos de 60 segundos.
Desenvolvimento Ativo e Suporte
O HeartMuLa é ativamente desenvolvido com atualizações regulares, uma comunidade crescente e suporte dedicado. Obtenha ajuda quando precisar, não apenas através de GitHub Issues.
Pronto para Uso Comercial
Licenciado sob Apache 2.0 com termos comerciais claros. Use a música gerada em qualquer projeto — YouTube, podcasts, jogos, anúncios — sem ambiguidade legal.
Perguntas Frequentes sobre o ACE-Step 1.5
O que é o ACE-Step 1.5?
O ACE-Step 1.5 é um modelo de música por IA de código aberto (licença MIT) que combina um planejador com modelo de linguagem e um diffusion transformer para criar música a partir de prompts de texto e letras. Ele pode ser executado localmente em GPUs consumer.
O ACE-Step 1.5 é melhor que o Suno?
Eles atendem a necessidades diferentes. O Suno é um serviço na nuvem refinado e de código fechado, enquanto o ACE-Step 1.5 é licenciado sob MIT e roda localmente com controle total. O HeartMuLa é outra opção de código aberto que também oferece uma plataforma na nuvem pronta para usar.
Quanta VRAM o ACE-Step 1.5 precisa?
Depende do tamanho do modelo: o modelo 2B roda com menos de 4GB de VRAM, enquanto o modelo XL (DiT 4B) precisa de pelo menos 12GB (20GB+ recomendado). A interface seleciona automaticamente uma configuração para sua GPU.
O ACE-Step 1.5 pode gerar vocais com letras?
Sim. O ACE-Step 1.5 gera vocais com letras e suporta 50+ idiomas, de acordo com o artigo oficial.
O ACE-Step 1.5 suporta ajuste fino LoRA?
Sim. O repositório oficial afirma que você pode treinar um LoRA a partir de apenas algumas músicas, permitindo adaptar o modelo a gêneros ou estilos específicos sem um ajuste fino completo.
Como o ACE-Step 1.5 se compara ao HeartMuLa?
Nas especificações publicadas: o ACE-Step 1.5 é licenciado sob MIT, suporta 50+ idiomas e pode produzir loops de até ~10 minutos; o HeartMuLa oss-3B é Apache 2.0. Ambos são de código aberto e rodam localmente. Veja a tabela de comparação fundamentada em fontes acima para mais detalhes.
Posso usar o ACE-Step 1.5 comercialmente?
Sim, o ACE-Step 1.5 é lançado sob a licença MIT, que permite uso comercial. Certifique-se de que seus dados de treinamento e o conteúdo gerado estejam em conformidade com as leis de direitos autorais da sua jurisdição.
Quais são os principais trade-offs do ACE-Step 1.5?
Os principais trade-offs são o esforço da configuração local e os requisitos de hardware mais altos do modelo XL maior. A qualidade e a velocidade dependem de qual tamanho de modelo e GPU você usa.
Existe um workflow ComfyUI para o ACE-Step 1.5?
Existem nós ComfyUI da comunidade para o ACE-Step. Para o HeartMuLa, há um nó personalizado ComfyUI da comunidade (benjiyaya/HeartMuLa_ComfyUI) disponível.
Devo usar o ACE-Step 1.5 ou o HeartMuLa?
Escolha o ACE-Step 1.5 para máximo controle local, a opção 2B de baixa VRAM, 50+ idiomas e ajuste fino LoRA. Escolha o HeartMuLa se preferir uma plataforma na nuvem pronta para usar e sem complicações, ao lado de um modelo de código aberto.
Experience HeartMuLa
Generate your first AI song for free — no setup, no GPU required
0/3000