Comparação de IA Musical de Código Aberto

ACE-Step 1.5: Análise e Comparação 2026

Uma visão geral do ACE-Step 1.5 fundamentada em fontes: mergulho profundo na arquitetura, comparação especificação por especificação com HeartMuLa e Suno, tutorial de instalação e notas sobre ajuste fino LoRA — tudo extraído de artigos e repositórios oficiais

O ACE-Step 1.5 é o modelo de código aberto que está revolucionando a geração de música por IA em 2026. Este guia detalha sua arquitetura a partir do artigo oficial, compara suas especificações publicadas com HeartMuLa e Suno, orienta a instalação local usando os comandos oficiais e explica seu suporte a ajuste fino LoRA. Cada dado abaixo remete a uma fonte de primeira mão.

Entendendo a Arquitetura do ACE-Step 1.5

O ACE-Step 1.5 é um modelo de música por IA de código aberto lançado sob a licença MIT pela ACE Studio e pela StepFun (arXiv 2602.00744). Em vez de uma única passagem de ponta a ponta, ele separa o planejamento da síntese: primeiro um modelo de linguagem raciocina sobre a música, e então um diffusion transformer renderiza o áudio. Abaixo estão os pilares de sua arquitetura, cada um extraído do artigo oficial.

Planejador com Modelo de Linguagem

O ACE-Step 1.5 usa um modelo de linguagem da família Qwen3 (0.6B, 1.7B ou 4B) como planejador. A partir do seu prompt, ele raciocina passo a passo (chain-of-thought) para sintetizar metadados estruturados, letras e uma legenda que descrevem a música-alvo antes de qualquer áudio ser gerado.

Síntese com Diffusion Transformer (DiT)

O plano projetado condiciona um Diffusion Transformer (DiT) que gera o áudio propriamente dito. O DiT 2B é voltado a configurações com pouca VRAM, enquanto a variante maior XL (DiT 4B) — lançada em April 2026 — eleva a qualidade a um custo de memória mais alto.

Aprendizado por Reforço Intrínseco

Em vez de depender de um modelo de recompensa externo, o ACE-Step 1.5 alinha suas saídas usando aprendizado por reforço intrínseco, melhorando a controlabilidade e a musicalidade diretamente a partir dos próprios sinais do modelo.

Stack de Código Aberto (MIT)

A stack completa — pesos, código e uma interface Gradio — é licenciada sob MIT e hospedada no GitHub e no Hugging Face. O ACE-Step 1.5 suporta 50+ idiomas, ajuste fino LoRA a partir de apenas algumas músicas e fluxos de edição como geração de cover, repintura e vocal-to-BGM.

ACE-Step 1.5 vs HeartMuLa vs Suno: Comparação de Especificações

Uma comparação objetiva e fundamentada em fontes de especificações publicadas — não pontuações subjetivas de qualidade

PropriedadeACE-Step 1.5HeartMuLa oss-3BSuno
LicençaMITApache 2.0Proprietary
ArtigoarXiv 2602.00744arXiv 2601.10547
VRAM Mínima<4GB (2B) / ≥12GB (XL)Não publicadoNuvem (N/A)
Velocidade<2s (A100), <10s (RTX 3090)RTF ≈ 1.0Nuvem (N/A)
Duração MáximaAté 10 min240s (padrão)
Idiomas50+Multilíngue
Implantação LocalSimSimNão
Ajuste Fino LoRASim (poucas amostras)Não publicadoNão
Ediçãocover / repintura / vocal-to-BGM

Fontes: ACE-Step 1.5 — arXiv 2602.00744 e github.com/ACE-Step/ACE-Step-1.5; HeartMuLa — arXiv 2601.10547 e github.com/HeartMuLa/heartlib. Campos marcados como "Not published" não são indicados na documentação oficial. Verificado em 2026-07-16.

Guia de Instalação Local do ACE-Step 1.5

Guia passo a passo para executar o ACE-Step 1.5 na sua máquina local, seguindo o repositório oficial

1

Verificar os Requisitos do Sistema

Escolha um modelo compatível com sua GPU: o modelo 2B roda com menos de 4GB de VRAM, enquanto o modelo XL (DiT 4B) precisa de pelo menos 12GB (20GB+ recomendado). A interface seleciona automaticamente a melhor configuração para sua GPU.

2

Clonar o Repositório

git clone https://github.com/ACE-Step/ACE-Step-1.5.git && cd ACE-Step-1.5

3

Instalar as Dependências

uv sync — instala o projeto e suas dependências com o gerenciador de pacotes uv.

4

Iniciar o Aplicativo

uv run acestep inicia a interface Gradio em http://localhost:7860. Os checkpoints do modelo são baixados automaticamente do Hugging Face na primeira execução.

5

Gerar Música

Digite um prompt e letras opcionais na interface e gere. Para usar a API REST em vez disso, execute uv run acestep-api (http://localhost:8001).

Problemas Comuns e Soluções

CUDA Sem Memória

Mude para um modelo menor (a variante 2B turbo), ative o offload ou reduza a predefinição de qualidade. O modelo XL precisa de mais VRAM do que o 2B.

Conflito de Porta do Gradio

Se a porta 7860 estiver ocupada, defina uma PORT diferente no seu arquivo .env, ou libere o processo existente (por exemplo, lsof -i :7860).

Problemas no Download do Modelo

Os checkpoints são baixados automaticamente na primeira execução do Hugging Face ou do ModelScope. Se um download travar, verifique sua rede ou defina um caminho de configuração personalizado através do arquivo .env.

Problemas Específicos do Windows

Use WSL2 com Ubuntu para melhor compatibilidade. É necessária uma GPU NVIDIA compatível com CUDA e com o driver correspondente.

Quer uma opção mais fácil?

Pule a complicação da configuração. O HeartMuLa oferece geração de música por IA de código aberto com uma plataforma na nuvem pronta para usar. Cadastre-se gratuitamente e comece a criar em segundos.

Guia de Ajuste Fino LoRA do ACE-Step 1.5

LoRA (Low-Rank Adaptation) permite ajustar o ACE-Step 1.5 a um estilo musical específico sem retreinar o modelo completo. Segundo o repositório oficial, você pode treinar um LoRA a partir de apenas algumas músicas, injetando pequenas matrizes treináveis no diffusion transformer — ensinando ao modelo um novo gênero, timbre vocal ou estética de produção com muito menos computação do que um ajuste fino completo.

Preparando seu Dataset

Um dataset bem preparado importa mais do que um grande — um punhado de faixas limpas e bem rotuladas pode ser suficiente para mudar o estilo do modelo.

  1. Colete algumas amostras de áudio de alta qualidade no estilo desejado (formato WAV, 44.1kHz)
  2. Transcreva as letras e marque metadados (gênero, humor, andamento) para cada amostra
  3. Divida em conjuntos de treinamento e validação

Notas de Treinamento

Orientação geral para o treinamento LoRA do ACE-Step 1.5 (ajuste conforme seus dados e hardware):

  • Rank LoRA: um rank maior adiciona capacidade, mas usa mais VRAM
  • Taxa de aprendizado: comece pequeno e use um agendador cosseno
  • Épocas: monitore a perda de validação para evitar overfitting
  • Tamanho do batch: dimensione conforme sua VRAM (a acumulação de gradientes ajuda em GPUs menores)

HeartTranscriptor: Preparação Automatizada do Dataset

A ferramenta de código aberto HeartTranscriptor do HeartMuLa ajuda na parte mais tediosa da preparação do dataset. Em vez de transcrever letras manualmente e marcar cada arquivo de áudio, ela usa reconhecimento de fala e recuperação de informação musical para gerar metadados mais rapidamente.

  1. Faça upload dos seus arquivos de áudio no HeartTranscriptor para transcrição e marcação automáticas
  2. Revise e edite os metadados, letras e tags de estilo gerados
  3. Exporte o dataset pronto para o treinamento LoRA

Por Que Escolher o HeartMuLa

Qualidade Pronta para Produção

O HeartMuLa entrega áudio de qualidade profissional com vocais nítidos, estilo consistente e saída masterizada pronta para lançamento.

Nenhuma Configuração Necessária

Sem GPU, sem Python, sem dependências. A plataforma na nuvem do HeartMuLa permite gerar música instantaneamente de qualquer navegador. Cadastre-se e crie sua primeira música em menos de 60 segundos.

Desenvolvimento Ativo e Suporte

O HeartMuLa é ativamente desenvolvido com atualizações regulares, uma comunidade crescente e suporte dedicado. Obtenha ajuda quando precisar, não apenas através de GitHub Issues.

Pronto para Uso Comercial

Licenciado sob Apache 2.0 com termos comerciais claros. Use a música gerada em qualquer projeto — YouTube, podcasts, jogos, anúncios — sem ambiguidade legal.

Perguntas Frequentes sobre o ACE-Step 1.5

O que é o ACE-Step 1.5?

O ACE-Step 1.5 é um modelo de música por IA de código aberto (licença MIT) que combina um planejador com modelo de linguagem e um diffusion transformer para criar música a partir de prompts de texto e letras. Ele pode ser executado localmente em GPUs consumer.

O ACE-Step 1.5 é melhor que o Suno?

Eles atendem a necessidades diferentes. O Suno é um serviço na nuvem refinado e de código fechado, enquanto o ACE-Step 1.5 é licenciado sob MIT e roda localmente com controle total. O HeartMuLa é outra opção de código aberto que também oferece uma plataforma na nuvem pronta para usar.

Quanta VRAM o ACE-Step 1.5 precisa?

Depende do tamanho do modelo: o modelo 2B roda com menos de 4GB de VRAM, enquanto o modelo XL (DiT 4B) precisa de pelo menos 12GB (20GB+ recomendado). A interface seleciona automaticamente uma configuração para sua GPU.

O ACE-Step 1.5 pode gerar vocais com letras?

Sim. O ACE-Step 1.5 gera vocais com letras e suporta 50+ idiomas, de acordo com o artigo oficial.

O ACE-Step 1.5 suporta ajuste fino LoRA?

Sim. O repositório oficial afirma que você pode treinar um LoRA a partir de apenas algumas músicas, permitindo adaptar o modelo a gêneros ou estilos específicos sem um ajuste fino completo.

Como o ACE-Step 1.5 se compara ao HeartMuLa?

Nas especificações publicadas: o ACE-Step 1.5 é licenciado sob MIT, suporta 50+ idiomas e pode produzir loops de até ~10 minutos; o HeartMuLa oss-3B é Apache 2.0. Ambos são de código aberto e rodam localmente. Veja a tabela de comparação fundamentada em fontes acima para mais detalhes.

Posso usar o ACE-Step 1.5 comercialmente?

Sim, o ACE-Step 1.5 é lançado sob a licença MIT, que permite uso comercial. Certifique-se de que seus dados de treinamento e o conteúdo gerado estejam em conformidade com as leis de direitos autorais da sua jurisdição.

Quais são os principais trade-offs do ACE-Step 1.5?

Os principais trade-offs são o esforço da configuração local e os requisitos de hardware mais altos do modelo XL maior. A qualidade e a velocidade dependem de qual tamanho de modelo e GPU você usa.

Existe um workflow ComfyUI para o ACE-Step 1.5?

Existem nós ComfyUI da comunidade para o ACE-Step. Para o HeartMuLa, há um nó personalizado ComfyUI da comunidade (benjiyaya/HeartMuLa_ComfyUI) disponível.

Devo usar o ACE-Step 1.5 ou o HeartMuLa?

Escolha o ACE-Step 1.5 para máximo controle local, a opção 2B de baixa VRAM, 50+ idiomas e ajuste fino LoRA. Escolha o HeartMuLa se preferir uma plataforma na nuvem pronta para usar e sem complicações, ao lado de um modelo de código aberto.

Try Now

Experience HeartMuLa

Generate your first AI song for free — no setup, no GPU required

0/3000

Guias Relacionados

Guia de Instalação do HeartMuLa

Implante o HeartMuLa localmente com nosso guia de instalação passo a passo.

HeartMuLa vs Suno: Comparação

Comparação detalhada entre o HeartMuLa e o gerador de música IA Suno.

Guia de Letras para Música

Aprenda a criar músicas a partir de letras usando geração de música por IA.

Pronto para Criar Música IA Profissional?

Pule a configuração complexa. O HeartMuLa oferece geração de música por IA sem nenhuma configuração. Comece a criar gratuitamente.