ACE-Step 1.5 리뷰 및 비교 2026
출처 기반 ACE-Step 1.5 개요: 아키텍처 심층 분석, HeartMuLa 및 Suno와의 사양별 비교, 설치 안내, LoRA 파인튜닝 노트 — 모두 공식 논문과 저장소에서 인용
ACE-Step 1.5는 2026년 AI 음악 생성 분야를 뒤흔드는 오픈소스 모델입니다. 이 가이드는 공식 논문을 바탕으로 아키텍처를 분석하고, 공개된 사양을 HeartMuLa 및 Suno와 비교하며, 공식 명령어를 사용한 로컬 설치 과정을 안내하고, LoRA 파인튜닝 지원을 설명합니다. 아래의 모든 수치는 1차 출처로 연결됩니다.
ACE-Step 1.5 아키텍처 이해하기
ACE-Step 1.5는 ACE Studio와 StepFun이 MIT 라이선스로 공개한 오픈소스 AI 음악 모델입니다(arXiv 2602.00744). 단일 엔드투엔드 방식 대신 계획과 합성을 분리합니다. 먼저 언어 모델이 곡에 대해 추론한 뒤, 디퓨전 트랜스포머가 오디오를 렌더링합니다. 아래는 공식 논문에서 인용한 아키텍처의 핵심 요소입니다.
언어 모델 플래너
ACE-Step 1.5는 Qwen3 계열의 언어 모델(0.6B, 1.7B 또는 4B)을 플래너로 사용합니다. 프롬프트가 주어지면 단계별로 추론(chain-of-thought)하여, 오디오가 생성되기 전에 목표 곡을 설명하는 구조화된 메타데이터, 가사, 캡션을 합성합니다.
디퓨전 트랜스포머(DiT) 합성
계획된 청사진이 실제 오디오를 생성하는 디퓨전 트랜스포머(DiT)를 조건화합니다. 2B DiT는 저VRAM 환경을 목표로 하며, 2026년 4월(April 2026)에 공개된 더 큰 XL(4B DiT) 변형은 더 높은 메모리 비용으로 품질을 향상시킵니다.
내재적 강화 학습
외부 보상 모델에 의존하는 대신, ACE-Step 1.5는 내재적 강화 학습을 사용하여 출력을 정렬하며, 모델 자체의 신호로부터 직접 제어성과 음악성을 개선합니다.
오픈소스 스택(MIT)
가중치, 코드, Gradio UI를 포함한 전체 스택은 MIT 라이선스이며 GitHub와 Hugging Face에서 호스팅됩니다. ACE-Step 1.5는 50개 이상의 언어, 단 몇 곡만으로 하는 LoRA 파인튜닝, 그리고 커버 생성, 리페인팅, 보컬-to-BGM 같은 편집 워크플로우를 지원합니다.
ACE-Step 1.5 vs HeartMuLa vs Suno: 사양 비교
주관적 품질 점수가 아닌, 공개된 사양에 대한 객관적이고 출처 기반의 비교
| 속성 | ACE-Step 1.5 | HeartMuLa oss-3B | Suno |
|---|---|---|---|
| 라이선스 | MIT | Apache 2.0 | Proprietary |
| 논문 | arXiv 2602.00744 | arXiv 2601.10547 | — |
| 최소 VRAM | <4GB (2B) / ≥12GB (XL) | 미공개 | 클라우드 (해당 없음) |
| 속도 | <2s (A100), <10s (RTX 3090) | RTF ≈ 1.0 | 클라우드 (해당 없음) |
| 최대 길이 | 최대 10분 | 240s (기본값) | — |
| 언어 | 50+ | 다국어 | — |
| 로컬 배포 | 가능 | 가능 | 불가 |
| LoRA 파인튜닝 | 가능 (소수 샘플) | 미공개 | 불가 |
| 편집 | 커버 / 리페인트 / 보컬-to-BGM | — | — |
출처: ACE-Step 1.5 — arXiv 2602.00744 및 github.com/ACE-Step/ACE-Step-1.5; HeartMuLa — arXiv 2601.10547 및 github.com/HeartMuLa/heartlib. "Not published"로 표시된 항목은 공식 문서에 명시되어 있지 않습니다. 2026-07-16 확인.
ACE-Step 1.5 로컬 설치 가이드
공식 저장소를 따라 로컬 머신에서 ACE-Step 1.5를 실행하는 단계별 가이드
시스템 요구사항 확인
GPU에 맞는 모델을 선택하세요. 2B 모델은 4GB 미만의 VRAM에서 실행되며, XL(4B DiT) 모델은 최소 12GB(20GB+ 권장)가 필요합니다. UI가 GPU에 가장 적합한 구성을 자동으로 선택합니다.
저장소 클론
git clone https://github.com/ACE-Step/ACE-Step-1.5.git && cd ACE-Step-1.5
의존성 설치
uv sync — uv 패키지 관리자로 프로젝트와 그 의존성을 설치합니다.
앱 실행
uv run acestep 은 http://localhost:7860 에서 Gradio UI를 시작합니다. 첫 실행 시 모델 체크포인트가 Hugging Face에서 자동으로 다운로드됩니다.
음악 생성
UI에 프롬프트와 선택적 가사를 입력하고 생성하세요. 대신 REST API를 사용하려면 uv run acestep-api 를 실행하세요(http://localhost:8001).
자주 발생하는 문제 및 해결 방법
CUDA 메모리 부족
더 작은 모델(2B turbo 변형)로 전환하거나, 오프로드를 활성화하거나, 품질 프리셋을 낮추세요. XL 모델은 2B보다 더 많은 VRAM이 필요합니다.
Gradio 포트 충돌
포트 7860이 사용 중이면 .env 파일에서 다른 PORT를 설정하거나 기존 프로세스를 종료하세요(예: lsof -i :7860).
모델 다운로드 문제
체크포인트는 첫 실행 시 Hugging Face 또는 ModelScope에서 자동으로 다운로드됩니다. 다운로드가 멈추면 네트워크를 확인하거나 .env 파일을 통해 사용자 지정 구성 경로를 설정하세요.
Windows 관련 문제
최상의 호환성을 위해 Ubuntu와 함께 WSL2를 사용하세요. 일치하는 드라이버가 설치된 CUDA 지원 NVIDIA GPU가 필요합니다.
ACE-Step 1.5 LoRA 파인튜닝 가이드
LoRA(Low-Rank Adaptation)를 사용하면 전체 모델을 재학습하지 않고도 특정 음악 스타일에 대해 ACE-Step 1.5를 파인튜닝할 수 있습니다. 공식 저장소에 따르면, 디퓨전 트랜스포머에 작은 학습 가능 행렬을 주입함으로써 단 몇 곡만으로 LoRA를 학습할 수 있으며, 전체 파인튜닝보다 훨씬 적은 연산으로 새로운 장르, 보컬 음색, 프로덕션 미학을 모델에 가르칠 수 있습니다.
데이터셋 준비
큰 데이터셋보다 잘 준비된 데이터셋이 더 중요합니다. 깔끔하고 잘 라벨링된 소수의 트랙만으로도 모델의 스타일을 바꾸기에 충분할 수 있습니다.
- 대상 스타일의 고품질 오디오 샘플 몇 개 수집 (WAV 형식, 44.1kHz)
- 각 샘플의 가사를 전사하고 메타데이터(장르, 분위기, 템포) 태깅
- 학습용과 검증용 세트로 분할
학습 노트
ACE-Step 1.5 LoRA 학습에 대한 일반 지침(데이터와 하드웨어에 맞게 조정하세요):
- LoRA rank: rank가 높을수록 용량이 늘어나지만 더 많은 VRAM을 사용합니다
- 학습률: 작게 시작하고 코사인 스케줄러를 사용하세요
- 에포크: 과적합을 피하기 위해 검증 손실을 관찰하세요
- 배치 크기: VRAM에 맞게 조절하세요(그래디언트 누적은 작은 GPU에 도움이 됩니다)
HeartTranscriptor: 자동 데이터셋 준비
HeartMuLa의 오픈소스 HeartTranscriptor 도구는 데이터셋 준비에서 가장 번거로운 부분을 돕습니다. 모든 오디오 파일의 가사를 수동으로 전사하고 태깅하는 대신, 음성 인식과 음악 정보 검색을 사용하여 메타데이터를 더 빠르게 생성합니다.
- 오디오 파일을 HeartTranscriptor에 업로드하여 자동 전사 및 태깅 실행
- 생성된 메타데이터, 가사, 스타일 태그 검토 및 편집
- LoRA 학습에 바로 사용할 수 있는 데이터셋 내보내기
HeartMuLa를 선택해야 하는 이유
프로덕션 수준 품질
HeartMuLa는 명료한 보컬, 일관된 스타일, 바로 출시할 수 있는 마스터링된 출력을 갖춘 프로덕션 수준 오디오를 제공합니다.
설정 불필요
GPU, Python, 의존성이 필요 없습니다. HeartMuLa의 클라우드 플랫폼에서 어떤 브라우저에서든 즉시 음악을 생성할 수 있습니다. 가입 후 60초 이내에 첫 곡을 만들 수 있습니다.
활발한 개발 및 지원
HeartMuLa는 정기적인 업데이트, 성장하는 커뮤니티, 전담 지원과 함께 활발하게 개발되고 있습니다. GitHub 이슈뿐만 아니라 필요할 때 도움을 받을 수 있습니다.
상용 준비 완료
Apache 2.0 라이선스로 명확한 상업적 조건을 제공합니다. 생성된 음악을 YouTube, 팟캐스트, 게임, 광고 등 모든 프로젝트에 법적 모호함 없이 사용할 수 있습니다.
ACE-Step 1.5 자주 묻는 질문
ACE-Step 1.5란 무엇인가요?
ACE-Step 1.5는 언어 모델 플래너와 디퓨전 트랜스포머를 결합하여 텍스트 프롬프트와 가사로부터 음악을 만드는 오픈소스 AI 음악 모델(MIT 라이선스)입니다. 소비자용 GPU에서 로컬로 실행할 수 있습니다.
ACE-Step 1.5가 Suno보다 나은가요?
둘은 서로 다른 요구를 충족합니다. Suno는 세련된 폐쇄형 클라우드 서비스인 반면, ACE-Step 1.5는 MIT 라이선스이며 완전한 제어권과 함께 로컬로 실행됩니다. HeartMuLa는 바로 사용할 수 있는 클라우드 플랫폼도 함께 제공하는 또 다른 오픈소스 옵션입니다.
ACE-Step 1.5에 필요한 VRAM은 얼마인가요?
모델 크기에 따라 다릅니다. 2B 모델은 4GB 미만의 VRAM에서 실행되며, XL(4B DiT) 모델은 최소 12GB(20GB+ 권장)가 필요합니다. UI가 GPU에 맞는 구성을 자동으로 선택합니다.
ACE-Step 1.5로 가사가 있는 보컬을 생성할 수 있나요?
네. 공식 논문에 따르면 ACE-Step 1.5는 가사가 있는 보컬을 생성하며 50개 이상의 언어를 지원합니다.
ACE-Step 1.5는 LoRA 파인튜닝을 지원하나요?
네. 공식 저장소에 따르면 단 몇 곡만으로 LoRA를 학습할 수 있어, 전체 파인튜닝 없이도 특정 장르나 스타일에 모델을 맞출 수 있습니다.
ACE-Step 1.5는 HeartMuLa와 어떻게 비교되나요?
공개된 사양 기준으로, ACE-Step 1.5는 MIT 라이선스이며 50개 이상의 언어를 지원하고 최대 약 10분 길이의 루프를 만들 수 있습니다. HeartMuLa oss-3B는 Apache 2.0입니다. 둘 다 오픈소스이며 로컬로 실행됩니다. 자세한 내용은 위의 출처 기반 비교 표를 참고하세요.
ACE-Step 1.5를 상업적으로 사용할 수 있나요?
네, ACE-Step 1.5는 상업적 사용을 허용하는 MIT 라이선스로 공개되어 있습니다. 학습 데이터와 생성된 콘텐츠가 해당 관할권의 저작권법을 준수하는지 확인하세요.
ACE-Step 1.5의 주요 절충점은 무엇인가요?
주요 절충점은 로컬 설정에 드는 수고와 더 큰 XL 모델의 높은 하드웨어 요구사항입니다. 품질과 속도는 사용하는 모델 크기와 GPU에 따라 달라집니다.
ACE-Step 1.5용 ComfyUI 워크플로우가 있나요?
ACE-Step용 커뮤니티 ComfyUI 노드가 존재합니다. HeartMuLa의 경우 커뮤니티 ComfyUI 커스텀 노드(benjiyaya/HeartMuLa_ComfyUI)를 사용할 수 있습니다.
ACE-Step 1.5와 HeartMuLa 중 무엇을 사용해야 하나요?
최대한의 로컬 제어, 저VRAM 2B 옵션, 50개 이상의 언어, LoRA 파인튜닝이 필요하다면 ACE-Step 1.5를 선택하세요. 오픈소스 모델과 함께 번거로움 없이 바로 사용할 수 있는 클라우드 플랫폼을 선호한다면 HeartMuLa를 선택하세요.
Experience HeartMuLa
Generate your first AI song for free — no setup, no GPU required
0/3000