ACE-Step 1.5 レビューと比較 2026
出典に基づく ACE-Step 1.5 の概説:アーキテクチャの詳細解説、HeartMuLa および Suno とのスペック別比較、インストール手順、そして LoRA ファインチューニングに関するメモ——すべて公式論文とリポジトリを典拠としています
ACE-Step 1.5 は、2026 年に AI 音楽生成の分野を揺るがしているオープンソースモデルです。本ガイドでは、公式論文をもとにそのアーキテクチャを解説し、公開されたスペックを HeartMuLa および Suno と比較し、公式コマンドを用いたローカルインストールの手順を追い、その LoRA ファインチューニング対応について説明します。以下のすべての数値は一次情報源にリンクしています。
ACE-Step 1.5 のアーキテクチャを理解する
ACE-Step 1.5 は、ACE Studio と StepFun によって MIT ライセンスのもとで公開されたオープンソースの AI 音楽モデルです(arXiv 2602.00744)。単一のエンドツーエンド処理ではなく、計画と合成を分離しています。まず言語モデルが楽曲について推論し、その後 DiT が音声をレンダリングします。以下は、いずれも公式論文から引用した、そのアーキテクチャの柱です。
言語モデルによるプランナー
ACE-Step 1.5 は、Qwen3 ファミリー(0.6B、1.7B、または 4B)の言語モデルをプランナーとして使用します。プロンプトを与えると、段階的に推論(chain-of-thought)を行い、音声が生成される前に、目標とする楽曲を記述する構造化されたメタデータ、歌詞、キャプションを合成します。
DiT による合成
計画された設計図が Diffusion Transformer(DiT)を条件付けし、実際の音声を生成します。2B DiT は低 VRAM 環境を対象とし、より大きな XL(4B DiT)バリアント——April 2026 に公開——はメモリコストと引き換えに品質を高めます。
内在的強化学習
外部の報酬モデルに依存するのではなく、ACE-Step 1.5 は内在的強化学習を用いて出力を調整し、モデル自身のシグナルから制御性と音楽性を直接向上させます。
オープンソーススタック(MIT)
重み、コード、Gradio UI を含むスタック全体が MIT ライセンスで、GitHub と Hugging Face にホストされています。ACE-Step 1.5 は 50+ の言語に対応し、わずか数曲からの LoRA ファインチューニング、そしてカバー生成、リペイント、ボーカルから BGM への変換といった編集ワークフローをサポートします。
ACE-Step 1.5 対 HeartMuLa 対 Suno:スペック比較
主観的な品質スコアではなく、公開されたスペックの客観的で出典に基づいた比較
| 項目 | ACE-Step 1.5 | HeartMuLa oss-3B | Suno |
|---|---|---|---|
| ライセンス | MIT | Apache 2.0 | Proprietary |
| 論文 | arXiv 2602.00744 | arXiv 2601.10547 | — |
| 最小 VRAM | <4GB(2B)/ ≥12GB(XL) | Not published | クラウド(N/A) |
| 速度 | <2s(A100)、<10s(RTX 3090) | RTF ≈ 1.0 | クラウド(N/A) |
| 最大長さ | 最大 10 分 | 240s(デフォルト) | — |
| 言語 | 50+ | 多言語 | — |
| ローカルデプロイ | 対応 | 対応 | 非対応 |
| LoRA ファインチューニング | 対応(数サンプル) | Not published | 非対応 |
| 編集 | カバー / リペイント / ボーカルから BGM | — | — |
出典:ACE-Step 1.5 — arXiv 2602.00744 および github.com/ACE-Step/ACE-Step-1.5、HeartMuLa — arXiv 2601.10547 および github.com/HeartMuLa/heartlib。「Not published」と記された項目は公式ドキュメントに記載がありません。2026-07-16 に確認。
ACE-Step 1.5 ローカルインストールガイド
公式リポジトリに従って、ローカルマシンで ACE-Step 1.5 を実行するためのステップバイステップガイド
システム要件を確認する
GPU に合わせてモデルを選びましょう。2B モデルは 4GB 未満の VRAM で動作し、XL(4B DiT)モデルは少なくとも 12GB(20GB+ 推奨)を必要とします。UI は GPU に最適な構成を自動選択します。
リポジトリをクローンする
git clone https://github.com/ACE-Step/ACE-Step-1.5.git && cd ACE-Step-1.5
依存関係をインストールする
uv sync — uv パッケージマネージャでプロジェクトとその依存関係をインストールします。
アプリを起動する
uv run acestep は http://localhost:7860 で Gradio UI を起動します。モデルのチェックポイントは初回実行時に Hugging Face から自動的にダウンロードされます。
音楽を生成する
UI にプロンプトと任意の歌詞を入力して生成します。代わりに REST API を使うには、uv run acestep-api を実行してください(http://localhost:8001)。
よくある問題と対処法
CUDA のメモリ不足
より小さいモデル(2B turbo バリアント)に切り替える、オフロードを有効にする、または品質プリセットを下げてください。XL モデルは 2B より多くの VRAM を必要とします。
Gradio のポート競合
ポート 7860 が使用中の場合は、.env ファイルで別の PORT を設定するか、既存のプロセスを解放してください(例:lsof -i :7860)。
モデルのダウンロードの問題
チェックポイントは初回実行時に Hugging Face または ModelScope から自動ダウンロードされます。ダウンロードが停止する場合は、ネットワークを確認するか、.env ファイルでカスタム設定パスを指定してください。
Windows 固有の問題
最良の互換性のため、Ubuntu を用いた WSL2 を使用してください。CUDA 対応の NVIDIA GPU と、対応するドライバが必要です。
ACE-Step 1.5 LoRA ファインチューニングガイド
LoRA(Low-Rank Adaptation)を使うと、モデル全体を再学習することなく、特定の音楽スタイルで ACE-Step 1.5 をファインチューニングできます。公式リポジトリによると、DiT に小さな学習可能な行列を注入することで、わずか数曲から LoRA を学習でき——フルファインチューニングよりもはるかに少ない計算量で、新しいジャンル、ボーカルの音色、あるいはプロダクションの美学をモデルに教え込めます。
データセットの準備
適切に準備されたデータセットは、大規模なものよりも重要です——きちんとラベル付けされたクリーンな数曲だけでも、モデルのスタイルを変えるのに十分です。
- 目標とするスタイルの高品質な音声サンプルを数点集める(WAV 形式、44.1kHz)
- 各サンプルの歌詞を書き起こし、メタデータ(ジャンル、ムード、テンポ)をタグ付けする
- 学習用と検証用のセットに分割する
学習に関するメモ
ACE-Step 1.5 の LoRA 学習に関する一般的な指針(データとハードウェアに合わせて調整してください):
- LoRA ランク:ランクを高くすると容量は増えますが、より多くの VRAM を使用します
- 学習率:小さく始め、コサインスケジューラを使用します
- エポック:過学習を避けるため、検証損失を注視します
- バッチサイズ:VRAM に合わせて調整します(勾配累積は小さめの GPU で役立ちます)
HeartTranscriptor:データセット準備の自動化
HeartMuLa のオープンソースツール HeartTranscriptor は、データセット準備の最も面倒な部分を助けます。歌詞を手作業で書き起こしたり、すべての音声ファイルをタグ付けしたりする代わりに、音声認識と音楽情報検索を用いてメタデータをより速く生成します。
- 音声ファイルを HeartTranscriptor にアップロードして、自動書き起こしとタグ付けを行う
- 生成されたメタデータ、歌詞、スタイルタグを確認・編集する
- LoRA 学習にすぐ使えるデータセットをエクスポートする
HeartMuLa を選ぶ理由
製品版クオリティ
HeartMuLa は、クリアなボーカル、一貫したスタイル、そしてリリース準備の整ったマスタリング済み出力で、製品レベルの音声を提供します。
セットアップ不要
GPU も Python も依存関係も不要。HeartMuLa のクラウドプラットフォームなら、どのブラウザからでも即座に音楽を生成できます。登録して、最初の曲を 60 秒以内に作りましょう。
活発な開発とサポート
HeartMuLa は、定期的なアップデート、成長するコミュニティ、専任のサポートとともに活発に開発されています。GitHub issues に頼るだけでなく、必要なときに助けを得られます。
商用対応
Apache 2.0 ライセンスで、明確な商用条件を備えています。生成した音楽を、YouTube、ポッドキャスト、ゲーム、広告など、あらゆるプロジェクトで法的な曖昧さなく使用できます。
ACE-Step 1.5 よくある質問
ACE-Step 1.5 とは何ですか?
ACE-Step 1.5 は、言語モデルのプランナーと DiT を組み合わせて、テキストプロンプトと歌詞から音楽を作成するオープンソースの AI 音楽モデル(MIT ライセンス)です。コンシューマー向け GPU 上でローカルに実行できます。
ACE-Step 1.5 は Suno より優れていますか?
それぞれ異なるニーズに応えます。Suno は洗練されたクローズドソースのクラウドサービスであり、一方 ACE-Step 1.5 は MIT ライセンスで、完全な制御のもとローカルに動作します。HeartMuLa は、すぐに使えるクラウドプラットフォームも提供する、もう一つのオープンソースの選択肢です。
ACE-Step 1.5 はどれくらいの VRAM を必要としますか?
モデルサイズによります。2B モデルは 4GB 未満の VRAM で動作し、XL(4B DiT)モデルは少なくとも 12GB(20GB+ 推奨)を必要とします。UI は GPU に合わせた構成を自動選択します。
ACE-Step 1.5 は歌詞付きのボーカルを生成できますか?
はい。公式論文によると、ACE-Step 1.5 は歌詞付きのボーカルを生成し、50+ の言語に対応します。
ACE-Step 1.5 は LoRA ファインチューニングに対応していますか?
はい。公式リポジトリによると、わずか数曲から LoRA を学習でき、フルファインチューニングなしにモデルを特定のジャンルやスタイルに適応させられます。
ACE-Step 1.5 は HeartMuLa と比べてどうですか?
公開スペックでは:ACE-Step 1.5 は MIT ライセンスで、50+ の言語に対応し、最大 ~10 分のループを生成できます。HeartMuLa oss-3B は Apache 2.0 です。どちらもオープンソースで、ローカルに動作します。詳細は上記の出典に基づく比較表をご覧ください。
ACE-Step 1.5 を商用利用できますか?
はい、ACE-Step 1.5 は MIT ライセンスで公開されており、商用利用が許可されています。学習データと生成されたコンテンツが、あなたの管轄区域の著作権法に準拠していることを確認してください。
ACE-Step 1.5 の主なトレードオフは何ですか?
主なトレードオフは、ローカルセットアップの手間と、より大きな XL モデルの高いハードウェア要件です。品質と速度は、どのモデルサイズと GPU を使うかによって変わります。
ACE-Step 1.5 用の ComfyUI ワークフローはありますか?
ACE-Step 向けのコミュニティ製 ComfyUI ノードが存在します。HeartMuLa については、コミュニティ製の ComfyUI カスタムノード(benjiyaya/HeartMuLa_ComfyUI)が利用可能です。
ACE-Step 1.5 と HeartMuLa のどちらを使うべきですか?
最大限のローカル制御、小 VRAM の 2B オプション、50+ の言語、そして LoRA ファインチューニングを求めるなら ACE-Step 1.5 を選びましょう。オープンソースモデルとともに、手間のかからないすぐ使えるクラウドプラットフォームを好むなら HeartMuLa を選びましょう。
Experience HeartMuLa
Generate your first AI song for free — no setup, no GPU required
0/3000