AI ボーカルリムーバー&ステム分離ツール

Mazmazika 楽曲ボーカルリムーバー

カラオケ音源をかんたん作成:どんな曲(YouTube・SNS のリンク・MP3/WAV)でも最大 6 ステムに分離し、同期歌詞に合わせて歌ったり、自分のテイクを録音したり、AI ボイスクローンで曲を自分の声で聴いたりできます。最先端の AI による高速・高精度なボーカル分離。

Mazmazika ボーカルリムーバーとカラオケスタジオについて

ボーカルリムーバーは、完成したミックスを元のパートに分離します。YouTube、SoundCloud、TikTok、Facebook の曲を指定するか、MP3 や WAV をアップロードすると、何千ものマルチトラック録音で学習したニューラルネットワークが、音のどの部分がボーカル、ドラム、ベース、ピアノ、ギター、そのほかの楽器に属するかを推定します。各パートは個別のファイルとして受け取れます。カラオケ用のクリーンなインストゥルメンタル、リミックス用のアカペラ、練習用のドラムだけのトラックなどです。

しかも、分離だけでは終わりません。結果はカラオケスタジオで開きます。曲の再生に合わせて歌詞が単語ごとに光り、バンドに合わせて自分のテイクを録音でき、AI ボイスクローンが曲をあなた自身の声で歌い直します。処理はすべて Mazmazika のサーバー上で行われ(Ultra と高音質エンジンは GPU で動作)、インストール不要で、スマートフォンでもノートパソコンと同じように使えます。

仕組み

  1. リンクを貼り付けるか、ファイルをアップロードします。音声はサーバー上で取得・デコードされます。
  2. エンジンとステム数を選びます。Ultra は 2、4、6 ステム(ボーカル、ドラム、ベース、ピアノ、ギター、その他)に分離し、高音質は最もクリーンなボーカルとインストゥルメンタルのペアを、標準は最大 5 ステムを出力します。Ultra と高音質は 320 kbps の MP3 で出力します。
  3. 歌詞が必要なら「同期歌詞」をオンにしてから処理します。一般的な 4 分の曲なら、Ultra で 1 分足らずで完了します。
  4. スタジオが開きます。各ステムは、音量、パン、ミュート、ソロ、エフェクトを個別に備えたトラックになり、カラオケ画面に歌詞が表示されます。
  5. テイクを録音し、自分の声のトラックを追加して、個別のトラック、ミックス全体、またはすべてを一括でダウンロードできます — エフェクトあり・なしのどちらでも。保存したプロジェクトは、閉じたときの状態のまま再び開きます。

ミュージシャンの活用シーン

  • カラオケ:リードボーカルを取り除き、バンドはフル音質のまま、画面の歌詞を見ながら歌えます。
  • 歌の練習:原曲に合わせて何テイクも録音し、トラックごとに聴き比べて、いちばん良いものを残せます。
  • AI ボイスクローンで、曲を覚える前に自分の声で歌うとどう聞こえるかを確かめられます。
  • リミックス、マッシュアップ、DJ セット用のアカペラ。
  • 練習用トラック:自分の楽器のステムをミュートして、残りのバンドと一緒に演奏。
  • 耳コピと研究:ベース、ピアノ、ギターを単独で取り出して、パートをはっきり聴き取る。
  • ボーカル指導:歌い手のテイクを、分離したオリジナルと聴き比べる。

無料版と Pro の違い

現在のプラン設定からリアルタイムで読み込んでいるため、このセクションは常にツールが今日適用している内容と一致します。

プランと最新の料金を見る

従来の位相キャンセルによる「ボーカルカット」やデスクトップ用のステム分離ソフトと比べて、このオンラインリムーバーはインストールも自前の GPU も不要です。AI 分離はセンターチャンネルのトリックでは消えてしまうリバーブの余韻やハーモニーも残し、結果はファイルの入ったフォルダーではなく、完全なカラオケスタジオとして手に入ります。

ブラウザーの中のカラオケスタジオ

スタジオでは各ステムがトラックとして表示されます。クリックして再生位置を移動できる波形付きの横長のレーンか、昔ながらの縦型チャンネルストリップを選べます。各トラックには回転式の音量ノブとパンノブ、ミュートとソロ、ステレオのレベルメーター、そして専用のエフェクトラック(ローカット、3 バンド EQ、コンプレッサー、温かみ、移調、ダブリング、フランジャー、エコー、リバーブ、リミッター)があり、「仕上げ」「ウォーム」「エアー」「ホール」「ラジオ」「スラップバック」などのワンタッププリセットも使えます。

録音機能も内蔵しています。「録音」を押すと 3 拍のカウントインのあとにバンドが始まり、あなたの声がステムの上にエフェクトなしで録音されます。テイクはそれぞれ独立したトラック(テイク 1、テイク 2…)にでき、歌いながら名前(最大 10 文字)を付けられるので、どれがどのテイクか迷いません。ほかの場所で録音したテイクをアップロードすることもできます。ダウンロードは聴いているとおりにレンダリングされます。1 つのトラック、ミックス全体、またはすべてのトラックの ZIP を、エフェクトあり・なしで選べます。

16 言語の同期歌詞

処理の前に「同期歌詞」をオンにするか、あとからスタジオ内で追加できます — その場合は分離したボーカルだけを読み直し、曲を再処理することはありません。歌詞は分離した声から書き起こされ、1 語ずつ音楽にタイミングが合わせられるので、カラオケ画面では歌われるそばから歌詞が光ります。

単語単位のタイミングは 16 言語に対応しています。それ以外の言語の曲でも歌詞は表示され、行単位でタイミングが合わせられます。アラビア語やペルシア語のような右から左に書く文字も、正しい順序で表示されます。

  • 単語単位のタイミング:アラビア語、中国語、オランダ語、英語、フィンランド語、フランス語、ドイツ語、ギリシャ語、ハンガリー語、イタリア語、日本語、ペルシア語、ポーランド語、ポルトガル語、ロシア語、スペイン語
  • 4 つの画面スタイル(スポットライト、フロー、カラオケ字幕、リスト)に、フォント、色、グロー、背景を組み合わせられ、テレビ向けの全画面モードもあります
  • どの行の歌詞やタイミングも編集でき、いつでも元の状態に戻せます
  • 歌詞は LRC(行単位または単語単位のタイミング)、SRT、WebVTT、プレーンテキスト、JSON でダウンロードできます

AI ボイスクローン:あなた自身の声で歌う曲

「自分の声でトラックを追加」は、曲のリードボーカルをあなたの声で歌い直します。歌ったり話したりしている自分の声を 10〜30 秒録音またはアップロードし、自分の声であることを確認すると、歌声変換モデルが元のメロディー、タイミング、歌詞を保ったまま、分離したボーカルをあなたの声で歌い直します。新しいトラックは元のトラックの隣に追加されます。自分の声が聴こえるよう元のリードボーカルはミュートされ、M を 1 回タップすれば元に戻して聴き比べられます。

ボイスクローンのエンジンは 2 つあります。速いほうの Seed-VC と、メロディーにとても忠実で約 2 倍の時間がかかる SoulX-Singer です。オクターブ(あなたの声がバンドとキーが合ったままになるよう、オクターブ単位のみ)と拡散ステップ数を選べます — ステップを増やすほど細かくなり、そのぶん時間もかかります。クローンはそれぞれ新しいトラックになり、1 曲につき最大 8 つのボイストラックを作れるので、エンジンを並べて聴き比べられます。

  • どの言語の曲でも使えます:変換で変わるのは声だけで、元の歌手が歌った歌詞はそのまま残ります
  • 4 分の曲で約 30 秒〜1 分
  • ボイスサンプルはあなたのアカウント内で非公開に保管され、あなたのボイストラックの作成にのみ使われ、いつでも削除できます
  • はっきりしたリードボーカルで最もよく機能します。ハーモニーやバックボーカルはぼやけ、歌詞は元の歌より少し柔らかく聞こえます

よくある質問

分離の精度はどのくらいですか?

しっかり制作されたポップス、ロック、ヒップホップなら、インストゥルメンタルはカラオケやライブで使えるほどクリーンです。残響の多い録音、ライブのブートレッグ、ボーカルがシンセで重ねられている曲では、わずかに痕跡が残ることがあります。高音質エンジンと Ultra エンジンは、こうしたアーティファクトを大きく減らします。

アップロードできるファイル形式は?

MP3、WAV、M4A ファイルのほか、YouTube、SoundCloud、Facebook、TikTok のリンクに対応しています。出力ステムは MP3 で、標準エンジンでは 128 kbps、高音質と Ultra では 320 kbps です。

ステムとは何ですか?

ステムとは、ひとまとまりの楽器群を個別の音声ファイルとして書き出したものです。ボーカル、ドラム、ベース、ピアノ、ギター、そしてシンセなど残りすべてを含む「その他」があります。2 ステムモードではボーカルとインストゥルメンタルだけが得られます。

同期歌詞はどの言語に対応していますか?

単語単位のタイミングは 16 言語に対応しています:アラビア語、中国語、オランダ語、英語、フィンランド語、フランス語、ドイツ語、ギリシャ語、ハンガリー語、イタリア語、日本語、ペルシア語、ポーランド語、ポルトガル語、ロシア語、スペイン語。それ以外の言語の曲でも歌詞は行単位でタイミングが合わせられ、歌われている行が光ります。

ボイスクローンはどの言語に対応していますか?

すべての言語に対応しています。歌声のボイスクローンが変えるのは声だけです。メロディー、タイミング、歌詞は元の歌手のものなので、アラビア語、英語、日本語の曲は、同じ言語のままあなたの声で歌い直されます。2 つのエンジンは異なるデータで学習しています — SoulX-Singer は北京語、英語、広東語の歌声から、Seed-VC は多言語の音声エンコーダーを使って学習しています — そのため、ある曲の歌詞が不明瞭になった場合は、もう一方のエンジンを試してください。

ボイスサンプルは非公開ですか?

はい。サンプルは、あなた自身の声であること、または声の持ち主の許可を得ていることを確認した後にのみ、あなたのアカウントに保存されます。あなたのボイストラックの作成にのみ使われ、いつでも差し替えや削除ができます。処理のために GPU に送られたコピーは、その処理とともに削除されます。

テイクは何回録音できますか?

何回でも続けて録音できます。「テイクごとに個別のトラックにする」をオンにすると、テイクはそれぞれ、名前を付けてミックスやダウンロードができる別々のトラックになります。1 曲に入れられるボイストラックは最大 8 つです(テイクとボイスクローンの合計)。このオプションをオフにすると、テイクは 1 つの「あなた」トラックに重ねて録音されます。

結果を商用利用できますか?

分離結果そのものはあなたのものですが、元の録音の著作権はそのまま残ります。自宅でのカラオケ、練習、個人的な研究は問題ありません。リミックスの公開や公の場での演奏には、権利者からのライセンスが必要です。ボイスクローンを作成できるのは、あなた自身の声か、声の持ち主の許可を得た場合に限られます。

曲が長すぎると言われるのはなぜですか?

各エンジンには、プランに応じた 1 回あたりの曲の長さの上限があります。正確な分数は、上の「無料版と Pro の違い」とツール本体に記載されています。この上限は共有の処理待ち列を守り、誰にとっても結果がすばやく届くようにするためのものです。

スマートフォンでも使えますか?

はい。処理は当社のサーバー上で行われるため、ページを開くにはブラウザーだけで十分です。カラオケ画面、録音、ミキサーはすべてタッチ操作に対応し、ダウンロードしたファイルはスマートフォンのファイルアプリに保存されます。

もっと詳しく