KI-Vocal-Remover & Stem-Splitter

Mazmazika Song-Vocal-Remover

Karaoke-Tracks ganz einfach erstellen: Zerlege jeden Song (YouTube, Social-Links oder MP3/WAV) in bis zu 6 Spuren, sing mit synchronisierten Songtexten, nimm deine eigenen Takes auf und hör den Song mit KI-Stimmklonen in deiner eigenen Stimme. Schnelle, hochpräzise Gesangstrennung mit modernster KI.

Über den Mazmazika Vocal Remover und das Karaoke-Studio

Der Vocal Remover zerlegt einen fertigen Mix wieder in seine Bestandteile. Gib ihm einen Song von YouTube, SoundCloud, TikTok oder Facebook oder lade eine MP3- oder WAV-Datei hoch, und ein neuronales Netz, das mit Tausenden von Mehrspuraufnahmen trainiert wurde, erkennt, welche Teile des Klangs zur Stimme, zu den Drums, zum Bass, zum Klavier, zur Gitarre und zu den übrigen Instrumenten gehören. Du bekommst jeden Teil als eigene Datei: ein sauberes Instrumental für Karaoke, ein Acapella für einen Remix oder eine reine Drum-Spur zum Üben.

Und bei der Trennung hört es nicht auf. Das Ergebnis öffnet sich in einem Karaoke-Studio: Der Songtext leuchtet Wort für Wort auf, während der Song läuft, du kannst deine eigenen Takes über die Band aufnehmen, und KI-Stimmklonen singt dir den Song mit deiner eigenen Stimme vor. Alles läuft auf den Servern von Mazmazika — die Engines Ultra und Hohe Qualität auf GPUs — deshalb funktioniert es auf dem Handy genauso wie auf dem Laptop, ohne etwas zu installieren.

So funktioniert es

  1. Füge einen Link ein oder lade eine Datei hoch. Das Audio wird auf dem Server abgerufen und dekodiert.
  2. Wähle die Engine und die Anzahl der Spuren. Ultra trennt in 2, 4 oder 6 Spuren (Stimme, Drums, Bass, Klavier, Gitarre und der Rest); Hohe Qualität liefert das sauberste Paar aus Stimme und Instrumental; Standard liefert bis zu fünf Spuren. Ultra und Hohe Qualität liefern MP3 mit 320 kbps.
  3. Schalte synchronisierte Songtexte ein, wenn du die Wörter haben möchtest, und starte dann die Verarbeitung. Ein typischer vierminütiger Song ist mit Ultra in weniger als einer Minute fertig.
  4. Das Studio öffnet sich: Jede Spur hat ihre eigene Lautstärke, ihr eigenes Panorama, Stumm, Solo und Effekte, und der Karaoke-Bildschirm zeigt den Songtext.
  5. Nimm deine Takes auf, füge eine Spur mit deiner Stimme hinzu und lade einzelne Spuren, den ganzen Mix oder alles auf einmal herunter — mit oder ohne Effekte. Ein gespeichertes Projekt öffnet sich wieder genau so, wie du es verlassen hast.

Wofür Musiker es nutzen

  • Karaoke-Abende: Entferne die Leadstimme, behalte die Band in voller Qualität und sing mit dem Text auf dem Bildschirm.
  • Gesangsübung: Nimm einen Take nach dem anderen über das Original auf, vergleiche sie Spur für Spur und behalte den besten.
  • Hör dir mit KI-Stimmklonen an, wie ein Song mit deiner eigenen Stimme klingen würde, bevor du ihn lernst.
  • Acapellas für Remixe, Mashups und DJ-Sets.
  • Übungstracks: Schalte die Spur deines eigenen Instruments stumm und spiele mit dem Rest der Band.
  • Transkription und Studium: Isoliere Bass, Klavier oder Gitarre, um die Stimme klar zu hören.
  • Gesangscoaching: Vergleiche den Take einer Sängerin oder eines Sängers mit dem isolierten Original.

Free vs. Pro

Live aus den aktuellen Plan-Einstellungen gelesen, damit dieser Abschnitt immer dem entspricht, was das Tool heute durchsetzt.

Tarife und aktuelle Preise ansehen

Verglichen mit einem klassischen „Vocal Cut“ per Phasenauslöschung oder einem Stem-Splitter für den Desktop braucht der Online-Remover keine Installation und keine eigene GPU, die KI-Trennung behält die Hallfahnen und Harmonien, die ein Mittenkanal-Trick löschen würde, und das Ergebnis ist ein komplettes Karaoke-Studio statt eines Ordners voller Dateien.

Ein Karaoke-Studio in deinem Browser

Das Studio zeigt jede Spur als eigenen Kanal: horizontale Bahnen mit einer Wellenform, auf die du zum Springen klicken kannst, oder klassische vertikale Kanalzüge. Jede Spur hat Drehregler für Lautstärke und Panorama, Stumm und Solo, Stereo-Pegelanzeigen und ihr eigenes Effekt-Rack — Low Cut, 3-Band-EQ, Kompressor, Wärme, Transponieren, Doppler, Flanger, Echo, Hall und Limiter — mit Presets per Fingertipp wie Feinschliff, Warm, Luftig, Halle, Radio und Slapback.

Aufnehmen ist eingebaut: Drück auf Aufnehmen, und nach einem Einzähler von drei Schlägen startet die Band, dann wird deine Stimme sauber über die Spuren aufgenommen. Jeder Take kann zu einer eigenen Spur werden — Take 1, Take 2 und so weiter — und du kannst jeden (bis zu 10 Zeichen) benennen, während du singst, sodass du immer weißt, welcher Take welcher ist. Du kannst auch einen Take hochladen, den du anderswo aufgenommen hast. Downloads rendern genau das, was du hörst: eine Spur, den ganzen Mix oder ein ZIP mit allen Spuren, mit oder ohne Effekte.

Synchronisierte Songtexte in 16 Sprachen

Schalte synchronisierte Songtexte vor der Verarbeitung ein oder füge sie später im Studio hinzu — dann wird nur der getrennte Gesang noch einmal gelesen, der Song wird kein zweites Mal verarbeitet. Die Wörter werden aus der isolierten Stimme transkribiert und jedes einzelne wird auf die Musik abgestimmt, sodass der Karaoke-Bildschirm sie aufleuchten lässt, während sie gesungen werden.

Wort-für-Wort-Timing gibt es in 16 Sprachen; Songs in allen anderen Sprachen bekommen ihren Songtext trotzdem, Zeile für Zeile getimt. Schriften, die von rechts nach links laufen, wie Arabisch und Persisch, werden in der richtigen Reihenfolge angezeigt.

  • Wort-für-Wort-Timing: Arabisch, Chinesisch, Niederländisch, Englisch, Finnisch, Französisch, Deutsch, Griechisch, Ungarisch, Italienisch, Japanisch, Persisch, Polnisch, Portugiesisch, Russisch und Spanisch
  • Vier Bildschirmstile — Spotlight, Fließend, Karaoke-Leiste und Liste — mit Schriften, Farben, Leuchten und Hintergründen, und ein Vollbildmodus für den Fernseher
  • Bearbeite die Wörter oder das Timing jeder Zeile und kehre jederzeit zum Original zurück
  • Lade den Songtext als LRC (zeilen- oder wortgenau getimt), SRT, WebVTT, reinen Text oder JSON herunter

KI-Stimmklonen: der Song mit deiner eigenen Stimme

„Spur mit deiner Stimme hinzufügen“ singt die Leadstimme des Songs noch einmal mit deiner Stimme. Nimm 10 bis 30 Sekunden auf, in denen du singst oder sprichst, oder lade sie hoch, bestätige, dass es deine eigene Stimme ist, und ein Modell für Singing Voice Conversion singt den getrennten Gesang mit deiner Stimme neu, während Melodie, Timing und Wörter des Originals erhalten bleiben. Die neue Spur erscheint neben dem Original: Die Original-Leadstimme wird stummgeschaltet, damit du dich selbst hörst, und ein Tipp auf M holt sie zum Vergleichen zurück.

Zwei Engines für das Stimmklonen stehen zur Wahl: Seed-VC, die schnellere, und SoulX-Singer, die die Melodie sehr genau hält und etwa doppelt so lange braucht. Du wählst die Oktave (nur ganze Oktaven, damit deine Stimme in der Tonart der Band bleibt) und die Anzahl der Diffusionsschritte — mehr Schritte bringen mehr Details und dauern entsprechend länger. Jeder Klon wird zu einer neuen Spur, bis zu acht Stimmspuren pro Song, sodass du die Engines direkt vergleichen kannst.

  • Songs in jeder Sprache: Die Umwandlung ändert die Stimme und behält die Wörter, die die Originalstimme gesungen hat
  • Etwa eine halbe bis eine Minute für einen vierminütigen Song
  • Deine Stimmprobe bleibt privat in deinem Konto, wird nur für deine Stimmspuren verwendet und kann jederzeit gelöscht werden
  • Funktioniert am besten mit einer klaren Leadstimme; Harmonien und Backing-Vocals verschwimmen, und die Wörter klingen etwas weicher als im Original

Fragen, die Musiker stellen

Wie gut ist die Trennung?

Bei gut produziertem Pop, Rock und Hip-Hop ist das Instrumental sauber genug für Karaoke und Live-Einsatz. Sehr hallige Aufnahmen, Live-Mitschnitte und Songs, in denen die Stimme von einem Synthesizer gedoppelt wird, können schwache Reste hinterlassen. Die Engines Hohe Qualität und Ultra verringern diese Artefakte deutlich.

Welche Dateiformate kann ich hochladen?

MP3-, WAV- und M4A-Dateien sowie Links von YouTube, SoundCloud, Facebook und TikTok. Die ausgegebenen Spuren sind MP3 mit 128 kbps bei der Standard-Engine und 320 kbps bei Hoher Qualität und Ultra.

Was ist eine Spur (Stem)?

Eine Spur (englisch „Stem“) ist eine Gruppe von Instrumenten, die als eigene Audiodatei exportiert wird: Gesang, Drums, Bass, Klavier, Gitarre und „Sonstiges“ für Synthesizer und alles Übrige. Der 2-Spuren-Modus liefert dir nur Stimme und Instrumental.

Welche Sprachen unterstützen die synchronisierten Songtexte?

Wort-für-Wort-Timing in 16 Sprachen: Arabisch, Chinesisch, Niederländisch, Englisch, Finnisch, Französisch, Deutsch, Griechisch, Ungarisch, Italienisch, Japanisch, Persisch, Polnisch, Portugiesisch, Russisch und Spanisch. Songs in jeder anderen Sprache bekommen ihren Songtext trotzdem, Zeile für Zeile getimt, sodass die richtige Zeile aufleuchtet, während sie gesungen wird.

Welche Sprachen unterstützt das Stimmklonen?

Alle. Stimmklonen beim Gesang ändert nur die Stimme: Melodie, Timing und Wörter stammen von der Originalstimme, sodass ein Song auf Arabisch, Englisch oder Japanisch in derselben Sprache mit deiner Stimme neu gesungen wird. Die beiden Engines haben aus unterschiedlichen Daten gelernt — SoulX-Singer aus Gesang auf Mandarin, Englisch und Kantonesisch, Seed-VC mit einem mehrsprachigen Sprach-Encoder — wenn also die Wörter eines Songs undeutlich herauskommen, probiere die andere Engine.

Ist meine Stimmprobe privat?

Ja. Die Stimmprobe wird erst in deinem Konto gespeichert, nachdem du bestätigt hast, dass es deine eigene Stimme ist oder dass du die Erlaubnis der sprechenden Person hast. Sie wird nur für deine Stimmspuren verwendet, und du kannst sie jederzeit ersetzen oder löschen. Die Kopie, die für einen Auftrag an die GPU geschickt wird, wird mit diesem Auftrag gelöscht.

Wie viele Takes kann ich aufnehmen?

So viele du willst, einen nach dem anderen. Mit eingeschalteter Option „Jede Aufnahme wird zu einer eigenen Spur“ ist jeder Take eine eigene Spur, die du benennen, mischen und herunterladen kannst; ein Song fasst bis zu acht Stimmspuren (Takes und Stimmklone zusammen). Schaltest du die Option aus, addieren sich deine Takes stattdessen auf einer einzigen Spur „Du“.

Darf ich das Ergebnis kommerziell nutzen?

Die Trennung selbst gehört dir, aber die zugrunde liegende Aufnahme bleibt urheberrechtlich geschützt. Karaoke zu Hause, Üben und privates Lernen sind in Ordnung; für die Veröffentlichung eines Remixes oder einen öffentlichen Auftritt brauchst du eine Lizenz des Rechteinhabers. Ein Stimmklon darf nur von deiner eigenen Stimme oder mit der Erlaubnis der sprechenden Person erstellt werden.

Warum ist mein Song zu lang?

Jede Engine hat eine maximale Songlänge pro Durchlauf, die von deinem Plan abhängt; die genauen Minuten stehen oben unter Gratis vs. Pro und direkt im Tool. Das Limit schützt die gemeinsame Warteschlange, damit die Ergebnisse für alle schnell bleiben.

Funktioniert es auf dem Handy?

Ja. Die Verarbeitung findet auf unseren Servern statt, deshalb braucht die Seite nur einen Browser. Der Karaoke-Bildschirm, das Aufnehmen und der Mixer funktionieren alle per Touch, und Downloads landen in der Dateien-App deines Handys.

Mehr erfahren