Karaoke-Tracks ganz einfach erstellen: Zerlege jeden Song (YouTube, Social-Links oder MP3/WAV) in bis zu 6 Spuren, sing mit synchronisierten Songtexten, nimm deine eigenen Takes auf und hör den Song mit KI-Stimmklonen in deiner eigenen Stimme. Schnelle, hochpräzise Gesangstrennung mit modernster KI.
Der Vocal Remover zerlegt einen fertigen Mix wieder in seine Bestandteile. Gib ihm einen Song von YouTube, SoundCloud, TikTok oder Facebook oder lade eine MP3- oder WAV-Datei hoch, und ein neuronales Netz, das mit Tausenden von Mehrspuraufnahmen trainiert wurde, erkennt, welche Teile des Klangs zur Stimme, zu den Drums, zum Bass, zum Klavier, zur Gitarre und zu den übrigen Instrumenten gehören. Du bekommst jeden Teil als eigene Datei: ein sauberes Instrumental für Karaoke, ein Acapella für einen Remix oder eine reine Drum-Spur zum Üben.
Und bei der Trennung hört es nicht auf. Das Ergebnis öffnet sich in einem Karaoke-Studio: Der Songtext leuchtet Wort für Wort auf, während der Song läuft, du kannst deine eigenen Takes über die Band aufnehmen, und KI-Stimmklonen singt dir den Song mit deiner eigenen Stimme vor. Alles läuft auf den Servern von Mazmazika — die Engines Ultra und Hohe Qualität auf GPUs — deshalb funktioniert es auf dem Handy genauso wie auf dem Laptop, ohne etwas zu installieren.
Live aus den aktuellen Plan-Einstellungen gelesen, damit dieser Abschnitt immer dem entspricht, was das Tool heute durchsetzt.
Tarife und aktuelle Preise ansehen
Verglichen mit einem klassischen „Vocal Cut“ per Phasenauslöschung oder einem Stem-Splitter für den Desktop braucht der Online-Remover keine Installation und keine eigene GPU, die KI-Trennung behält die Hallfahnen und Harmonien, die ein Mittenkanal-Trick löschen würde, und das Ergebnis ist ein komplettes Karaoke-Studio statt eines Ordners voller Dateien.
Das Studio zeigt jede Spur als eigenen Kanal: horizontale Bahnen mit einer Wellenform, auf die du zum Springen klicken kannst, oder klassische vertikale Kanalzüge. Jede Spur hat Drehregler für Lautstärke und Panorama, Stumm und Solo, Stereo-Pegelanzeigen und ihr eigenes Effekt-Rack — Low Cut, 3-Band-EQ, Kompressor, Wärme, Transponieren, Doppler, Flanger, Echo, Hall und Limiter — mit Presets per Fingertipp wie Feinschliff, Warm, Luftig, Halle, Radio und Slapback.
Aufnehmen ist eingebaut: Drück auf Aufnehmen, und nach einem Einzähler von drei Schlägen startet die Band, dann wird deine Stimme sauber über die Spuren aufgenommen. Jeder Take kann zu einer eigenen Spur werden — Take 1, Take 2 und so weiter — und du kannst jeden (bis zu 10 Zeichen) benennen, während du singst, sodass du immer weißt, welcher Take welcher ist. Du kannst auch einen Take hochladen, den du anderswo aufgenommen hast. Downloads rendern genau das, was du hörst: eine Spur, den ganzen Mix oder ein ZIP mit allen Spuren, mit oder ohne Effekte.
Schalte synchronisierte Songtexte vor der Verarbeitung ein oder füge sie später im Studio hinzu — dann wird nur der getrennte Gesang noch einmal gelesen, der Song wird kein zweites Mal verarbeitet. Die Wörter werden aus der isolierten Stimme transkribiert und jedes einzelne wird auf die Musik abgestimmt, sodass der Karaoke-Bildschirm sie aufleuchten lässt, während sie gesungen werden.
Wort-für-Wort-Timing gibt es in 16 Sprachen; Songs in allen anderen Sprachen bekommen ihren Songtext trotzdem, Zeile für Zeile getimt. Schriften, die von rechts nach links laufen, wie Arabisch und Persisch, werden in der richtigen Reihenfolge angezeigt.
„Spur mit deiner Stimme hinzufügen“ singt die Leadstimme des Songs noch einmal mit deiner Stimme. Nimm 10 bis 30 Sekunden auf, in denen du singst oder sprichst, oder lade sie hoch, bestätige, dass es deine eigene Stimme ist, und ein Modell für Singing Voice Conversion singt den getrennten Gesang mit deiner Stimme neu, während Melodie, Timing und Wörter des Originals erhalten bleiben. Die neue Spur erscheint neben dem Original: Die Original-Leadstimme wird stummgeschaltet, damit du dich selbst hörst, und ein Tipp auf M holt sie zum Vergleichen zurück.
Zwei Engines für das Stimmklonen stehen zur Wahl: Seed-VC, die schnellere, und SoulX-Singer, die die Melodie sehr genau hält und etwa doppelt so lange braucht. Du wählst die Oktave (nur ganze Oktaven, damit deine Stimme in der Tonart der Band bleibt) und die Anzahl der Diffusionsschritte — mehr Schritte bringen mehr Details und dauern entsprechend länger. Jeder Klon wird zu einer neuen Spur, bis zu acht Stimmspuren pro Song, sodass du die Engines direkt vergleichen kannst.
Bei gut produziertem Pop, Rock und Hip-Hop ist das Instrumental sauber genug für Karaoke und Live-Einsatz. Sehr hallige Aufnahmen, Live-Mitschnitte und Songs, in denen die Stimme von einem Synthesizer gedoppelt wird, können schwache Reste hinterlassen. Die Engines Hohe Qualität und Ultra verringern diese Artefakte deutlich.
MP3-, WAV- und M4A-Dateien sowie Links von YouTube, SoundCloud, Facebook und TikTok. Die ausgegebenen Spuren sind MP3 mit 128 kbps bei der Standard-Engine und 320 kbps bei Hoher Qualität und Ultra.
Eine Spur (englisch „Stem“) ist eine Gruppe von Instrumenten, die als eigene Audiodatei exportiert wird: Gesang, Drums, Bass, Klavier, Gitarre und „Sonstiges“ für Synthesizer und alles Übrige. Der 2-Spuren-Modus liefert dir nur Stimme und Instrumental.
Wort-für-Wort-Timing in 16 Sprachen: Arabisch, Chinesisch, Niederländisch, Englisch, Finnisch, Französisch, Deutsch, Griechisch, Ungarisch, Italienisch, Japanisch, Persisch, Polnisch, Portugiesisch, Russisch und Spanisch. Songs in jeder anderen Sprache bekommen ihren Songtext trotzdem, Zeile für Zeile getimt, sodass die richtige Zeile aufleuchtet, während sie gesungen wird.
Alle. Stimmklonen beim Gesang ändert nur die Stimme: Melodie, Timing und Wörter stammen von der Originalstimme, sodass ein Song auf Arabisch, Englisch oder Japanisch in derselben Sprache mit deiner Stimme neu gesungen wird. Die beiden Engines haben aus unterschiedlichen Daten gelernt — SoulX-Singer aus Gesang auf Mandarin, Englisch und Kantonesisch, Seed-VC mit einem mehrsprachigen Sprach-Encoder — wenn also die Wörter eines Songs undeutlich herauskommen, probiere die andere Engine.
Ja. Die Stimmprobe wird erst in deinem Konto gespeichert, nachdem du bestätigt hast, dass es deine eigene Stimme ist oder dass du die Erlaubnis der sprechenden Person hast. Sie wird nur für deine Stimmspuren verwendet, und du kannst sie jederzeit ersetzen oder löschen. Die Kopie, die für einen Auftrag an die GPU geschickt wird, wird mit diesem Auftrag gelöscht.
So viele du willst, einen nach dem anderen. Mit eingeschalteter Option „Jede Aufnahme wird zu einer eigenen Spur“ ist jeder Take eine eigene Spur, die du benennen, mischen und herunterladen kannst; ein Song fasst bis zu acht Stimmspuren (Takes und Stimmklone zusammen). Schaltest du die Option aus, addieren sich deine Takes stattdessen auf einer einzigen Spur „Du“.
Die Trennung selbst gehört dir, aber die zugrunde liegende Aufnahme bleibt urheberrechtlich geschützt. Karaoke zu Hause, Üben und privates Lernen sind in Ordnung; für die Veröffentlichung eines Remixes oder einen öffentlichen Auftritt brauchst du eine Lizenz des Rechteinhabers. Ein Stimmklon darf nur von deiner eigenen Stimme oder mit der Erlaubnis der sprechenden Person erstellt werden.
Jede Engine hat eine maximale Songlänge pro Durchlauf, die von deinem Plan abhängt; die genauen Minuten stehen oben unter Gratis vs. Pro und direkt im Tool. Das Limit schützt die gemeinsame Warteschlange, damit die Ergebnisse für alle schnell bleiben.
Ja. Die Verarbeitung findet auf unseren Servern statt, deshalb braucht die Seite nur einen Browser. Der Karaoke-Bildschirm, das Aufnehmen und der Mixer funktionieren alle per Touch, und Downloads landen in der Dateien-App deines Handys.