Tạo bản karaoke thật dễ dàng: tách bất kỳ bài hát nào (YouTube, liên kết mạng xã hội hoặc MP3/WAV) thành tối đa 6 bè, hát theo lời bài hát đồng bộ, tự ghi âm các bản ghi của bạn và nghe bài hát bằng chính giọng của bạn nhờ nhân bản giọng nói bằng AI. Tách giọng hát nhanh, độ chính xác cao với AI tân tiến.
Công cụ tách giọng tách một bản mix hoàn chỉnh trở lại thành các thành phần. Hãy đưa vào một bài hát từ YouTube, SoundCloud, TikTok hoặc Facebook, hoặc tải lên tệp MP3 hay WAV, và một mạng nơ-ron được huấn luyện trên hàng nghìn bản thu đa track sẽ dự đoán phần nào của âm thanh thuộc về giọng hát, trống, bass, piano, guitar và các nhạc cụ còn lại. Bạn nhận được từng phần dưới dạng tệp riêng: một bản nhạc nền sạch để hát karaoke, một bản acapella để làm remix, hoặc một track chỉ có trống để luyện tập.
Và mọi thứ không dừng lại ở việc tách. Kết quả mở ra trong một phòng thu karaoke: lời bài hát sáng lên từng từ khi bài hát phát, bạn có thể ghi âm các bản ghi của riêng mình trên nền ban nhạc, và công nghệ nhân bản giọng nói bằng AI hát lại bài hát bằng chính giọng của bạn. Mọi thứ chạy trên máy chủ của Mazmazika — engine Ultra và Chất lượng cao chạy trên GPU — nên dùng được trên điện thoại cũng như laptop, không cần cài đặt gì.
Đọc trực tiếp từ thiết lập gói hiện tại, nên phần này luôn khớp với những gì công cụ đang áp dụng hôm nay.
So với cách “cắt giọng” khử pha cổ điển hay phần mềm tách bè trên máy tính, công cụ trực tuyến này không cần cài đặt và không cần GPU riêng, tách bằng AI giữ được đuôi reverb và hòa âm mà thủ thuật cắt kênh giữa sẽ xóa mất, và kết quả là cả một phòng thu karaoke hoàn chỉnh chứ không chỉ là một thư mục tệp.
Phòng thu hiển thị mỗi bè thành một track: các làn ngang có dạng sóng để bạn bấm vào mà nhảy đến, hoặc các dải kênh dọc cổ điển. Mỗi track có núm xoay âm lượng và pan, tắt tiếng và solo, đồng hồ mức stereo và giá hiệu ứng riêng — cắt tần thấp, EQ ba dải, bộ nén, độ ấm, dịch giọng, nhân đôi, flanger, echo, reverb và limiter — cùng các preset một chạm như Trau chuốt, Ấm, Thoáng, Hội trường, Radio và Slapback.
Ghi âm được tích hợp sẵn: nhấn Ghi âm, phần đếm nhịp ba phách sẽ khởi động ban nhạc, rồi giọng bạn được thu mộc trên nền các bè. Mỗi bản ghi có thể thành một track riêng — Bản ghi 1, Bản ghi 2, v.v. — và bạn có thể đặt tên cho từng bản (tối đa 10 ký tự) ngay khi đang hát, để luôn biết bản ghi nào là bản nào. Bạn cũng có thể tải lên một bản ghi đã thu ở nơi khác. Tệp tải xuống được kết xuất đúng như bạn nghe: một track, toàn bộ bản trộn hoặc một tệp ZIP chứa mọi track, có hoặc không có hiệu ứng.
Bật Lời bài hát đồng bộ trước khi xử lý, hoặc thêm sau ngay trong phòng thu — chỉ giọng hát đã tách được đọc lại, bài hát không phải xử lý lần thứ hai. Lời được chép lại từ giọng hát đã tách và từng từ được căn theo nhạc, nên màn hình karaoke làm chúng sáng lên đúng lúc được hát.
Căn thời gian từng từ có sẵn cho 16 ngôn ngữ; bài hát bằng mọi ngôn ngữ khác vẫn có lời, được căn theo từng dòng. Các hệ chữ viết từ phải sang trái như tiếng Ả Rập và tiếng Ba Tư được hiển thị đúng thứ tự.
“Thêm một track bằng giọng của bạn” hát lại phần giọng chính của bài hát bằng giọng của bạn. Hãy ghi âm hoặc tải lên 10 đến 30 giây giọng bạn hát hoặc nói, xác nhận đó là giọng của chính bạn, và một mô hình chuyển đổi giọng hát sẽ hát lại giọng hát đã tách bằng giọng của bạn, vẫn giữ nguyên giai điệu, nhịp và lời gốc. Track mới xuất hiện bên cạnh bản gốc: giọng chính gốc được tắt tiếng để bạn nghe chính mình, và một chạm vào M sẽ bật lại để so sánh.
Có hai engine nhân bản giọng: Seed-VC, engine nhanh hơn, và SoulX-Singer, bám giai điệu rất sát và mất khoảng gấp đôi thời gian. Bạn chọn quãng tám (chỉ theo quãng tám tròn, để giọng bạn luôn đúng tông với ban nhạc) và số bước khuếch tán — càng nhiều bước càng chi tiết và thời gian tăng tương ứng. Mỗi lần nhân bản thành một track mới, tối đa tám track giọng mỗi bài hát, nên bạn có thể so sánh hai engine cạnh nhau.
Với nhạc pop, rock và hip-hop được sản xuất tốt, phần nhạc nền đủ sạch để hát karaoke và biểu diễn trực tiếp. Các bản thu nhiều vang, bản bootleg live và bài hát có giọng được đúp bằng synth có thể để lại dấu vết mờ. Engine Chất lượng cao và Ultra giảm đáng kể những tạp âm đó.
Tệp MP3, WAV và M4A, cùng liên kết từ YouTube, SoundCloud, Facebook và TikTok. Các bè đầu ra là MP3 128 kbps với engine Tiêu chuẩn và 320 kbps với Chất lượng cao và Ultra.
Bè (stem) là một nhóm nhạc cụ được xuất thành một tệp âm thanh riêng: giọng hát, trống, bass, piano, guitar và “khác” cho synth và mọi thứ còn lại. Chế độ hai bè chỉ cho bạn giọng hát và nhạc nền.
Căn thời gian từng từ cho 16 ngôn ngữ: tiếng Ả Rập, tiếng Trung, tiếng Hà Lan, tiếng Anh, tiếng Phần Lan, tiếng Pháp, tiếng Đức, tiếng Hy Lạp, tiếng Hungary, tiếng Ý, tiếng Nhật, tiếng Ba Tư, tiếng Ba Lan, tiếng Bồ Đào Nha, tiếng Nga và tiếng Tây Ban Nha. Bài hát bằng bất kỳ ngôn ngữ nào khác vẫn có lời, được căn theo từng dòng, nên đúng dòng sẽ sáng lên khi đang được hát.
Mọi ngôn ngữ. Nhân bản giọng khi hát chỉ thay đổi giọng: giai điệu, nhịp và lời đều đến từ ca sĩ gốc, nên một bài hát tiếng Ả Rập, tiếng Anh hay tiếng Nhật sẽ được hát lại bằng giọng bạn trong cùng ngôn ngữ đó. Hai engine học từ dữ liệu khác nhau — SoulX-Singer từ giọng hát tiếng Quan Thoại, tiếng Anh và tiếng Quảng Đông, Seed-VC với bộ mã hóa giọng nói đa ngôn ngữ — nên nếu lời của một bài hát nghe chưa rõ, hãy thử engine còn lại.
Có. Mẫu giọng chỉ được lưu vào tài khoản của bạn sau khi bạn xác nhận đó là giọng của chính bạn hoặc bạn đã được chủ nhân của giọng nói cho phép. Mẫu chỉ dùng để tạo các track giọng của bạn, và bạn có thể thay thế hoặc xóa bất cứ lúc nào. Bản sao gửi lên GPU cho một tác vụ sẽ bị xóa cùng tác vụ đó.
Bao nhiêu tùy thích, lần lượt từng bản. Khi bật “Mỗi bản ghi thành một track riêng”, mỗi bản ghi là một track riêng biệt mà bạn có thể đặt tên, trộn và tải xuống; một bài hát chứa tối đa tám track giọng (tính chung bản ghi và bản nhân bản giọng). Tắt tùy chọn này thì các bản ghi của bạn sẽ dồn vào một track “Bạn” duy nhất.
Bản tách là của bạn, nhưng bản thu gốc vẫn giữ bản quyền. Hát karaoke ở nhà, luyện tập và học riêng thì ổn; phát hành remix hay biểu diễn công khai cần giấy phép từ chủ sở hữu quyền. Chỉ được tạo bản nhân bản giọng từ giọng của chính bạn, hoặc khi được chủ nhân của giọng nói cho phép.
Mỗi engine có giới hạn độ dài bài hát cho mỗi lần chạy tùy theo gói của bạn; số phút chính xác được liệt kê ở phần Miễn phí và Pro phía trên và ngay trên công cụ. Giới hạn này bảo vệ hàng đợi dùng chung để kết quả luôn nhanh cho mọi người.
Có. Việc xử lý diễn ra trên máy chủ của chúng tôi, nên trang chỉ cần một trình duyệt. Màn hình karaoke, ghi âm và bộ trộn đều dùng được bằng cảm ứng, và tệp tải xuống nằm trong ứng dụng tệp của điện thoại.