สร้างแทร็กคาราโอเกะได้ง่ายๆ: แยกเพลงใดก็ได้ (YouTube ลิงก์โซเชียล หรือ MP3/WAV) เป็นสเต็มได้สูงสุด 6 สเต็ม ร้องตามพร้อมเนื้อเพลงซิงก์ อัดเทคของคุณเอง และฟังเพลงในเสียงของคุณเองผ่านการโคลนเสียงด้วย AI แยกเสียงร้องได้รวดเร็วและแม่นยำสูงด้วย AI ล้ำสมัย
เครื่องมือแยกเสียงร้องจะแยกเพลงที่มิกซ์เสร็จแล้วกลับออกเป็นส่วนประกอบต่างๆ เพียงส่งเพลงจาก YouTube, SoundCloud, TikTok หรือ Facebook หรืออัปโหลดไฟล์ MP3 หรือ WAV แล้วโครงข่ายประสาทเทียมที่ฝึกจากการบันทึกแบบมัลติแทร็กหลายพันชุดจะคาดการณ์ว่าส่วนใดของเสียงเป็นเสียงร้อง กลอง เบส เปียโน กีตาร์ และเครื่องดนตรีอื่นๆ คุณจะได้แต่ละส่วนเป็นไฟล์แยกกัน: ดนตรีบรรเลงที่สะอาดสำหรับคาราโอเกะ อะแคปเปลลาสำหรับรีมิกซ์ หรือแทร็กกลองล้วนสำหรับซ้อม
และไม่ได้หยุดแค่การแยกเสียง ผลลัพธ์จะเปิดในสตูดิโอคาราโอเกะ: เนื้อเพลงสว่างขึ้นทีละคำขณะเพลงเล่น คุณอัดเทคของตัวเองทับเสียงวงได้ และการโคลนเสียงด้วย AI จะร้องเพลงนั้นกลับมาด้วยเสียงของคุณเอง ทุกอย่างทำงานบนเซิร์ฟเวอร์ของ Mazmazika — เอนจิน อัลตร้า และคุณภาพสูงทำงานบน GPU — จึงใช้งานได้ทั้งบนโทรศัพท์และแล็ปท็อป โดยไม่ต้องติดตั้งอะไรเลย
อ่านสดจากการตั้งค่าแพ็กเกจปัจจุบัน ส่วนนี้จึงตรงกับสิ่งที่เครื่องมือบังคับใช้ในวันนี้เสมอ
เมื่อเทียบกับการ “ตัดเสียงร้อง” แบบหักล้างเฟสดั้งเดิม หรือโปรแกรมแยกสเต็มบนเดสก์ท็อป เครื่องมือออนไลน์นี้ไม่ต้องติดตั้งและไม่ต้องมี GPU ของตัวเอง การแยกด้วย AI ยังคงหางรีเวิร์บและเสียงประสานที่เทคนิคตัดช่องกลางจะลบทิ้งไป และผลลัพธ์ที่ได้คือสตูดิโอคาราโอเกะครบชุด ไม่ใช่แค่โฟลเดอร์ไฟล์
สตูดิโอแสดงทุกสเต็มเป็นแทร็ก: เป็นแถวแนวนอนที่มีรูปคลื่นให้คลิกเพื่อข้ามไป หรือเป็นแชนเนลสตริปแนวตั้งแบบคลาสสิก ทุกแทร็กมีปุ่มหมุนปรับระดับเสียงและแพน ปุ่มปิดเสียงและโซโล มาตรวัดระดับเสียงสเตอริโอ และแร็กเอฟเฟกต์ของตัวเอง — ตัดเสียงต่ำ, EQ สามย่าน, คอมเพรสเซอร์, ความอุ่น, ทรานสโพส, ดับเบิล, แฟลนเจอร์, เอคโค่, รีเวิร์บ และลิมิตเตอร์ — พร้อมพรีเซ็ตแตะครั้งเดียว เช่น เนี้ยบ อบอุ่น โปร่ง ฮอลล์ วิทยุ และสแลปแบ็ก
มีระบบอัดเสียงในตัว: กด อัดเสียง แล้ววงจะเริ่มเล่นหลังนับเข้าสามจังหวะ จากนั้นเสียงของคุณจะถูกอัดแบบสะอาดทับสเต็ม ทุกเทคแยกเป็นแทร็กของตัวเองได้ — เทค 1, เทค 2 ไปเรื่อยๆ — และคุณตั้งชื่อแต่ละเทคได้ (ไม่เกิน 10 ตัวอักษร) ระหว่างที่ร้อง จึงรู้เสมอว่าเทคไหนเป็นเทคไหน คุณยังอัปโหลดเทคที่อัดจากที่อื่นได้ด้วย ไฟล์ดาวน์โหลดเรนเดอร์ตรงตามที่คุณได้ยิน: แทร็กเดียว มิกซ์ทั้งหมด หรือ ZIP รวมทุกแทร็ก จะมีหรือไม่มีเอฟเฟกต์ก็ได้
เปิดเนื้อเพลงซิงก์ก่อนประมวลผล หรือเพิ่มภายหลังจากในสตูดิโอ — ระบบจะอ่านเฉพาะเสียงร้องที่แยกแล้วอีกครั้ง โดยไม่ประมวลผลเพลงเป็นรอบที่สอง คำร้องถอดจากเสียงร้องที่แยกออกมา และแต่ละคำจะจับเวลาให้ตรงกับดนตรี หน้าจอคาราโอเกะจึงทำให้คำสว่างขึ้นตอนที่ถูกร้อง
การจับเวลาทีละคำรองรับ 16 ภาษา ส่วนเพลงในภาษาอื่นๆ ก็ยังได้เนื้อเพลง โดยจับเวลาทีละบรรทัด อักษรที่เขียนจากขวาไปซ้าย เช่น อาหรับและเปอร์เซีย จะแสดงตามลำดับที่ถูกต้อง
“เพิ่มแทร็กด้วยเสียงของคุณ” จะร้องเสียงร้องนำของเพลงใหม่ด้วยเสียงของคุณ อัดหรืออัปโหลดเสียงของคุณขณะร้องหรือพูด 10 ถึง 30 วินาที ยืนยันว่าเป็นเสียงของคุณเอง แล้วโมเดลแปลงเสียงร้องจะร้องเสียงร้องที่แยกแล้วใหม่ด้วยเสียงของคุณ โดยคงทำนอง จังหวะ และคำร้องเดิมไว้ แทร็กใหม่จะมาอยู่ข้างต้นฉบับ: เสียงร้องนำต้นฉบับจะถูกปิดเสียงเพื่อให้คุณได้ยินเสียงตัวเอง และแตะ M ครั้งเดียวก็เปิดกลับมาเปรียบเทียบได้
มีเอนจินโคลนเสียงให้เลือกสองตัว: Seed-VC ที่เร็วกว่า และ SoulX-Singer ที่ตามทำนองเดิมได้แม่นยำมากแต่ใช้เวลาราวสองเท่า คุณเลือกอ็อกเทฟได้ (เฉพาะอ็อกเทฟเต็ม เพื่อให้เสียงของคุณตรงคีย์กับวง) และจำนวนขั้นดิฟฟิวชัน — ยิ่งขั้นมากยิ่งได้รายละเอียดมาก และใช้เวลานานขึ้นตามสัดส่วน การโคลนแต่ละครั้งจะเป็นแทร็กใหม่ สูงสุดแปดแทร็กเสียงต่อเพลง คุณจึงเปรียบเทียบเอนจินทั้งสองได้แบบเคียงข้างกัน
กับเพลงป็อป ร็อก และฮิปฮอปที่โปรดิวซ์มาดี ดนตรีบรรเลงจะสะอาดพอสำหรับคาราโอเกะและการแสดงสด ส่วนการบันทึกที่มีเสียงก้องมาก บูตเลกจากการแสดงสด และเพลงที่เสียงร้องถูกซ้อนด้วยซินธ์อาจเหลือร่องรอยจางๆ เอนจินคุณภาพสูงและ อัลตร้า ช่วยลดสิ่งแปลกปลอมเหล่านั้นได้อย่างเห็นได้ชัด
ไฟล์ MP3, WAV และ M4A รวมถึงลิงก์จาก YouTube, SoundCloud, Facebook และ TikTok สเต็มที่ได้เป็น MP3 ที่ 128 kbps บนเอนจินมาตรฐาน และ 320 kbps บนคุณภาพสูงและ อัลตร้า
สเต็มคือกลุ่มเครื่องดนตรีหนึ่งกลุ่มที่ส่งออกเป็นไฟล์เสียงของตัวเอง: เสียงร้อง กลอง เบส เปียโน กีตาร์ และ “อื่นๆ” สำหรับซินธ์และทุกอย่างที่เหลือ โหมดสองสเต็มจะให้เพียงเสียงร้องและดนตรีบรรเลง
การจับเวลาทีละคำใน 16 ภาษา: อาหรับ จีน ดัตช์ อังกฤษ ฟินแลนด์ ฝรั่งเศส เยอรมัน กรีก ฮังการี อิตาลี ญี่ปุ่น เปอร์เซีย โปแลนด์ โปรตุเกส รัสเซีย และสเปน ส่วนเพลงในภาษาอื่นๆ ก็ยังได้เนื้อเพลง โดยจับเวลาทีละบรรทัด บรรทัดที่ถูกต้องจึงสว่างขึ้นขณะที่กำลังร้อง
ทุกภาษา การโคลนเสียงสำหรับการร้องเพลงจะเปลี่ยนแค่เสียง: ทำนอง จังหวะ และคำร้องมาจากนักร้องต้นฉบับ เพลงภาษาอาหรับ อังกฤษ หรือญี่ปุ่นจึงถูกร้องใหม่ด้วยเสียงของคุณในภาษาเดิม เอนจินทั้งสองเรียนรู้จากข้อมูลต่างกัน — SoulX-Singer เรียนจากการร้องเพลงภาษาจีนกลาง อังกฤษ และกวางตุ้ง ส่วน Seed-VC ใช้ตัวเข้ารหัสเสียงพูดหลายภาษา — หากคำร้องของเพลงใดฟังไม่ชัด ให้ลองอีกเอนจินหนึ่ง
ใช่ ตัวอย่างเสียงจะถูกเก็บในบัญชีของคุณหลังจากที่คุณยืนยันแล้วว่าเป็นเสียงของคุณเอง หรือคุณได้รับอนุญาตจากเจ้าของเสียง ใช้เพื่อสร้างแทร็กเสียงของคุณเท่านั้น และคุณแทนที่หรือลบได้ทุกเมื่อ สำเนาที่ส่งไปยัง GPU สำหรับงานหนึ่งๆ จะถูกลบไปพร้อมกับงานนั้น
ได้มากเท่าที่ต้องการ ทีละเทค เมื่อเปิด “แยกแต่ละเทคเป็นแทร็กของตัวเอง” ทุกเทคจะเป็นแทร็กแยกที่คุณตั้งชื่อ มิกซ์ และดาวน์โหลดได้ เพลงหนึ่งเพลงมีแทร็กเสียงได้สูงสุดแปดแทร็ก (รวมเทคและเสียงโคลน) หากปิดตัวเลือกนี้ เทคของคุณจะรวมกันอยู่ในแทร็ก “คุณ” แทร็กเดียวแทน
ผลการแยกเสียงเป็นของคุณ แต่การบันทึกต้นฉบับยังคงมีลิขสิทธิ์ การร้องคาราโอเกะที่บ้าน การซ้อม และการศึกษาส่วนตัวทำได้ แต่การปล่อยรีมิกซ์หรือแสดงต่อสาธารณะต้องได้รับใบอนุญาตจากเจ้าของสิทธิ์ ส่วนการโคลนเสียงทำได้เฉพาะกับเสียงของคุณเอง หรือเมื่อได้รับอนุญาตจากเจ้าของเสียง
แต่ละเอนจินมีความยาวเพลงต่อครั้งที่ขึ้นอยู่กับแพ็กเกจของคุณ จำนวนนาทีที่แน่นอนแสดงอยู่ในส่วน ฟรี กับ Pro ด้านบนและในตัวเครื่องมือเอง ขีดจำกัดนี้ปกป้องคิวที่ใช้ร่วมกัน เพื่อให้ผลลัพธ์ออกมาเร็วสำหรับทุกคน
ได้ การประมวลผลเกิดขึ้นบนเซิร์ฟเวอร์ของเรา หน้าเว็บจึงต้องการเพียงเบราว์เซอร์ หน้าจอคาราโอเกะ การอัดเสียง และมิกเซอร์ใช้งานด้วยการสัมผัสได้ทั้งหมด และไฟล์ที่ดาวน์โหลดจะอยู่ในแอปไฟล์ของโทรศัพท์