VoiceStudio คือแอปเดสก์ท็อปโอเพนซอร์สที่โคลนเสียง ออกแบบเสียง…
ผมไปไล่ดูว่าคนว่ากันว่าไง ฝั่งชม มีบทความสอนใช้จาก KDnuggets เรียกขั้นตอนพากย์วิดีโอว่าน่าประทับใจ เพราะใส่วิดีโอหรือลิงก์ YouTube แล้วมันถอดเสียง แปล โคลนเสียงคนพูดเดิม สังเคราะห์เสียงพากย์ แล้วรวมกลับเป็นวิดีโอ ทั้งหมดในเครื่อง ส่วนความเห็นที่เขาคัดมาโชว์บนเว็บเองก็ชมเรื่องข้อมูลไม่ออกนอกเครื่อง แต่ตรงนี้เป็นความเห็นที่ทีมเลือกมาเอง ต้องอ่านด้วยความระวัง
ฝั่งที่ถามต่อ มีรีวิวบน YouTube ชื่อว่า I Tested the Local ElevenLabs Alternative. Here Is the Catch ชี้ว่าคำว่า ไม่ต้องใช้ API key ต้องพูดให้แม่น เพราะการแยกผู้พูดใช้โมเดลที่ต้องมี token และกดยอมรับสัญญาบน Hugging Face และการติดตั้งยังมีด่าน โมเดลโหลดครั้งแรกประมาณ 2.4 GB macOS อาจเตือนว่าแอปเสียหายเพราะยังไม่ได้ลงนาม ผู้ใช้ Windows อาจเจอปัญหา torch compile หรือหน่วยความจำ บทความจีนฉบับหนึ่งบอกว่า Intel Mac รันฝั่งหลังบ้านในเครื่องไม่ได้ ต้องเป็น Apple Silicon
เรื่องสัญญาอนุญาต ตัวแอปเป็น AGPL-3.0 และเสนอใบอนุญาตเชิงพาณิชย์แยกต่างหาก รีวิว YouTube ข้างบนพูดถึงสัญญารุ่นเก่า ตอนนี้ README เป็น AGPL-3.0 แล้ว จุดที่ผมยังไม่ฟันธงคือโมเดลเสียงเริ่มต้น OmniVoice ในหน้าไลบรารีของเขาติดป้าย Non-commercial terms และมีกระทู้ใน Reddit กับบล็อกจีนที่บอกว่าน้ำหนักโมเดลเป็นแบบไม่เชิงพาณิชย์ ขณะที่เว็บของ OmniVoice เองอ้างว่าเป็น Apache 2.0 ข้อมูลขัดกัน ถ้าจะใช้ทำงานรับจ้างหรือขายต้องอ่านเงื่อนไขของโมเดลก่อน
ภาษาไทย ในหน้าไลบรารีกรองภาษาไทยแล้วขึ้น 3 โมเดล คือ OmniVoice, VoxCPM2 และ Confucius4-TTS ผมยังไม่ได้ฟังคุณภาพเสียงไทยเอง และเห็นว่ามีคนทำโมเดล OmniVoice ที่ปรับด้วยข้อมูลไทยแยกไว้บน Hugging Face ซึ่งอาจบอกว่าโมเดลฐานยังมีที่ให้ปรับ แต่นั่นเป็นข้อสังเกตของผม ไม่ใช่ข้อสรุป
เจ้าของโครงการเขียนเงื่อนไขชัดว่าโคลนเสียงได้เฉพาะเสียงที่ได้รับอนุญาตเท่านั้น
ผมก็เห็นว่าคุ้มลองถ้ากำลังหาเครื่องมือพากย์หรือทำเสียงที่เก็บข้อมูลในเครื่อง แต่ควรลองกับงานส่วนตัวก่อน แล้วค่อยตัดสินเรื่องสัญญาถ้าจะเอาไปทำเงิน
ที่มา: GitHub ของโครงการ หน้าเว็บทางการ KDnuggets และรีวิวที่กล่าวถึง
อยากใช้ AI กับงานจริงเป็นระบบ?
เรียน Claude Method — วิธีคิดและลงมือใช้ Claude/AI กับงานจริง ตั้งแต่วันแรก
📍 โพสต้นฉบับบน Facebook: AI กับ Peesamac