Gemini 3.8 Flash TTS คือโมเดลแปลงข้อความเป็นเสียงตัวใหม่ของ…
รอบนี้ออกมาสองตัว ตัว Flash เน้นงานสร้างสรรค์ที่ต้องกำกับละเอียด อย่างเกม หนังสือเสียง พอดแคสต์ ส่วนตัว Flash-Lite เน้นงานปริมาณเยอะแบบประหยัด อย่างพากย์เสียงทีละมาก ๆ หรือ voice agent ที่ต้องตอบแทบจะทันที
ออกแบบเสียงใหม่ได้กว่า 100 ภาษาและสำเนียง หรือถ้าขี้เกียจออกแบบก็มีเสียงสำเร็จรูปให้เลือกกว่า 2,000 เสียง จากเดิมที่มีแค่ 30 เสียง จะโคลนเสียงตัวเองก็ได้ ใช้แค่คลิปเสียงยาว 30 วินาที แต่ต้องอัดคำยินยอมจากเจ้าของเสียงให้ตรงกับเสียงต้นแบบก่อน ระบบถึงจะยอมสร้างให้
ส่วนที่ผมว่าเจ๋งสุดคือการกำกับการแสดงทีละบรรทัด เขียนบทแล้วใส่คำสั่งแบบบทละครได้เลย ว่าบรรทัดนี้กระซิบ บรรทัดนี้ใจเย็นแบบพนักงาน call center ใส่ ‹laughs› ให้หัวเราะ ‹sigh› ให้ถอนหายใจ หรือใส่ |mhm| ให้อีกคนพยักหน้ารับระหว่างฟัง ทำบทสนทนาสองคนจากสคริปต์เดียวได้ และ Google บอกว่าคุมเสียงให้นิ่งได้ยาวเป็นชั่วโมงสำหรับทำพอดแคสต์หรือหนังสือเสียง
เรื่องตัวเลข Google อ้างผลจากเบนช์มาร์กของ Hume AI ได้คะแนนรวม 0.920 ที่หนึ่ง ตามด้วย Flash-Lite 0.914 ที่สอง ทิ้ง Cartesia Sonic 3.6 ที่ 0.840 และ ElevenLabs v3 ที่ 0.706 แต่ถ้าดูตารางเดียวกัน แถว Human-like variation ElevenLabs v3 ยังนำอยู่ที่ 5.00 เทียบกับ Gemini 4.58 และตารางนี้เป็นตารางที่ Google เลือกมาโชว์เองนะครับ
อีกเรื่องที่ชอบคือเสียงทุกคลิปที่สร้างจาก Gemini จะฝังลายน้ำ SynthID ไว้ในเสียง หูคนฟังไม่ออกแต่ตรวจได้ว่าเป็นเสียง AI ช่วยกันเรื่องเสียงปลอมได้ระดับหนึ่ง
ตอนนี้ผมใช้ Gemini TTS รุ่น 2.5 อ่านข้อความภาษาไทยให้ฟังอยู่ทุกวัน เลยอยากลองรุ่นนี้มาก ในประกาศไม่ได้ระบุชื่อภาษาไทยตรง ๆ บอกแค่ว่ารองรับกว่า 100 ภาษา เดี๋ยวลองแล้วมาเล่าให้ฟังครับ
ลองได้แล้วตั้งแต่วันนี้ใน Google AI Studio กับ Gemini API ตัว Flash ใช้ได้ใน Gemini Notebook ส่วน Flash-Lite ใช้ได้ใน Google Vids ฝั่ง Gemini Enterprise จะตามมาเร็ว ๆ นี้
อยากใช้ AI กับงานจริงเป็นระบบ?
เรียน Claude Method — วิธีคิดและลงมือใช้ Claude/AI กับงานจริง ตั้งแต่วันแรก
📍 โพสต้นฉบับบน Facebook: AI กับ Peesamac