News / ข่าว AI / รวมค่าย
รวมค่าย · ข่าว AI

Qwen-Audio-3.1 คือชุดโมเดลเสียงรุ่นใหม่ของทีม Qwen จาก Alibaba…

ภีศเดช เพชรน้อย
ภีศเดช เพชรน้อย
26 ก.ย. 2026 · อ่าน 3 นาที
สรุปสั้น — Qwen-Audio-3.1 คือชุดโมเดลเสียงรุ่นใหม่ของทีม Qwen จาก Alibaba ที่ปล่อยมาทีเดียว 5 ตัว ครอบคลุมตั้งแต่ฟัง พูด คุยสด ไปจนถึงสร้างงา
#Productivity
Qwen-Audio-3.1 คือชุดโมเดลเสียงรุ่นใหม่ของทีม Qwen จาก Alibaba…

ขอไล่ทีละตัวนะครับ ตัวแรก ASR แปลงเสียงพูดเป็นข้อความ เก่งเรื่องหลายภาษาและสำเนียงขึ้น และมีระบบเกลาข้อความในตัว ตัดคำว่า เอ่อ อ่า กับคำพูดซ้ำออกให้ ได้ข้อความที่อ่านรู้เรื่องกว่าเดิม

ตัวที่สอง ASR-Next ขยายจากถอดคำพูดเป็นเข้าใจเสียงทั้งคลิป บอกได้ว่าใครพูดตอนไหน มี timestamp จับอารมณ์ผู้พูด ฟังออกว่ามีเสียงบรรยากาศหรือเสียงเครื่องจักร แล้วตอบคำถามเกี่ยวกับเสียงนั้นได้ ตัวนี้ API ยังไม่เปิด ทีมบอกว่าเร็ว ๆ นี้

ตัวที่สาม TTS แปลงข้อความเป็นเสียง สั่งอารมณ์ ความเร็ว และสไตล์ด้วยประโยคธรรมดาได้ และเอาเสียงคนหนึ่งไปพูดภาษาอื่นได้โดยเสียงยังเหมือนเดิม ตัวนี้มีข่าวดีสำหรับคนไทย เพราะในรายงานเทคนิคของเขาเพิ่มภาษาไทยเข้ามาเป็นหนึ่งใน 16 ภาษาที่รองรับ และในหน้าเดโมก็มีตัวอย่างเสียงไทยให้ฟังด้วย

ตัวที่สี่ TTS-Next ตัวใหม่ที่ผมว่าน่าสนใจที่สุด สร้างเสียงพูด เอฟเฟกต์ และเสียงพื้นหลังออกมาพร้อมกันในรอบเดียว อย่างฉากคนคุยกันในร้านกาแฟที่มีเสียงฝนข้างนอก ไม่ต้องทำแยกทีละชั้นแล้วมาประกอบเอง เหมาะกับหนังสือเสียง พอดแคสต์ เกม และโฆษณา

ตัวสุดท้าย Realtime คุยสดแบบพูดและฟังไปพร้อมกัน เราพูดแทรกได้ตลอดเหมือนคุยโทรศัพท์จริง และถ้ามันจับได้ว่าเราเสียงหงอย ๆ มันจะพูดช้าลงและตอบแบบเห็นใจมากขึ้น รุ่น Realtime Plus รับ context ได้ 262K และเรียกใช้เครื่องมือระหว่างคุยได้

ตอนนี้ใช้ผ่าน API บนแพลตฟอร์มของ Qwen ส่วนคุณภาพเสียงไทยจริง ๆ ยังไม่เห็นใครทดสอบจริงจัง ใครทำงานเสียงภาษาไทยอยู่ ราคาที่ลดลงขนาดนี้คุ้มที่จะลองเทสเทียบกับเจ้าที่ใช้อยู่ครับ

วันที่ 23 ก.ย. ทั้ง Google และ Alibaba ปล่อยโมเดลเสียงใหม่ออกมาวันเดียวกันพอดี ผมว่าเสียงกำลังกลายเป็นหน้าบ้านหลักของ AI ไม่ต่างจากหน้าจอแชท

อยากใช้ AI กับงานจริงเป็นระบบ?

เรียน Claude Method — วิธีคิดและลงมือใช้ Claude/AI กับงานจริง ตั้งแต่วันแรก

ดูคอร์ส →

📍 โพสต้นฉบับบน Facebook: AI กับ Peesamac