ตอนที่ 33 — Paxa Labs
หายไปสามสัปดาห์ กลับมาพร้อมตัวที่ผมอยากเล่ามาสักพักแล้ว
Paxa Labs คือแล็บในกรุงเทพฯ ที่ทำโมเดลเสียงและภาษาสำหรับภาษาไทยโดยเฉพาะ ตัวเรือธงคือ Paxa TTS Flash ที่อ่านไทยปนอังกฤษกลางประโยคได้โดยไม่สะดุด
ปัญหาที่เขาจับคืออันที่คนไทยเจอทุกวันแต่เครื่องมือต่างชาติไม่เคยแก้ให้ เราพิมพ์ว่า เดี๋ยว join meeting แล้วส่ง file ให้ ในประโยคเดียว ภาษาไทยเขียนติดกันไม่เว้นวรรค วรรณยุกต์เปลี่ยนความหมาย แล้วคำว่าตากลมจะอ่านว่าตา-กลม หรือ ตาก-ลม ก็ต้องดูบริบทเอาเอง โมเดลที่เทรนจากภาษาอังกฤษเป็นหลักไม่ได้ถูกออกแบบมารับมือเรื่องพวกนี้
สิ่งที่ผมชอบที่สุดคือรายละเอียดเล็ก ๆ ที่บอกว่าคนทำเป็นคนไทยจริง คือเสียงทั้ง 26 เสียงตั้งชื่อตามขนมกับอาหารไทยหมด เสียงชายหลักชื่อขนมครก เสียงหญิงหลักชื่อนมเย็น ผู้ประกาศข่าวชื่อทองเอก เสียงพระเอกทุ้มลึกชื่อมัสมั่น วิทยุยามดึกชื่อโอเลี้ยง ตัวการ์ตูนชื่อลูกชุบ เสียง ASMR ชื่อสังขยา
แล้วมีสำเนียงถิ่นด้วย ส้มตำกับลาบเป็นอีสาน ข้าวซอยเป็นเหนือ โรตีเป็นใต้ อันนี้เจ้าใหญ่ต่างชาติไม่มีวันทำให้ เพราะตลาดเล็กเกินไปสำหรับเขา แต่สำหรับคอนเทนต์ท้องถิ่นหรือแบรนด์ที่อยากพูดภาษาเดียวกับลูกค้า มันคนละเรื่องเลย
ของอื่นที่มีคือ API แปลภาษา OCR ที่อ่านใบเสร็จใบกำกับภาษีแบบที่ธุรกิจไทยใช้จริง และ Speech-to-Text ที่ยังเป็นพรีวิวงานวิจัย
เมื่อไม่กี่วันก่อนเขาเพิ่งปล่อย MCP ให้ต่อกับ Claude Code หรือ Cursor ได้ตรง ๆ ซึ่งโยโย่ ผู้ร่วมก่อตั้ง เล่าเองว่าใช้ให้ Claude ตะโกนเรียกตอนทำงานเสร็จ จะได้เดินไปทำอย่างอื่นระหว่างรอ ผมเช็คบน npm แล้วมีจริง แต่ยังเป็น beta เวอร์ชัน 0.1.0-beta.9 ปล่อย 5 กันยายน ยอดโหลดสัปดาห์ล่าสุด 1,249 ครั้ง โค้ดบน GitHub เป็น MIT
ราคา เสียงคิด 15 เครดิตต่อ 1,000 ตัวอักษร โดย 1,000 เครดิตเท่ากับ 1 ดอลลาร์ แปลว่าตกล้านตัวอักษรละ 15 ดอลลาร์ แปลภาษา 25 เครดิต OCR 6.5 ต่อหน้า ถอดเสียง 8.33 ต่อนาที สมัครได้ 100 เครดิตฟรีไม่ต้องผูกบัตร คำขอล้มเหลวคืนเครดิตให้เอง จุดที่สาย dev น่าจะชอบคือ endpoint เสียงใช้กับ OpenAI SDK ได้เลยที่ /v1/audio/speech เปลี่ยนแค่ base URL
ทีนี้ส่วนที่ต้องบอกให้ชัด เพราะมีตัวเลขที่เป็นคำอ้างของเขาเอง ไม่ใช่ของที่คนนอกไปวัดมา
บนเว็บมีตารางเทียบราคากับ ElevenLabs, Gemini TTS, Cartesia, MiniMax, iApp, Botnoi แล้วสรุปว่าตัวเองถูกกว่า 2.8 ถึง 48 เท่า อันนั้นเป็นตารางที่ Paxa ทำเอง ผมไม่ได้ไล่เปิดราคาทุกเจ้ามาทานเอง ใครจะย้ายจริงควรเช็คแพ็กเกจฝั่งที่ใช้อยู่อีกที
ส่วนเลขระดับองค์กรที่เขียนว่าได้ยินเสียงแรกใน 50 มิลลิวินาที และเร็วกว่าเวลาจริง 95 เท่า เขากำกับเองตรง ๆ ว่าเป็นผลที่ดีที่สุดจากการทดสอบโหลดของเขาเองบนเครื่องที่กันไว้เฉพาะ ส่วนแพ็กเกจที่สมัครใช้เองใช้ทรัพยากรร่วมกัน อันนี้ซื่อสัตย์ดี และที่โยโย่โพสว่าปล่อยมา 8 วันมีคนสมัครเกิน 250 คน เป็นตัวเลขที่เขาบอกเอง ผมยืนยันจากข้างนอกไม่ได้
ผมก็เห็นว่านี่คือช่องที่คนไทยได้เปรียบจริง เพราะเรื่องอ่านไทยปนอังกฤษ วรรณยุกต์ สำเนียงอีสานเหนือใต้ ไม่ใช่โจทย์ที่บริษัทระดับโลกจะลงแรงแก้ให้ ต้องเป็นคนที่เจอปัญหานี้เองทุกวันถึงจะรู้ว่าต้องแก้ตรงไหน
ลองได้ที่ paxalabs.com สมัครแล้วมี 100 เครดิตฟรีให้เล่นก่อน
อยากใช้ AI กับงานจริงเป็นระบบ?
เรียน Claude Method — วิธีคิดและลงมือใช้ Claude/AI กับงานจริง ตั้งแต่วันแรก
📍 โพสต้นฉบับบน Facebook: AI กับ Peesamac