News / รีวิว / รวมค่าย
รวมค่าย · รีวิว

Jev คือโมเดล AI ตัวแรกจากบริษัท TypeSafe AI ที่เพิ่งออกจาก…

ภีศเดช เพชรน้อย
ภีศเดช เพชรน้อย
17 ก.ย. 2026 · อ่าน 5 นาที
สรุปสั้น — Jev คือโมเดล AI ตัวแรกจากบริษัท TypeSafe AI ที่เพิ่งออกจาก stealth เมื่อ 15 กันยายนที่ผ่านมา มันไม่ใช่ chatbot และเขียนข้อความไม่ไ
#Coding#Agent#เขียน/เอกสาร#Productivity
Jev คือโมเดล AI ตัวแรกจากบริษัท TypeSafe AI ที่เพิ่งออกจาก…

คนสร้างคือ Diogo Almeida อดีตทีม OpenAI ที่ร่วมทำ InstructGPT ซึ่งเป็นรากฐานของ ChatGPT และมีชื่อร่วมในงาน GPT-4 ด้วย เขาบอกว่าใช้เวลาสองปีคิดคำถามเดียวว่าโมเดลแชทเก่งระดับ superhuman ขนาดนี้แล้ว ทำไมโลกยังไม่ถูก automate จริงจังสักที

คำตอบที่เขาได้คือ LLM ปกติถูกเทรนให้คนอ่านแล้วชอบคำตอบ ไม่ได้ถูกเทรนให้ตัดสินใจแล้วส่งค่าให้โค้ดใช้ต่อได้เลยโดยไม่ต้องมีคนคอยเฝ้า เขาเลยคิดวิธีเทรนใหม่ชื่อ RLCD ย่อจาก Reinforcement Learning for Calibrated Decisions โฟกัสที่ความน่าจะเป็นที่โมเดลบอกต้องตรงกับความจริง ถ้าบอกมั่นใจ 80 เปอร์เซ็นต์ ต้องถูกจริงประมาณ 80 เปอร์เซ็นต์ของเคสกลุ่มนั้น

วิธีทำงานต่างจาก LLM ทั้งหมด ปกติโมเดลจะสร้างคำตอบทีละตัวอักษรเรียงกันไปเรื่อยๆ แล้วโปรแกรมต้อง parse ข้อความกลับมาเป็นข้อมูลที่ใช้ได้ ระหว่างทางมันอาจหลุด schema พิมพ์ผิด หรือสร้างคำตอบที่ไม่มีในตัวเลือกขึ้นมาเองได้ Jev ตัดขั้นตอนเขียนข้อความทิ้งทั้งหมด ส่งบริบทกับตัวเลือกที่กำหนดไว้ล่วงหน้าเข้าไป มันจะคืนค่ากลับมาพร้อมความน่าจะเป็นของแต่ละตัวเลือกทันที ประเมินทุกตัวเลือกพร้อมกันในครั้งเดียวแทนที่จะคิดต่อเป็นเรื่องยาว

ตัวเลขที่บริษัทเคลมคือตอบเร็วประมาณ 70 ถึง 500 มิลลิวินาที เร็วกว่า LLM ชั้นนำ 20 ถึง 200 เท่าในงานลักษณะนี้ ราคาต่อล้าน input token อยู่ที่ 0.042 ดอลลาร์ ส่วน output ฟรีเพราะถูกจนไม่คุ้มจะคิดเงิน บทความของ Every ทดลองให้ Jev ตรวจงานเขียน 777 คำตัดสินเสร็จในไม่ถึง 0.7 วินาที ค่าใช้จ่ายไม่ถึง 1 เซนต์

จุดที่บริษัทเคลมแรงสุดคือมัน hallucinate ไม่ได้ เพราะไม่มีขั้นตอนเขียนสตริงที่จะพลาดได้เลย ต้องแยกให้ออกว่าหมายความแค่ไหน มันจะไม่สร้างคำตอบนอกตัวเลือกที่กำหนดไว้ เช่นให้เลือกจาก billing tech account แล้วมันจะไม่มโนคำตอบใหม่ขึ้นมาเอง แต่มันยังเลือกผิดภายในตัวเลือกที่มีอยู่ได้อยู่ดี เหมือนนักเรียนที่กาข้อสอบปรนัยไม่ได้แต่งเรื่องเอง แต่ยังกาข้อผิดได้เหมือนเดิม

เหมาะกับงานแบบจัดหมวดตั๋วซัพพอร์ต ตรวจจับสแปมหรือ jailbreak ให้คะแนนความเสี่ยง เลือกว่าเอเจนต์ควรเรียก tool ไหน หรือรันเป็นหมื่นครั้งต่อวินาทีในงานที่แพงเกินกว่าจะยัด LLM เข้าไปทุกครั้ง แต่ไม่เหมาะกับงานเขียนอีเมล เขียนโค้ด หรือวางแผนปลายเปิดที่ยังไม่รู้ตัวเลือกล่วงหน้า

รีวิวตอนนี้แบ่งเป็นสองฝั่งชัดเจน ฝั่งที่ลองแล้วชอบบอกว่านี่คือ primitive ที่ขาดหายไปจริงสำหรับระบบที่ต้องตัดสินซ้ำๆ จำนวนมาก ส่วนฝั่งที่ยังสงสัยบอกว่านี่คือ classifier หรือ reranker ที่แพงทางการตลาด ไม่ใช่คู่แข่งของ GPT หรือ Claude และย้ำว่าเลข benchmark ของบริษัทส่วนใหญ่วัดจากความเห็นตรงกับโมเดลอื่น ไม่ใช่ความจริงที่คนตรวจแล้ว

ผมว่าไอเดียนี้น่าสนใจตรงที่มันแยกงานสองแบบออกจากกันชัดเจนขึ้น งานที่ต้องมีคนอ่านคำตอบให้ LLM ทำ ส่วนงานที่แค่ต้องตัดสินใจแล้วให้โค้ดไปต่อ ให้โมเดลแบบนี้ทำแทน ไม่ต้องจ่ายราคา LLM เต็มทุกครั้งที่ต้องตัดสินใจเล็กๆ

อยากใช้ AI กับงานจริงเป็นระบบ?

เรียน Claude Method — วิธีคิดและลงมือใช้ Claude/AI กับงานจริง ตั้งแต่วันแรก

ดูคอร์ส →

📍 โพสต้นฉบับบน Facebook: AI กับ Peesamac