News / How-to / Microsoft
Microsoft · How-to

ThinkingBox คือเบนช์มาร์กใหม่จาก Microsoft ที่ไม่วัดว่า AI agent…

ภีศเดช เพชรน้อย
ภีศเดช เพชรน้อย
11 ก.ย. 2026 · อ่าน 5 นาที
สรุปสั้น — ThinkingBox คือเบนช์มาร์กใหม่จาก Microsoft ที่ไม่วัดว่า AI agent ตอบเก่งแค่ไหน แต่วัดว่ามันทำงานเสร็จจริงหรือเปล่า ลองนึกภาพนี้ คุ
#GPT-5#Coding#Agent#Productivity
ThinkingBox คือเบนช์มาร์กใหม่จาก Microsoft ที่ไม่วัดว่า AI agent…

ลองนึกภาพนี้ คุณบอก agent ว่าช่วยเพิ่มคำขอห้องเงียบให้หน่อย agent ถามเลขจอง เช็คระบบ แล้วตอบกลับมาสวยงามว่าเพิ่มให้เรียบร้อยแล้วครับ อ่านบทสนทนายังไงก็เหมือนงานสำเร็จ แต่พอเปิดฐานข้อมูลจริง ช่อง special_requests ยังว่างเปล่า คุณจะรู้ตอนไปเช็คอินแล้วเจอห้องติดลิฟต์

ปัญหาคือเบนช์มาร์กส่วนใหญ่ให้คะแนนจากคำตอบสุดท้าย หรือจากลำดับการเรียก tool ซึ่งทั้งสองอย่างนี้โกงได้หมด agent พูดว่าทำแล้วก็ได้คะแนน ทีมงานเลยเปลี่ยนเกณฑ์ใหม่ ดูที่ร่องรอยที่มันทิ้งไว้ในระบบหลังบ้าน ถ้าเรคคอร์ดไม่เปลี่ยน คือไม่ผ่าน จบ ไม่ต้องเถียง

วิธีทำคือรัน agent ในสภาพแวดล้อมปิดที่มีสถานะจริง มีฐานข้อมูลจอง มีตั๋วซัพพอร์ต มีผู้ใช้จำลองที่ถือข้อมูลส่วนตัวไว้ ไม่บอกจนกว่าจะถูกถาม พอจบงานก็เอา assertion ภาษา Python ไปตรวจว่าเรคคอร์ดเปลี่ยนถูกไหม แล้วทำลายเซสชันทิ้ง รันใหม่เริ่มจากศูนย์ทุกครั้ง ที่ผมชอบคือมันไม่บังคับเส้นทาง agent จะเรียก tool ลำดับไหนก็ได้ ขอแค่ปลายทางถูกและไม่ไปแตะของที่ไม่เกี่ยว

ชุดข้อสอบมี 507 งาน กระจาย 5 โดเมนธุรกิจ ค้าปลีก ท่องเที่ยว ประกันรถ ไอทีธนาคาร และงาน HR ที่ปรึกษา รันโมเดลละ 20 ครั้งต่องาน แล้ววัดสามตัว pass@1 คือทำถูกในครั้งเดียว pass@20 คือเคยถูกอย่างน้อยหนึ่งใน 20 ครั้ง และ pass^20 คือถูกครบทั้ง 20 ครั้ง

ตัวเลขนี่แหละที่น่าตกใจ GPT-5.4 นำที่ 65.36% pass@1 pass@20 พุ่งไป 91.12% แปลว่าเกือบทุกงานมันหาทางทำสำเร็จได้ถ้าให้โอกาสพอ แต่ pass^20 เหลือแค่ 25.25% คือมีแค่ราวหนึ่งในสี่ของงานที่มันทำถูกซ้ำได้ทุกครั้ง อันดับสองคือ Claude Sonnet 4.6 ที่ 58.45% ซึ่งเด่นตรงคะแนนไม่เหวี่ยงตามโดเมนเท่าตัวอื่น ขณะที่ GPT-5.2 ตกจาก 70.20% ในค้าปลีก เหลือ 22.40% ในประกันรถ

แล้วมันพังตรงไหน ทีมงานไล่ดูร่องรอยที่สอบตกแล้วพบว่า 77.5% คือเรียก tool แล้วเจอ error หรือค้นไม่เจอ แล้วไม่กู้สถานการณ์ต่อ อีก 12.1% คือเรียก tool สำเร็จแต่แก้ผิดรายการผิดค่า มีแค่ 7.9% เท่านั้นที่พังเพราะคำตอบสุดท้าย แปลว่าปัญหาไม่ได้อยู่ที่โมเดลพูดไม่เก่ง แต่อยู่ที่มันอ่านผลลัพธ์ของ tool ไม่ขาด และไม่ยอมเช็คสถานะก่อนประกาศว่าเสร็จ

สิ่งที่ผมได้จากงานนี้คือคำเดียวสั้นๆ ความสามารถกับความน่าเชื่อถือเป็นคนละเรื่อง โมเดลที่เก่งพอจะทำงานคุณได้ ไม่ได้แปลว่าจะทำถูกทุกครั้งที่คุณเผลอ ใครกำลังจะปล่อย agent ไปแตะระบบจริงโดยไม่มีคนดู ลองถามตัวเองก่อนว่าคุณวัดมันด้วย pass@1 หรือ pass^20 เพราะธุรกิจคุณอยู่บนตัวหลัง

โค้ดเปิดหมดที่ microsoft/thinkingbox ส่วนข้อสอบอยู่ที่ microsoft/thinkingbox-data ลองไปเล่นกันได้

อยากใช้ AI กับงานจริงเป็นระบบ?

เรียน Claude Method — วิธีคิดและลงมือใช้ Claude/AI กับงานจริง ตั้งแต่วันแรก

ดูคอร์ส →

📍 โพสต้นฉบับบน Facebook: AI กับ Peesamac