DeepSeek เปิด V4-Flash ตัวทางการเป็น public beta แล้วครับ…
แล้วผลที่ออกมาคือตัวเลขแบบนี้ครับ DeepSWE จาก 7.3 ขึ้นเป็น 54.4 Cybergym จาก 38.7 เป็น 76.7 Terminal Bench 2.1 จาก 61.8 เป็น 82.7 AutomationBench จาก 10.8 เป็น 25.1 นี่คือโมเดลตัวเดิม ขนาดเท่าเดิม แค่ฝึกต่อ
ที่แรงกว่านั้นคือมันแซง V4-Pro-Preview ซึ่งเป็นรุ่นพี่ตัวใหญ่กว่า แทบทุกช่อง Terminal Bench 82.7 ต่อ 72.1 DeepSWE 54.4 ต่อ 12.8 แล้วยังแซง GLM-5.2 ในหลายตัว ส่วน Opus-4.8 ยังนำอยู่เกือบทุกช่อง แต่ช่องว่างแคบลงเยอะ อย่าง Agents Last Exam ห่างกันแค่ 25.2 กับ 25.7
ตัวโมเดลรอบนี้รองรับ Responses API แบบเนทีฟ กับปรับให้ทำงานกับ Codex ได้ด้วย ซึ่งเป็นสัญญาณชัดว่าเขาเล็งงาน coding agent เต็มตัว ไม่ใช่แค่แชท
แต่อ่านตัวเลขพวกนี้ต้องมีสติหน่อยนะครับ ทุกช่องมาจาก DeepSeek รันเอง แล้วเชิงอรรถใต้ตารางเขียนไว้เองเลยว่าเทสด้วย DeepSeek Harness ที่ยังไม่ปล่อย กับอีกสองแถวล่างเป็นชุดข้อสอบภายในของบริษัท แปลว่าคนนอกยังทำซ้ำไม่ได้
ถึงอย่างนั้นผมว่าเรื่องที่ควรเก็บไปคิดคือ ถ้าการฝึกเพิ่มหลังบ้านดันคะแนน agent จาก 7 เป็น 54 ได้โดยไม่ต้องเพิ่มขนาดโมเดล คำถามว่าโมเดลไหนเก่งกว่ากันตอนนี้ อาจตอบยากขึ้นเรื่อยๆ เพราะเก่งไม่ได้มาจากใหญ่อีกต่อไป
ใครจะลอง ตัวนี้อัปเดตเฉพาะฝั่ง API ของ Flash นะครับ เว็บกับแอปยังเป็นตัวเดิม
อยากใช้ AI กับงานจริงเป็นระบบ?
เรียน Claude Method — วิธีคิดและลงมือใช้ Claude/AI กับงานจริง ตั้งแต่วันแรก
📍 โพสต้นฉบับบน Facebook: AI กับ Peesamac