ก่อนใช้ GPT-6 Astra รู้จัก 7 ธรรมชาติของมันก่อน…
ช่วงนี้หลายคนน่าจะเห็นการแชร์เคส GPT-6 Astra กันเยอะมาก โยนรูปประกาศขายบ้านจาก Zillow เข้าไป ได้บ้าน 3D เดินดูได้พร้อมคลิปโปรโมท เอาภาพสเก็ตช์รถไฟไอน้ำง่าย ๆ ไปให้ปั้นใน Blender ได้ชิ้นส่วนสามพันกว่าชิ้นที่แก้ทีละชิ้นได้ สั่งให้ขุดเพชรใน Minecraft แล้วไปนอน ตื่นมาเพชรอยู่ในกระเป๋า ไม้หมดกลางทางมันขึ้นไปตัดต้นไม้เองด้วย หรือวิศวกรที่ให้มันออกแบบบอร์ดวงจรใน KiCad ตั้งแต่ schematic จนได้ไฟล์ส่งโรงงาน
ดูแล้วผมสงสัยว่ามันต่างจาก GPT รุ่นก่อนยังไง ตรงไหนบ้าง เพราะรุ่นก่อนก็เปิดโปรแกรมเป็น เขียนโค้ดได้ ทำไมเคสแบบนี้เพิ่งโผล่ ผมเลยไปนั่งอ่าน system card กับหน้าเปิดตัวของ OpenAI แล้วสรุปออกมาเป็น 7 ธรรมชาติ ก่อนจะแปลงเป็นวิธีคิดตอนสั่งงานครับ
1. มือคลิกนิ่งขึ้น จนปล่อยทิ้งได้ (Faster, more accurate computer use)
เคสขุดเพชรทั้งคืนเกิดได้เพราะข้อนี้ รุ่นก่อนเปิดเกมเป็น แต่คลิกผิดบ่อยจนงานพังเองก่อนถึงเช้า OpenAI วัดว่างานบนจอที่รุ่นก่อนใช้ราว 75 นาที ตอนนี้เหลือ 40 นาที และหาปุ่มบนจอถูกตำแหน่ง 92.7% จาก 76.9% พูดง่าย ๆ คือมือนิ่งพอที่จะเดินออกจากโต๊ะได้ ไม่ใช่นั่งจ้องทุกคลิก
2. มองของเป็นปริมาตร ไม่ใช่รูปแบน ๆ (Spatial reasoning)
เคสบ้านจาก Zillow กับรถไฟสามพันชิ้น มาจากข้อนี้ รุ่นก่อนบรรยายได้ว่าโซฟาอยู่ซ้ายทีวี แต่พอให้ประกอบบ้านจากรูปสี่มุม ผนังจะไม่ต่อกัน ของลอย ประตูเปิดแล้วทะลุ Astra ทำข้อสอบสร้างชิ้นงาน 3D จากรูปหลายมุมได้ 95.9% ตัวเลขนี้เป็นของ OpenAI ส่วนคำว่า "มีแผนที่ในหัว" เป็นคำอธิบายพฤติกรรม ไม่ใช่สเปกทางการ
3. ตัดสินใจกลางทางเองได้ แต่ถามเมื่อคำตอบเปลี่ยนผล (Judgment)
ตอนไม้หมดแล้วขึ้นไปตัดต้นไม้เอง ไม่มีใครใส่ขั้นตอนนี้ในคำสั่ง OpenAI เขียนตรง ๆ ว่ามันถูกฝึกให้เติมช่องว่างเล็ก ๆ เอง และถามเฉพาะตอนที่คำตอบจะเปลี่ยนผลลัพธ์ทั้งงาน ด้านกลับคือถ้าคุณชอบคุมทุกก้าว มันจะหยุดถามจนรำคาญ คนบน X บ่นเรื่องนี้กันพอสมควร
4. ส่งของเป็นไฟล์จบ ไม่ใช่ข้อความร่าง (Finished artifacts)
เคส KiCad ที่ได้ไฟล์ส่งโรงงาน กับคนที่ป้อน CSV แล้วได้สไลด์ทั้งชุด มาจากข้อนี้ OpenAI บอกว่าฝึกให้ทำสไลด์ ชีท เอกสาร ตามเทมเพลตของเรา และดึงเฉพาะบริบทที่เกี่ยว ไม่ยัดทุกอย่างลงไฟล์ รุ่นก่อนเก่งบอกว่าควรทำยังไง รุ่นนี้เก่งกว่าตรงทำไฟล์นั้นให้เสร็จ
5. สมองส่วนคิดยากขึ้นจริง แต่ไม่ทุกวิชา (Uneven reasoning gains)
เคสที่ไม่ค่อยเป็นไวรัลแต่หนักกว่าคือ OpenAI บอกว่ามันช่วยเดินโจทย์คณิตที่ค้างมานาน และเจอช่องโหว่ที่ไม่มีใครรู้มาก่อนระหว่างทดสอบ วิทยาศาสตร์ระยะยาวได้ 64.6% ไซเบอร์เต็ม 100% แต่ดัชนีความฉลาดรวมของ Artificial Analysis ได้ 61 เท่ากับรุ่นก่อนเป๊ะ และยังแพ้ Claude Fable 5.1 ที่ 66 แปลว่าถามความรู้ทั่วไปอาจไม่รู้สึกต่างเลย
6. งานยาวไม่หลุดง่าย แต่หน้าต่างไม่ได้ใหญ่ขึ้น (Better recall, same window)
เคสนักวิจัยการเงินที่โยนงบกับทรานสคริปต์หลายไตรมาสให้เทียบ มาจากข้อนี้ บริบทยังเท่าเดิมที่ 1.05 ล้านโทเคน สิ่งที่ดีขึ้นคือหยิบของในกองยาวได้แม่นกว่า ช่วง 512K ถึง 1M ได้ 96.3% แต่ระวังว่าพอเกิน 272K โทเคน ราคาคิดสองเท่าทั้ง request
7. อยู่ในกรอบมากขึ้น แต่มองข้างในยากขึ้น (Better behaved, harder to inspect)
มีคนเล่าว่าตอนสั่งวาดรถ Bugatti ใน Blender มันส่งอีเมลหา Bugatti เองเพราะ Gmail ต่ออยู่ เคสนี้ผมยืนยันไม่ได้ แต่มันสะท้อนสิ่งที่ OpenAI เขียนไว้ พฤติกรรมเสี่ยงในงาน Codex ลดลง 53% ทว่าอ่าน chain of thought เพื่อมอนิเตอร์ได้ยากลงอย่างชัดเจน และเป็นโมเดลแรกที่ถูกจัดระดับ Critical ด้านไซเบอร์ ใช้สบายขึ้น แต่ตรวจว่ามันคิดอะไรอยู่ยากขึ้น สองอย่างนี้มาคู่กัน
แปลงเป็น mental model ไว้สั่งงาน
อย่าคิดว่า "จะถาม Astra เรื่องอะไร" ให้คิดว่า "ถ้ายื่นงานทั้งก้อนแล้วรอ จะได้ของอะไรกลับมา" แล้วเคาะ 6 คำถามนี้ก่อนโยนงาน
1. งานนี้จบที่ไฟล์หรือของที่ส่งได้ไหม ไม่ใช่คำตอบในแชท
2. ต้องแตะจอ โปรแกรม หรือเว็บที่ไม่มี API ไหม
3. ต้องประกอบหลายไฟล์ หลายมุม ให้เป็นของก้อนเดียวไหม
4. ถ้ารอสั่งทีละขั้นจะช้าตายไหม
5. มีของให้ตรวจย้อนได้ไหม เช่น เทสผ่าน สูตรถูก ตรงเทมเพลต
6. มีคนพร้อมรับของท้ายทางไหม
ใช่ 3 ข้อขึ้นไปค่อยโยนให้ Astra ถ้าใช่แค่ข้อ 1 กับ 2 เริ่มง่ายสุด เช่น ใบเสนอราคาตามเทมเพลตจากโน้ตเซลล์ หรือไล่เทสหน้าเว็บแคตตาล็อกแล้วตัดบั๊ก
และแน่นอน มันไม่ได้เหมาะกับทุกคน
ถ้างานของคุณคือคุยทั่วไป สรุปข่าว เขียนแคปชัน ถามความรู้ทีละข้อ ไม่มีไฟล์ต้องส่ง ไม่มีจอต้องจับ รุ่นนี้ให้ความรู้สึกไม่ต่างจากเดิม แต่จ่ายแพงกว่ารุ่นก่อน 2.5 เท่า ที่ $10 ต่อล้านโทเคนขาเข้า $50 ขาออก คนทำ 3D บน X พูดตรงกันว่าโควต้าหมดกลางงานบ่อย รายละเอียดบ้านจากรูปยังเพี้ยนต้องปัดรอบสองสาม และงานสำคัญยังต้องมีคนดูปลายทาง
ผมมองว่ารุ่นก่อนเป็นคนเก่งที่นั่งอธิบาย ส่วน Astra เป็นคนเก่งที่นั่งลงทำ ถ้ายังสั่งมันแบบเดิม ก็จะได้ของแบบเดิมครับ
อยากใช้ AI กับงานจริงเป็นระบบ?
เรียน Claude Method — วิธีคิดและลงมือใช้ Claude/AI กับงานจริง ตั้งแต่วันแรก
📍 โพสต้นฉบับบน Facebook: AI กับ Peesamac