News / รีวิว / รวมค่าย
รวมค่าย · รีวิว

WikiSkill คือ paper ใหม่จาก Google Research…

ภีศเดช เพชรน้อย
ภีศเดช เพชรน้อย
2 ก.ย. 2026 · อ่าน 5 นาที
สรุปสั้น — WikiSkill คือ paper ใหม่จาก Google Research ที่ตอบคำถามซึ่งผมเจอกับตัวเองทุกวัน คือทำยังไงให้ AI agent ไม่ลืมบทเรียนที่เคยเจ็บมาแล
#Gemma#Agent#เขียน/เอกสาร#Research#Productivity
WikiSkill คือ paper ใหม่จาก Google Research…

เล่าปัญหาก่อนครับ เวลาเราให้ agent ปรับปรุงคำสั่งของตัวเองไปเรื่อยๆ มันจะลองแก้ แล้ววัดผล ถ้าแก้แล้วแย่ลงก็ถอยกลับเวอร์ชันเดิม ฟังดูดี แต่ปัญหาคือพอถอยกลับ เหตุผลว่าทำไมถึงพัง มันหายไปด้วย รอบหน้ามันก็เลยเดินไปเหยียบกับระเบิดลูกเดิม

วิธีของ WikiSkill คือแยกพื้นที่ทำงานเป็นสามชั้น ชั้นแรกคือ raw เก็บบันทึกการทำงานดิบทุกครั้ง ห้ามแก้ ชั้นสองคือ wiki เป็นฐานความรู้ที่บันทึกว่าเคยพังแบบไหน วิธีไหนเคยได้ผล และเคยเสนอแก้อะไรไปแล้วบ้างที่ถูกปฏิเสธ ชั้นสามคือ skills ซึ่งเป็นคำสั่งที่ใช้งานจริง

หัวใจอยู่ตรงนี้ครับ ชั้น skills ถอยกลับได้ แต่ชั้น wiki ห้ามลบเด็ดขาด ไม่ว่าการแก้ครั้งนั้นจะผ่านหรือไม่ผ่าน บทเรียนจะถูกเก็บไว้เสมอ พูดง่ายๆ คือแยกความเข้าใจออกจากคำสั่งที่กำลังใช้อยู่

ผมไปเปิด Table 1 ในเปเปอร์อ่านเองแล้ว ตัวเลขน่าสนใจมาก Gemini 3.5 Flash คะแนนเฉลี่ยจาก 49.5 ขึ้นเป็น 68.1 ส่วน Qwen 3.6 ขนาด 27B จาก 39.4 ขึ้นเป็น 63.3 และเฉพาะงานคณิตศาสตร์ Gemini ขยับจาก 33.0 ไป 72.6 คือมากกว่าเท่าตัว

แต่ผลที่ผมคิดว่าสำคัญที่สุดคืออันนี้ Qwen ขนาด 9B ที่มี skill ผ่านการพัฒนาแล้ว ได้ 47.4 เปอร์เซ็นต์ ซึ่งชนะ Qwen ขนาด 27B ที่ไม่มี skill ซึ่งได้ 39.4 เปอร์เซ็นต์ แปลว่าคำสั่งที่เขียนดีชดเชยขนาดโมเดลได้จริง

อีกอย่างที่เซอร์ไพรส์คือ skill ที่โมเดลหนึ่งพัฒนาขึ้น เอาไปให้อีกโมเดลใช้แล้วได้ผลดีกว่า skill ที่โมเดลนั้นพัฒนาเอง ในงาน ALFWorld ตัว Qwen 9B ใช้ skill ที่ 27B พัฒนาไว้ ได้ 70.2 เปอร์เซ็นต์ ส่วนใช้ของตัวเองได้ 63.4 เปอร์เซ็นต์ ผู้เขียนสรุปว่าความสามารถในการคิดค้น skill กับความสามารถในการใช้ skill เป็นคนละเรื่องกัน

มีจุดที่ผมอ่านแล้วสะดุด คือระหว่างที่ agent ทำงานจริง เขาห้ามไม่ให้มันอ่าน wiki เลย เพราะผลการทดลองพบว่าถ้าให้อ่านตอนทำงาน คุณภาพ skill กลับแย่ลง wiki เอาไว้ให้ตัวที่ทำหน้าที่เสนอแก้อ่านเท่านั้น

และเขาไม่ได้เชียร์ข้างเดียว ในตารางเดียวกันมีเคสที่วิธีอื่นทำให้แย่ลง เช่น EvoSkill ทำให้ Gemma 4 ขนาด 31B ตกจาก 33.9 เหลือ 29.8 ในงานคณิต แสดงว่าการให้ agent เขียนคำสั่งเองไม่ได้ดีขึ้นเสมอไป ต้องมีด่านวัดผลคอยกรอง

ข้อจำกัดที่ต้องบอกคือ นี่เป็น preprint บน arXiv ยังไม่ผ่าน peer review และในการทดลองเขายัด skill เข้าไปใน prompt ตรงๆ ทั้งชุด ไม่ได้ทดสอบว่าถ้ามีคลัง skill เป็นร้อยตัวแล้ว agent จะเลือกหยิบตัวถูกไหม ซึ่งเขาบอกเองว่าตั้งใจตัดตัวแปรนี้ออก แต่ในการใช้งานจริงมันคือปัญหาใหญ่

ส่วนตัวผมอ่านแล้วรู้สึกว่ามันตรงกับสิ่งที่ผมทำอยู่มาก เพราะผมเก็บบทเรียนที่พลาดไว้เป็นไฟล์แยกต่างหากจากคำสั่งที่ใช้งาน และเวลาแก้อะไรพังก็ถอยแค่คำสั่ง ไม่ถอยบันทึก การได้เห็นว่ามีงานวิจัยวัดผลออกมาเป็นตัวเลขว่าวิธีนี้ได้ผลจริง มันช่วยยืนยันว่าเดินมาถูกทาง

arxiv.org/abs/2608.27454

อยากใช้ AI กับงานจริงเป็นระบบ?

เรียน Claude Method — วิธีคิดและลงมือใช้ Claude/AI กับงานจริง ตั้งแต่วันแรก

ดูคอร์ส →

📍 โพสต้นฉบับบน Facebook: AI กับ Peesamac