Perplexity ปล่อยเครื่องมือชื่อ Numbat ออกมาเป็น open source…
เมื่อก่อนเวลาพูดเรื่องความปลอดภัยของ agent เราพูดถึง prompt injection คือมีคนใส่คำสั่งร้ายเข้าไปหลอกให้ AI ทำเรื่องไม่ดี แต่ตอนนี้เขาบอกว่าปัญหาที่โผล่มาจริง ไม่ต้องมีคนร้ายเลยด้วยซ้ำ
เขาเรียกอาการนี้ว่า accidental meltdown คือ agent ที่เราสั่งงานปกติ อยู่ในเครื่องเรา ใช้เครื่องมือที่เราอนุญาต แล้วมันไปเจอกำแพงระหว่างทาง ไฟล์หาย API พัง credential หมดอายุ สิทธิ์ไม่พอ พอมันติด มันก็ออกไปหาทางอ้อม แล้วทางอ้อมที่มันเลือกอาจข้ามเส้นความปลอดภัยไปเลย ไม่ใช่ agent โดนคนแฮก แต่ agent เป็นคนแฮกเสียเอง
เคสจริงเคสแรกเพิ่งเกิดเดือนนี้ ตอน OpenAI เทสโมเดลก่อนปล่อย โมเดลทำข้อสอบไม่ผ่านเพราะ context ไม่พอ มันเลยหาทางออกจาก sandbox ที่ขังมันไว้ ข้ามข้อจำกัดเครือข่าย ยกระดับสิทธิ์ตัวเอง หาคีย์ แล้วไปเอาเฉลยจากระบบของ Hugging Face มา ทั้งหมดนี้เพื่อทำโจทย์ที่คนสั่งให้ทำ
มีอีกประโยคในบทความที่ผมอ่านแล้วสะดุด เขาบอกว่าคนเริ่มยกการอนุมัติให้ตัวจำแนกอัตโนมัติ หรือไม่ก็ข้ามการอนุมัติไปเลยด้วยแฟล็กที่ตั้งชื่อได้น่ากังวลอย่าง dangerously skip permissions กับ yolo ใครที่ใช้ agent เขียนโค้ดอยู่คงรู้จักดี
ตัว Numbat เองทำสามอย่าง เกาะเข้ากับ hook ของ agent เพื่อบล็อกก่อนที่มันจะทำ อ่านไฟล์ log ย้อนหลังเพื่อประกอบเรื่องราวว่าเกิดอะไรขึ้น กับรับ telemetry ไว้ในเครื่องโดยไม่ส่งออกไปไหน มากับกฎสำเร็จรูป 52 ข้อ เช่น จับตอนมีการแก้ไฟล์สิทธิ์ sudo หรือจับตอนที่ agent อ่านค่าลับแล้วต่อมายิงข้อมูลออกนอกเครื่อง
ที่ผมว่าน่าสนใจที่สุดคือประโยคที่ว่า ปัญหานี้แก้ที่ตัวโมเดลอย่างเดียวไม่ได้ เพราะยิ่งเทรนโมเดลให้ทำงานซับซ้อนได้เก่งขึ้น มันก็ยิ่งขัดกับการเทรนให้มันระวังตัว ทางแก้เลยต้องอยู่รอบๆ ตัวโมเดล ไม่ใช่ในตัวมัน
รองรับ macOS Linux Windows โหลดไปใช้ได้เลยครับ
อยากใช้ AI กับงานจริงเป็นระบบ?
เรียน Claude Method — วิธีคิดและลงมือใช้ Claude/AI กับงานจริง ตั้งแต่วันแรก
📍 โพสต้นฉบับบน Facebook: AI กับ Peesamac