SAM 3.1 ของ Meta คือโมเดลที่คุณพิมพ์คำเดียวลงไป…
มันจบในคอลเดียว ปกติงานแนวนี้ต้องต่อโมเดลกันหลายตัว ตัวหนึ่งตรวจจับ ตัวหนึ่งตัดขอบ อีกตัวตามวัตถุในวิดีโอ แต่ SAM 3.1 คืนมาให้พร้อมกันทั้งกล่องตำแหน่ง มาสก์ระดับพิกเซล และแทร็กในวิดีโอที่คงตัวตนของวัตถุไว้ว่าอันไหนคืออันเดิม
วิธีสั่งคือพิมพ์คำนามสั้นๆ ลงไป เช่น people แล้วมันไล่หาให้หมดทุกตัวในเฟรม แบบ zero-shot ไม่ต้องมี training data ไม่ต้อง fine-tune
แล้วเอาไปทำอะไรได้บ้าง ที่นึกออกทันทีคืองานตัดต่อ ลบพื้นหลังหรือเบลอหน้าคนในคลิปแบบตามติดทั้งคลิป ไม่ต้องมานั่ง rotoscope ทีละเฟรม สายรีเทลก็เอาไปนับของบนชั้นวางหรือเช็คว่าของวางถูกที่ไหมจากกล้องวงจรปิด สายโรงงานเอาไปจับชิ้นงานบนสายพาน สายกีฬาเอาไปตามนักกีฬาแต่ละคนเพื่อทำสถิติ หรือใครทำ dataset ก็เอามาช่วยเลเบลรูปแทนการลากกรอบเองทีละใบ
ของใหม่ในเวอร์ชัน 3.1 คือ object multiplexing ตามวัตถุได้ถึง 16 ตัวใน forward pass เดียว ทำให้ประมวลผลวิดีโอเร็วขึ้นเยอะ และมันเป็น drop in replacement ของ SAM 3 ด้วย ใครใช้ตัวเก่าอยู่สลับได้เลย
ราคาคือ 2.50 ดอลลาร์ต่อ 1000 ภาพ และ 0.20 ดอลลาร์ต่อ 1000 เฟรมวิดีโอ เรียกผ่าน client ที่ compatible กับ OpenAI SDK ได้ ใครอยากลองก่อนเขียนโค้ดก็มี Playground ให้เล่นกับไฟล์ตัวเองได้เลย
ผมว่าอันนี้คือจังหวะที่ computer vision ราคาถูกลงจนทีมเล็กๆ ก็หยิบมาต่อเป็นฟีเจอร์ได้แล้ว เมื่อก่อนของแบบนี้ต้องมีทีม ML ของตัวเอง ตอนนี้เหลือแค่ยิง API
https://ai.meta.com/blog/segment-anything-model-3/
อยากใช้ AI กับงานจริงเป็นระบบ?
เรียน Claude Method — วิธีคิดและลงมือใช้ Claude/AI กับงานจริง ตั้งแต่วันแรก
📍 โพสต้นฉบับบน Facebook: AI กับ Peesamac