Assistant Benchmark คือเว็บที่เอา AI personal assistant…
ทุกวันนี้มี AI assistant ให้เลือกเป็นร้อยตัว แต่ละเจ้าก็โชว์คลิปตัวเองเก่งไปหมด คนทำเว็บนี้เลยจับมาทดสอบด้วยงานจริงชุดเดียวกันทุกตัวแทน อย่างจองโรงแรมชิคาโก 2 คืนในงบจำกัด จองตั๋วเครื่องบิน ตอบอีเมล สั่งของ โทรหาธุรกิจ
ให้คะแนน 1-10 จากผลที่ทำได้จริงเท่านั้น ถ้ายังไม่ได้ทดสอบมิติไหนก็ไม่ให้คะแนนมิตินั้น ไม่เดาให้
ตอนนี้มีในระบบ 108 ตัว ทดสอบไปแล้ว 21 ตัว จาก 15 มิติ (ความเร็ว งานออนไลน์ ท่องเที่ยว อีเมล ซื้อของ proactive รูทีน เชื่อมแอป สิทธิ์ ความจำ โทรศัพท์ แชทกลุ่ม งานหลายขั้นตอน ความยับยั้งชั่งใจ สร้างภาพ) อัปเดตล่าสุด 15 กันยายนที่ผ่านมา
Muse ของ Meta นำอยู่ที่ 9.1 แต่ทดสอบไปแค่ 7 จาก 15 มิติ ยังไม่ครบ ตามด้วย Instinct 8.4 และ szn 8.0 ที่ทดสอบไปแล้ว 11 มิติทั้งคู่
Muse เพิ่งเปิดตัวเมื่อ 8 กันยายนนี้เอง เป็น personal agent ฟรีของ Meta ที่ทำงานแทนได้จริงไม่ใช่แค่ตอบคำถาม
คนทำคือ David Pawlan ทำงานด้าน growth ที่ Merit Systems เริ่มทดสอบด้วยบัญชีตัวเองตั้งแต่ต้นเดือน แล้วมี Autumn Moulder อดีต SVP Engineering ของ Cohere มาช่วยทดสอบด้วย
จุดที่ผมชอบคือไม่มีสปอนเซอร์ ไม่มี affiliate ทุกคะแนนมีลิงก์ให้ดูบทสนทนาจริงที่ใช้ตัดสิน
ข้อควรระวังคือคะแนนรวมเป็นค่าเฉลี่ยเฉพาะมิติที่ทดสอบแล้ว ตัวที่ยังไม่โดนลองมิติยากอย่าง proactive หรือความจำ อาจดูคะแนนสูงกว่าที่ควรเป็น เป็นโปรเจกต์เพิ่งเริ่ม อันดับน่าจะขยับอีกเยอะเมื่อทดสอบครบมากขึ้น
อยากใช้ AI กับงานจริงเป็นระบบ?
เรียน Claude Method — วิธีคิดและลงมือใช้ Claude/AI กับงานจริง ตั้งแต่วันแรก
📍 โพสต้นฉบับบน Facebook: AI กับ Peesamac