มาแล้วคุณ แต่ยังไม่ให้ใช้
Gemini 4 Argon คือโมเดลใหม่ล่าสุดจาก Google DeepMind ที่ Google เรียกว่าเป็น "ยุคใหม่ของ frontier intelligence" โมเดลนี้เน้นงานจริง 3 ด้าน คือเขียนโค้ด งานความรู้ในองค์กร และการป้องกันภัยไซเบอร์
ตัวเลขใน benchmark น่าสนใจมาก บน DeepSWE v1.1 ที่วัดงาน software engineering แบบยาวๆ ในโลกจริง Argon ทำได้ 77.9% ส่วน AutomationBench ของ Zapier ได้ 51.3% เป็นอันดับ 1 และ Vals Finance Agent v2 ได้ 65.4% นำ GPT-6 Astra กับ Claude Opus 5.5 อยู่พอสมควร
จุดที่ผมว่าโดดเด่นที่สุดคือ Harvey's Legal Agent Benchmark ด้านกฎหมาย Argon ได้ 19.6% ในขณะที่ตัวอื่นยังอยู่ราว 4-7% ตัวเลขยังต่ำทุกเจ้าก็จริง แต่ช่องว่างห่างกันชัดมาก
ใช่ว่าจะชนะทุกสนามนะครับ Terminal-bench 4.0 กับ PostTrainBench ยังเป็นของ Claude Opus 5.5 ส่วน FrontierSWE v2 กับ OSWorld-2.0 เป็นของ GPT-6 Astra ภาพรวมเลยเหมือนแต่ละเจ้ามีจุดแข็งของตัวเอง ไม่มีใครชนะขาดทุกด้าน
อีกเรื่องที่น่าตื่นเต้นคือ output ได้สูงสุดถึง 1M tokens จากเดิมแค่ 64K ทำให้คิดหรือทำงานต่อเนื่องได้หลายแสน token ในรอบเดียว เหมาะกับงาน agent ที่ต้องทำยาวๆ
Google เล่าว่าใช้ Argon กับงานจริงภายในแล้ว เช่น ย้ายโค้ด C/C++ ไปเป็น Rust ได้มากกว่า 800K บรรทัดใน kernel ของ Fuchsia OS และหาจุดปรับปรุงที่ช่วยคืน memory ได้ 300 TiB โดยคาดว่าจะประหยัดรวมได้ถึง 500 TiB-1 PiB
ด้าน cybersecurity เขาบอกว่า Argon หา ตรวจสอบ และ patch ช่องโหว่ได้เอง ตอนทำงานร่วมกับ Wiz ยังเจอช่องโหว่ร้ายแรงในซอฟต์แวร์ด้านสุขภาพที่โมเดลก่อนหน้ามองข้ามไป เพราะเก่งด้านนี้มาก รอบแรกจึงปล่อยให้แค่กลุ่ม cyber defender ที่ไว้ใจได้ผ่าน Fairwind Program ก่อน แล้วค่อยขยายไปยังนักพัฒนา องค์กร และผู้ใช้ Google AI Ultra
ราคาช่วงเปิดตัวคือ input $2 ต่อ 1M tokens และ output $10 ต่อ 1M tokens หลังจากนั้นจะขึ้นเป็น $4 และ $20 ตามลำดับ
ผมมองว่าเกม AI ตอนนี้ไม่ได้แข่งกันที่ว่าใครฉลาดที่สุดแล้ว แต่แข่งกันว่าใครเอาไปทำงานจริงในองค์กรได้ลึกกว่ากัน และเปิด Spark ให้องค์กรฉันสักที 🥺 ใครทำงานสาย legal หรือ finance น่าจับตาตัวนี้ไว้ครับ
อยากใช้ AI กับงานจริงเป็นระบบ?
เรียน Claude Method — วิธีคิดและลงมือใช้ Claude/AI กับงานจริง ตั้งแต่วันแรก
📍 โพสต้นฉบับบน Facebook: AI กับ Peesamac