Google อัปเดต Android Bench เพิ่ม LLM รุ่นใหม่ ทดสอบงานพัฒนาแอป Android
Google ปรับปรุง Android Bench ซึ่งเป็นชุดทดสอบที่ใช้วัดความสามารถของโมเดลภาษาขนาดใหญ่ในการช่วยพัฒนาแอป Android โดยรอบอัปเดตครั้งนี้เพิ่มโมเดลใหม่จำนวนมากลงในลีดเดอร์บอร์ด พร้อมเปลี่ยนไปใช้เฟรมเวิร์ก…

Google ปรับปรุง Android Bench ซึ่งเป็นชุดทดสอบที่ใช้วัดความสามารถของโมเดลภาษาขนาดใหญ่ในการช่วยพัฒนาแอป Android โดยรอบอัปเดตครั้งนี้เพิ่มโมเดลใหม่จำนวนมากลงในลีดเดอร์บอร์ด พร้อมเปลี่ยนไปใช้เฟรมเวิร์กใหม่ที่ใช้งานสะดวกขึ้นและเปิดให้ผู้พัฒนาภายนอกเข้ามาทดสอบร่วมได้มากกว่าเดิม
Android Bench ถูกออกแบบมาเพื่อประเมินว่าเอเจนต์ AI แต่ละตัวทำงานด้านพัฒนา Android ได้ดีแค่ไหนในภารกิจมาตรฐาน 100 งาน เพราะแม้ LLM จะเริ่มถูกใช้เป็นเครื่องมือเขียนโค้ดอย่างแพร่หลาย แต่ประสิทธิภาพจริงยังแตกต่างกันมากในแต่ละงาน และไม่ได้เก่งเท่ากันทุกโมเดล การจัดอันดับนี้จึงช่วยชี้ให้เห็นว่าเครื่องมือใดเหมาะกับงานประเภทใด มากกว่าจะมองว่าโมเดลใด “เก่งที่สุด” แบบเหมารวม
นับตั้งแต่เปิดตัวในเดือนมีนาคม Google ได้เสริมตัวชี้วัดเพิ่มเติมให้ benchmark นี้ ไม่ได้ดูแค่ความถูกต้องของผลลัพธ์ แต่รวมถึงเรื่องต้นทุนและความคุ้มค่าด้านประสิทธิภาพด้วย อีกทั้งยังขยายการรองรับไปยังโมเดลแบบ open-weight เพื่อสะท้อนภาพรวมของตลาด AI coding tools ที่กว้างขึ้นและแข่งขันกันมากขึ้น
การอัปเดตรอบนี้เพิ่มโมเดลสำคัญ 8 ตัวเข้ามาในระบบ ได้แก่ Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus และ Qwen 3.7 Max ซึ่งทำให้ Android Bench มีข้อมูลเปรียบเทียบโมเดลรุ่นใหม่ล่าสุดในงานพัฒนาแอปมากขึ้น และช่วยให้เห็นว่าผู้เล่นรายใหญ่ในตลาดกำลังพัฒนาเครื่องมือด้านโค้ดดิ้ง AI ไปไกลแค่ไหน
แม้ Google จะเป็นผู้พัฒนา benchmark นี้ แต่รายงานยังสะท้อนว่า Gemini ซึ่งเป็นโมเดลของ Google เอง ยังทำผลงานตามหลังคู่แข่งบางรายในงานพัฒนา Android อยู่พอสมควร การอัปเดตครั้งนี้จึงมีนัยสำคัญทั้งในแง่การประเมินศักยภาพของโมเดลต่างค่าย และการผลักดันให้ชุมชนนักพัฒนาเข้ามาร่วมทดสอบ ส่งข้อสังเกต และช่วยกำหนดทิศทางของ Android Bench ในอนาคต


