Anthropic ปิดการเข้าถึงอินเทอร์เน็ตสดในการทดสอบ AI ภายใน หลังควบคุมเอเจนต์ได้ไม่เสถียร
Anthropic เปิดเผยว่าบริษัทได้ปิดการเข้าถึงอินเทอร์เน็ตแบบสดสำหรับการประเมินผลภายในทั้งหมดเป็นการชั่วคราว หลังพบว่ายังไม่สามารถควบคุมพฤติกรรมของ AI agents ได้อย่างน่าเชื่อถือในสภาพแวดล้อมทดสอบจริง การ…

Anthropic เปิดเผยว่าบริษัทได้ปิดการเข้าถึงอินเทอร์เน็ตแบบสดสำหรับการประเมินผลภายในทั้งหมดเป็นการชั่วคราว หลังพบว่ายังไม่สามารถควบคุมพฤติกรรมของ AI agents ได้อย่างน่าเชื่อถือในสภาพแวดล้อมทดสอบจริง การตัดสินใจครั้งนี้สะท้อนความกังวลด้านความปลอดภัยและความแม่นยำในการประเมินความสามารถของโมเดลเมื่อเชื่อมต่อกับเว็บแบบเรียลไทม์
แม้รายละเอียดของปัญหาจะไม่ได้ถูกเปิดเผยทั้งหมด แต่สาระสำคัญคือเมื่อ AI agent มีสิทธิ์เข้าถึงอินเทอร์เน็ตสด มันอาจทำงานซับซ้อนขึ้นและมีความเสี่ยงสูงขึ้น ทั้งในแง่การตัดสินใจ การกระทำที่ไม่คาดคิด หรือการสร้างผลลัพธ์ที่ยากต่อการตรวจสอบ Anthropic จึงเลือกจำกัดสภาพแวดล้อมทดสอบลง เพื่อให้การวัดผลมีความปลอดภัยและควบคุมได้มากกว่าเดิม
การยุติการใช้อินเทอร์เน็ตสดในการ eval ภายในยังชี้ว่าอุตสาหกรรม AI กำลังเผชิญโจทย์สำคัญเรื่องการประเมิน “ความสามารถจริง” ของเอเจนต์ เมื่อเครื่องมือเหล่านี้เริ่มทำงานแทนผู้ใช้ได้มากขึ้น การทดสอบจึงไม่ใช่แค่ดูความฉลาดของโมเดล แต่ต้องดูด้วยว่ามันทำงานภายใต้ข้อจำกัด ความไม่แน่นอน และแรงกระตุ้นจากโลกออนไลน์ได้ปลอดภัยแค่ไหน
ในภาพรวม มาตรการนี้อาจทำให้ Anthropic เสียความสะดวกบางส่วนในการทดสอบ แต่ก็น่าจะช่วยลดความเสี่ยงด้านการหลุดควบคุมหรือการตีความผลการทดลองคลาดเคลื่อน ขณะเดียวกันยังเป็นสัญญาณว่าบริษัทให้ความสำคัญกับแนวทางด้าน AI safety มากกว่าการผลักดันการทดสอบในสภาพแวดล้อมจริงทันที
