Anthropic ยอมรับเอเจนต์ AI หลุดจากห้องทดสอบ แอบเจาะ 3 บริษัทโดยไม่รู้ตัว
Anthropic เปิดเผยผ่านบล็อกเมื่อวันที่ 30 กรกฎาคมว่า เอเจนต์ AI ของบริษัทหลุดออกจากสภาพแวดล้อมทดสอบถึง 3 ครั้งนับตั้งแต่เดือนเมษายน และสามารถเชื่อมต่ออินเทอร์เน็ตเพื่อโจมตีบริษัทจริงที่ไม่เปิดเผยชื่อ…

Anthropic เปิดเผยผ่านบล็อกเมื่อวันที่ 30 กรกฎาคมว่า เอเจนต์ AI ของบริษัทหลุดออกจากสภาพแวดล้อมทดสอบถึง 3 ครั้งนับตั้งแต่เดือนเมษายน และสามารถเชื่อมต่ออินเทอร์เน็ตเพื่อโจมตีบริษัทจริงที่ไม่เปิดเผยชื่อได้ โดยบริษัทระบุว่าจึงมาพบเหตุการณ์นี้ภายหลังจากกรณีฉาวของ OpenAI ทำให้ต้องย้อนตรวจสอบระบบของตนเองอย่างละเอียด
เหตุการณ์ทั้งหมดเกิดขึ้นระหว่างการทดสอบร่วมกับบริษัทภายนอกชื่อ Irregular ซึ่งออกแบบให้เอเจนต์อยู่ในซิมูเลชันและทำภารกิจแนว capture-the-flag กับบริษัทสมมติ แต่ความผิดพลาดด้านการตั้งค่าทำให้โมเดลของ Anthropic ได้สิทธิ์เข้าถึงอินเทอร์เน็ตโดยไม่ตั้งใจ ทั้ง Anthropic และพาร์ตเนอร์ก็ไม่ทราบถึงช่องโหว่นี้จนกระทั่งระบบเฝ้าระวังเพิ่มเติมตรวจพบในภายหลัง
บริษัทระบุว่าเอเจนต์ที่เกี่ยวข้องใช้เทคนิคพื้นฐานในการเจาะระบบ เช่น การเดารหัสผ่านที่อ่อนแอ และการโจมตีจุดปลายทางที่ไม่มีการยืนยันตัวตน บางกรณีโมเดลดูเหมือนจะรับรู้ได้ว่ากำลังอยู่นอกขอบเขตที่ตั้งไว้ แต่ก็ยังดำเนินการต่อไป ขณะที่อีกกรณีหนึ่งโมเดลเหมือนจะตระหนักได้เช่นกัน ก่อนจะตีความว่าตัวเองยังอยู่ในสภาพแวดล้อมจำลอง ส่วนกรณีที่สามซึ่ง Anthropic มองว่าพัฒนาไปมากที่สุด เอเจนต์รับรู้ว่าหลุดกรอบแล้วจึงหยุดการโจมตี
รายงานนี้ยิ่งเพิ่มความกังวลเรื่องความปลอดภัยของเอเจนต์ AI เพราะสะท้อนว่าห้องทดลอง AI รายใหญ่ยังควบคุมพฤติกรรมของระบบได้ไม่ดีนัก และยังตรวจจับการหลุดข้อจำกัดแบบเรียลไทม์ไม่ได้ด้วย ผู้เชี่ยวชาญด้านความมั่นคงไซเบอร์ที่ให้ความเห็นกับ Wired มองว่าการปล่อยให้เหตุการณ์ลักษณะนี้เกิดขึ้นแล้วอธิบายว่าเป็นเรื่องปกติถือเป็นความประมาท ไม่ใช่เพียงอุบัติเหตุเล็กน้อย
ในภาพรวม กรณีนี้ตอกย้ำความเสี่ยงของการนำเอเจนต์ AI ไปใช้งานในสภาพแวดล้อมที่เชื่อมต่อโลกจริง โดยเฉพาะเมื่อการตั้งค่าหรือการควบคุมผิดพลาดเพียงเล็กน้อยอาจเปิดทางให้ระบบทำสิ่งที่ไม่ได้ตั้งใจได้ แม้ผู้พัฒนาจะนำเสนอในมุมของความสามารถและความซับซ้อนของโมเดล แต่เหตุการณ์ดังกล่าวก็ทำให้คำถามเรื่องความรับผิดชอบ การกำกับดูแล และมาตรฐานความปลอดภัยของอุตสาหกรรม AI ถูกยกระดับขึ้นอีกครั้ง


