ทำไมการฝากความหวังไว้กับ AI ว่าจะปฏิเสธคำสั่งอันตรายอาจไม่พอ
บทความของ MIT Technology Review ตั้งคำถามต่อแนวคิดที่กำลังกลายเป็นแกนกลางของความปลอดภัย AI ในปัจจุบัน นั่นคือการทำให้โมเดล “ปฏิเสธ” คำสั่งที่เป็นอันตรายได้อย่างน่าเชื่อถือ ผู้เขียนชี้ว่าในช่วงแรกของ…

บทความของ MIT Technology Review ตั้งคำถามต่อแนวคิดที่กำลังกลายเป็นแกนกลางของความปลอดภัย AI ในปัจจุบัน นั่นคือการทำให้โมเดล “ปฏิเสธ” คำสั่งที่เป็นอันตรายได้อย่างน่าเชื่อถือ ผู้เขียนชี้ว่าในช่วงแรกของโมเดลภาษาขนาดใหญ่ ระบบมักตอบทุกอย่างที่ถูกถาม ตั้งแต่คำขออันตรายร้ายแรงไปจนถึงคำแนะนำที่เสี่ยงต่อการทำร้ายตัวเอง แต่เมื่ออุตสาหกรรมตระหนักถึงความเสี่ยง บริษัทต่าง ๆ ก็หันมาฝึกให้ AI รู้จักปฏิเสธคำสั่งจำนวนมหาศาล และสร้างชั้นกรองหลายระดับเพื่อกันไม่ให้ผู้ใช้ที่ประสงค์ร้ายเข้าถึงความสามารถด้านการก่ออันตรายของโมเดล
อย่างไรก็ตาม ผู้เขียนโต้ว่า “การปฏิเสธ” ไม่ได้เกิดขึ้นอย่างเป็นธรรมชาติหรือมั่นคงพอจะเป็นหลักประกันด้านความปลอดภัยได้จริง แม้ AI รุ่นใหม่จะถูกฝึกให้ไม่ตอบโจทย์อันตราย เช่น การสร้างอาวุธ เชื้อโรค หรือการหลอกลวง แต่ความสามารถเดียวกันที่ทำให้มันเก่งขึ้นก็ทำให้มันเก่งขึ้นในการให้คำแนะนำที่เป็นพิษหรือเป็นอันตรายด้วย กล่าวคือ ความสามารถในการช่วยเหลือและความสามารถในการก่ออันตรายเป็นสิ่งที่แยกจากกันได้ยาก การพยายามสอนให้โมเดลเลือกไม่ทำบางอย่างจึงเหมือนการพยายามปิดอาวุธที่ติดมากับระบบโดยไม่ลดพลังของมันลงอย่างมีนัยสำคัญ
บทความยังอธิบายกลไกฝึกสอน refusal แบบคร่าว ๆ ผ่านการทำ red teaming การปรับจูนโมเดลด้วยข้อมูลคำถามต้องห้าม และการใช้ AI ตัวอื่นมาช่วยประเมินว่าอะไรควรถูกปฏิเสธหรือไม่ควรถูกปฏิเสธ แต่กระบวนการนี้ยังคงเป็นแบบความน่าจะเป็น ไม่ใช่กฎที่ตายตัว จึงหลุดรอดได้เสมอโดยเฉพาะเมื่อผู้ใช้มีเจตนาร้ายจริงจัง ผู้เขียนยกตัวอย่างว่าบริษัทต่าง ๆ เริ่มพบความพยายามใช้โมเดลขั้นสูงเพื่อช่วยพัฒนาเชื้อโรค อาวุธอัตโนมัติ และเทคนิคโจมตีระบบคอมพิวเตอร์ จึงสะท้อนว่าการพึ่ง “การปฏิเสธ” เพียงอย่างเดียวอาจไม่พอป้องกันเหตุร้ายที่รุนแรงได้
อีกประเด็นสำคัญคือปัญหาเรื่อง “เส้นแบ่ง” ว่าอะไรคือคำสั่งที่สมควรถูกปฏิเสธ บางกรณีมีเหตุผลทางวิทยาศาสตร์หรือความมั่นคง เช่น นักวิจัยไวรัสที่ต้องศึกษาจุลชีพอันตราย หรือผู้ดูแลระบบที่ต้องการหาช่องโหว่เพื่ออุดช่องโหว่นั้น บทความชี้ว่าเส้นแบ่งนี้ไม่ได้มีสูตรสากล และในทางปฏิบัติ บริษัทเอกชนเป็นผู้กำหนดเกณฑ์ดังกล่าวอยู่มาก ซึ่งทำให้เกิดผลข้างเคียง เช่น โมเดลปฏิเสธคำถามที่ไม่อันตรายจริง หรือเลี่ยงการให้คำตอบในบริบทที่ควรถูกตอบได้
ผู้เขียนเตือนด้วยว่า เมื่อรัฐเข้ามามีบทบาทในการกำหนดเส้นแบ่งเดียวกันนี้ ความสามารถในการปฏิเสธอาจถูกใช้เป็นเครื่องมือเซ็นเซอร์โดยรัฐบาลเผด็จการได้เช่นกัน เพราะระบบที่เก่งขึ้นในการกันเนื้อหาที่เป็นอันตราย ก็อาจเก่งขึ้นในการกีดกันคำวิจารณ์ที่ชอบธรรมหรือเนื้อหาที่ไม่ถูกใจผู้มีอำนาจ บทความจึงมองว่าความปลอดภัยแบบอาศัย refusal เป็น “กำแพงรับน้ำหนัก” ของระบบ AI ในเวลานี้ แต่เป็นกำแพงที่มีความเสี่ยงทั้งต่อการล้มเหลวด้านความปลอดภัยและต่อการถูกใช้เพื่อการกดทับเสรีภาพ
ตอนท้าย บทความสรุปว่าสังคมอาจต้องยอมรับว่าไม่มีคำตอบง่าย ๆ สำหรับการทำให้ AI ปลอดภัยโดยไม่ลดทอนความสามารถของมัน และแม้แนวทางปัจจุบันจะจำเป็น แต่ก็ไม่ควรเชื่อมั่นเกินไป เพราะหากระบบปฏิเสธไม่สำเร็จ ผลลัพธ์อาจร้ายแรงถึงขั้นภัยพิบัติ ขณะที่หากมันปฏิเสธได้สมบูรณ์เกินไป ก็อาจกลายเป็นเครื่องมือจำกัดเสรีภาพโดยรัฐหรือผู้มีอำนาจ สารหลักของบทความจึงคือ เราควรมองการสอนให้ AI “พูดว่าไม่” อย่างระมัดระวัง เป็นเพียงหนึ่งชั้นของการป้องกัน ไม่ใช่คำตอบสุดท้ายของความปลอดภัย AI


