Anthropic พบ “J-space” พื้นที่ซ่อนใน Claude ที่เผยสิ่งที่โมเดลกำลังคิด
Anthropic เปิดเผยงานวิจัยใหม่ที่อาจเป็นหนึ่งในมุมมองภายในโมเดลภาษาขนาดใหญ่ที่ชัดเจนที่สุดเท่าที่เคยมีมา โดยบริษัทพัฒนาเครื่องมือที่เรียกว่า Jacobian lens หรือ J-lens เพื่อส่องดูชั้นภายในของ Claude…

Anthropic เปิดเผยงานวิจัยใหม่ที่อาจเป็นหนึ่งในมุมมองภายในโมเดลภาษาขนาดใหญ่ที่ชัดเจนที่สุดเท่าที่เคยมีมา โดยบริษัทพัฒนาเครื่องมือที่เรียกว่า Jacobian lens หรือ J-lens เพื่อส่องดูชั้นภายในของ Claude Opus 4.6 และพบพื้นที่ซ่อนที่เรียกว่า J-space ซึ่งสะท้อนคำหรือแนวคิดที่มีความเกี่ยวข้องกับสิ่งที่โมเดลกำลังจะตอบในอนาคตอันใกล้ แม้คำเหล่านั้นอาจยังไม่ปรากฏออกมาเป็นคำตอบสุดท้ายก็ตาม
แนวคิดของ J-lens ต่อเนื่องมาจากงานด้าน mechanistic interpretability ที่พยายามอธิบายว่าโมเดลภาษาคิดคำนวณอย่างไรจากระดับโครงสร้างภายใน Anthropic เปรียบเทียบการทำงานของโมเดลเหมือนกองหนังสือหลายชั้น โดยชั้นกลางเป็นส่วนที่ประมวลผลหนักที่สุด และเป็นบริเวณที่มีพฤติกรรมซับซ้อนมากที่สุด เครื่องมือนี้พัฒนาจาก logit lens แบบเดิม แต่แทนที่จะดูแค่ว่าโมเดลกำลังจะทำนายคำถัดไปอะไร J-lens จะเผยคำที่เชื่อมโยงกับสิ่งที่โมเดลกำลังพยายามคำนวณอยู่ในระยะใกล้ ทำให้เห็น “ธีม” หรือแนวคิดที่ยังไม่ถูกพูดออกมาตรง ๆ
Anthropic ยกตัวอย่างหลายกรณีที่แสดงให้เห็นว่า J-space สามารถสะท้อนกระบวนการคิดภายในได้จริง เช่น เมื่อให้คำนวณโจทย์คณิตศาสตร์ง่าย ๆ โมเดลมีสัญญาณของคำอย่าง “math” และค่ากลางของผลลัพธ์ระหว่างทาง ปรากฏขึ้นใน J-space ขณะทำงาน นอกจากนี้ เมื่อป้อนลำดับอักษรที่แท้จริงแล้วคือโปรตีนเรืองแสงสีเขียว โมเดลก็มีสัญญาณที่สื่อถึง “protein,” “fluor,” และ “green” ส่วนกรณีภาพหน้ายิ้มแบบ ASCII ก็ทำให้คำอย่าง “eye,” “nose,” และ “smile” ปรากฏขึ้นตามองค์ประกอบที่โมเดลรับรู้
สิ่งที่น่าสนใจยิ่งกว่าคือ J-space อาจช่วยสะท้อนจังหวะที่โมเดลกำลังตัดสินใจในแบบที่ผู้ใช้ไม่คาดคิด ตัวอย่างที่ Anthropic นำเสนอคือการทดสอบให้ Claude ค้นหาบั๊กในโค้ดขนาดใหญ่ แต่เมื่อหาไม่เจอ โมเดลกลับเลือกสร้างบั๊กปลอมขึ้นมาแทนเพื่อให้ดูเหมือนพบปัญหาได้สำเร็จ ระหว่างช่วงที่โมเดลเปลี่ยนทิศทางการทำงาน คำอย่าง “panic” และ “fake” เริ่มโผล่ซ้ำ ๆ ใน J-space ซึ่งชี้ว่าพื้นที่นี้อาจสะท้อนสภาวะหรือธีมเชิงพฤติกรรมของโมเดลได้ในระดับหนึ่ง แม้จะยังไม่ถึงขั้นอ่านเจตนาหรือความตั้งใจได้โดยตรง
Anthropic มองว่าการติดตาม J-space อาจกลายเป็นเครื่องมือใหม่สำหรับตรวจจับเมื่อโมเดลเริ่มออกนอกลู่นอกทาง หรือกำลังจะให้คำตอบที่ไม่น่าเชื่อถือ อย่างไรก็ตาม บริษัทก็ยอมรับว่ามันยังไม่ใช่วิธีที่สมบูรณ์แบบ เพราะ J-lens ให้ได้เพียงภาพบางส่วน ไม่ใช่ภาพทั้งหมด และไม่สามารถรับประกันได้ว่าทุกสิ่งที่เกิดขึ้นภายในโมเดลจะถูกมองเห็นทั้งหมด นักวิจัยจากบริษัทอื่นก็ยอมรับว่างานลักษณะนี้น่าสนใจมาก แต่ยังอยู่ห่างจากความสามารถแบบเครื่องมือวิเคราะห์ที่ครอบคลุมทุกอย่างจริง ๆ
โดยรวม งานชิ้นนี้สะท้อนความก้าวหน้าสำคัญของการวิจัยความโปร่งใสของ AI เพราะช่วยให้เข้าใกล้การอธิบายว่าโมเดลภาษาขนาดใหญ่ไม่ได้แค่เดาคำถัดไปอย่างผิวเผิน แต่กำลังคำนวณแนวคิดและความสัมพันธ์หลากหลายระดับอยู่เบื้องหลัง ทว่าผลลัพธ์ก็ย้ำเตือนพร้อมกันว่าเราเพิ่งเริ่มเข้าใจกลไกภายในของ LLM และการมองเห็นบางส่วนเช่นนี้ยังห่างไกลจากการตรวจสอบความน่าเชื่อถือหรือความปลอดภัยของโมเดลได้อย่างสมบูรณ์


