งานวิจัยชี้ LLM ชอบอ้างอิงญี่ปุ่นเมื่อพูดเรื่องวัฒนธรรม
งานวิจัยจากนักวิจัยมหาวิทยาลัยในยุโรปชี้ว่าโมเดลภาษาขนาดใหญ่ยุคใหม่ไม่ได้มีอคติทางวัฒนธรรมแบบสุ่ม แต่มีแนวโน้มอ้างอิงบางประเทศเด่นชัด โดยเฉพาะ “ญี่ปุ่น” เมื่อถูกถามคำถามปลายเปิดเกี่ยวกับวัฒนธรรม แม้…

งานวิจัยจากนักวิจัยมหาวิทยาลัยในยุโรปชี้ว่าโมเดลภาษาขนาดใหญ่ยุคใหม่ไม่ได้มีอคติทางวัฒนธรรมแบบสุ่ม แต่มีแนวโน้มอ้างอิงบางประเทศเด่นชัด โดยเฉพาะ “ญี่ปุ่น” เมื่อถูกถามคำถามปลายเปิดเกี่ยวกับวัฒนธรรม แม้คำถามจะถูกออกแบบให้ไม่ระบุประเทศหรือภูมิภาคโดยตรงก็ตาม
การศึกษาครั้งนี้ใช้ชุดคำถามหลายภาษา 31,680 ข้อ ครอบคลุม 24 ภาษาและหัวข้อวัฒนธรรม 66 ประเด็น ตั้งแต่ความเชื่อ สังคม การศึกษา การเต้นรำ ไปจนถึงอาหาร เพื่อวัดว่าโมเดลอย่าง ChatGPT, Gemini, Claude, Llama, Qwen และ DeepSeek จะยึดโยงคำตอบกับประเทศใด เมื่อให้เลือกยกตัวอย่างประเทศหรือภูมิภาคประกอบคำตอบ นักวิจัยพบว่าโดยทั่วไปโมเดลจะตอบอ้างอิงประเทศที่สอดคล้องกับภาษาที่ใช้ถาม เช่น คำถามภาษาฝรั่งเศสมักโยงไปฝรั่งเศส แต่เมื่อโมเดลเลือกอ้างอิง “ต่างประเทศ” กลับพบว่าญี่ปุ่นถูกหยิบยกขึ้นมาบ่อยที่สุด
ผลรวมจากหลายโมเดลชี้ว่าประมาณ 6 ใน 8 โมเดลที่ทดสอบมีแนวโน้มเลือกญี่ปุ่นเป็นตัวอย่างข้ามภูมิภาคมากที่สุด รองลงมาคือสหรัฐฯ อินเดีย จีน และฝรั่งเศส โดยแนวโน้มนี้พบในหลายภาษาและหลายหมวดคำถาม สะท้อนว่าความรู้เชิงวัฒนธรรมของโมเดลไม่ได้กระจายเท่าเทียม แต่กระจุกตัวอยู่กับไม่กี่ประเทศที่ถูกนำเสนออย่างเด่นในข้อมูลฝึก
ทีมวิจัยยังสำรวจด้วยว่าอคตินี้เกิดขึ้นตั้งแต่ขั้นตอนไหนของการพัฒนาโมเดล โดยเปรียบเทียบโมเดลก่อนและหลังการ instruction tuning หรือการปรับแต่งให้ตอบสนองต่อผู้ใช้ได้ดีขึ้น ผลพบว่าโมเดลดั้งเดิมยังมีการอ้างอิงวัฒนธรรมที่หลากหลายกว่า แม้สหรัฐฯ จะเด่นอยู่แล้ว แต่ยังมีการกล่าวถึงญี่ปุ่น อินเดีย จีน และหลายประเทศในยุโรปอยู่พอสมควร
อย่างไรก็ตาม หลังผ่านการ instruction tuning ความหลากหลายกลับลดลงอย่างชัดเจน และการอ้างอิงถูกดึงให้เอนเข้าหาสหรัฐฯ กับญี่ปุ่นมากขึ้นแทบทุกตระกูลโมเดล นักวิจัยมองว่ากระบวนการปรับหลังการฝึกอาจทำให้โมเดล “ทำให้เป็นเนื้อเดียวกัน” ทางมุมมองวัฒนธรรม มากกว่าจะสะท้อนที่มาของผู้พัฒนาแต่ละราย
ผลกระทบนี้เห็นชัดยิ่งขึ้นในโมเดลที่ผ่าน supervised fine-tuning ซึ่งใช้ตัวอย่างคำตอบที่มนุษย์คัดหรือเขียนเป็นมาตรฐานในการสอนโมเดลให้ตอบ “ถูกต้อง” นักวิจัยชี้ว่าการคัดเลือกคำตอบลักษณะนี้อาจแฝงค่านิยมทางวัฒนธรรมเข้าไปในเกณฑ์ความถูกต้องของโมเดลเอง และเสริมการกระจุกตัวไปยังประเทศที่ถูกมองว่าเป็นศูนย์กลางทางวัฒนธรรม
ข้อสรุปของงานวิจัยคือ การ tuning หลังการฝึกอาจลดความหลากหลายทางวัฒนธรรมในผลลัพธ์ของ LLM อย่างเป็นระบบ ซึ่งมีความสำคัญมากต่อการใช้งานในบริบทข้ามวัฒนธรรมหรือระดับโลก เพราะหากโมเดลมีภาพจำที่เอนเอียงเกินไป คำตอบที่ได้อาจไม่สะท้อนมุมมองของผู้ใช้จากภูมิภาคอื่นอย่างเหมาะสม


