งานวิจัยใหม่ชี้ บริษัทยังเปิดเผยพฤติกรรมใช้ AI ไม่ครบถ้วน
รายงานจาก MIT Technology Review ชี้ให้เห็นปัญหาใหญ่ของการทำความเข้าใจว่า ผู้คนใช้งาน AI เชิงสนทนากันอย่างไรในโลกจริง เพราะข้อมูลที่บริษัทผู้พัฒนาอย่าง Anthropic และ OpenAI เผยแพร่ออกมานั้นมักสะท้อน…

รายงานจาก MIT Technology Review ชี้ให้เห็นปัญหาใหญ่ของการทำความเข้าใจว่า ผู้คนใช้งาน AI เชิงสนทนากันอย่างไรในโลกจริง เพราะข้อมูลที่บริษัทผู้พัฒนาอย่าง Anthropic และ OpenAI เผยแพร่ออกมานั้นมักสะท้อนเพียงมุมที่บริษัทเลือกนำเสนอ และไม่มีแหล่งข้อมูลอิสระมาช่วยตรวจสอบภาพรวมได้อย่างแท้จริง นักวิจัยจึงเตือนว่า ขณะนี้ทั้งภาควิชาการและผู้กำหนดนโยบายอาจกำลังตัดสินใจบนฐานข้อมูลที่จำกัดกว่าความเป็นจริงมาก
เพื่อลดช่องว่างดังกล่าว ทีมวิจัยจากหลายสถาบันรวมถึง Stanford และ MIT ได้พัฒนาโครงการ AI Observatory ซึ่งเป็นแพลตฟอร์มสาธารณะที่รวบรวมบทสนทนาจริงกับโมเดลยอดนิยม เช่น Claude, Gemini, ChatGPT และ Grok โดยใช้ชุดข้อมูลจากงานวิจัยเดิม 7 ชุดที่เก็บมาจากผู้ใช้ด้วยความยินยอม จุดมุ่งหมายคือสร้างแหล่งข้อมูลอิสระให้ผู้วิจัยและผู้กำหนดนโยบายใช้ประเมินทั้งประโยชน์ ความเสี่ยง และรูปแบบการใช้งาน AI ที่หลากหลายกว่ารายงานของบริษัท
ผลการวิเคราะห์พบว่า การใช้งาน AI แตกต่างกันอย่างชัดเจนตามแพลตฟอร์ม และเปลี่ยนไปตามเวลา อีกทั้งยังมีพฤติกรรมที่ละเอียดอ่อนหรืออาจเป็นปัญหามากกว่าที่รายงานของบริษัทมักสะท้อน โดยเฉพาะรายงานของ Anthropic ที่เน้นการใช้งานเชิงงานและประสิทธิภาพการทำงานเป็นหลัก เมื่อนักวิจัยนำวิธีคัดกรองแบบเดียวกันมาทดลองกับชุดข้อมูลของตน พบว่าเกือบครึ่งของบทสนทนาอาจถูกตัดทิ้ง หากใช้เกณฑ์ที่เน้นงานเป็นหลัก และบทสนทนาที่ถูกคัดออกมีสัดส่วนเรื่องสุขภาพ ความสัมพันธ์ เนื้อหาล่อแหลม การคุกคาม หรือถ้อยคำเกลียดชังมากกว่าอย่างมีนัยสำคัญ
งานวิจัยยังชี้ว่าพฤติกรรมผู้ใช้เปลี่ยนไปในช่วงปี 2023-2025 โดยในชุดข้อมูลอย่าง WildChat บทสนทนามีความยาวและซับซ้อนมากขึ้น มีการโต้ตอบหลายรอบมากขึ้น และมี “small talk” เพิ่มขึ้น ซึ่งตีความได้ว่า การใช้ AI ในบทบาทเพื่อนคุยหรือคู่สนทนากำลังเพิ่มขึ้น ขณะเดียวกัน การที่โมเดลบอกตัวเองว่าเป็นแชตบอตกลับลดลง นอกจากนี้ กลุ่มบทสนทนาที่จัดเป็นการใช้งานอ่อนไหว เช่น การคุกคามทางเพศหรือคำพูดสร้างความเกลียดชัง มีแนวโน้มลดลง ซึ่งอาจสะท้อนว่ามาตรการป้องกันของแพลตฟอร์มเริ่มมีประสิทธิภาพขึ้น
อีกประเด็นสำคัญคือ รูปแบบการใช้งานแตกต่างกันไปตามโมเดลอย่างมาก ตัวอย่างเช่น Grok และ Gemini ถูกใช้ค้นหาข้อมูลบ่อยกว่า โดย Grok เด่นเป็นพิเศษในประเด็นข่าวและการเมือง แต่ก็เป็นจุดที่ข้อมูลผิดพลาดกระจุกตัวมากเช่นกัน ส่วน Anthropic มักถูกใช้เขียนโค้ด, Gemini ถูกใช้กับการคุยเชิงสังคมหรือบทบาทสมมติ, และ ChatGPT มักถูกใช้ช่วยทำการบ้าน นอกจากนี้ แม้แต่คนละเวอร์ชันของโมเดลเดียวกันก็สร้างรูปแบบการใช้งานต่างกัน เช่น ChatGPT ที่ใช้ GPT-4o ทำให้เกิดบทสนทนายาวและต่อเนื่องกว่ารุ่น GPT-3.5
นักวิจัยย้ำด้วยว่า ข้อมูลของ AI Observatory ยังมีข้อจำกัด เพราะอาศัยชุดข้อมูลที่ผู้ใช้ยินยอมแบ่งปัน จึงอาจมองไม่เห็นการใช้งานที่อ่อนไหวหรือไม่อยากเปิดเผยมากพอ และปริมาณข้อมูลก็ยังน้อยมากเมื่อเทียบกับสิ่งที่บริษัทใหญ่ถืออยู่ในมือ ตัวอย่างเช่น รายงานของ Anthropic และ OpenAI ใช้ข้อมูลนับล้านบทสนทนา ขณะที่ AI Observatory มีเพียงหลักหมื่น อย่างไรก็ดี โครงการนี้ช่วยเปิดพื้นที่ให้การตรวจสอบภายนอกเกิดขึ้นจริง และสะท้อนข้อเรียกร้องสำคัญว่า หากบริษัทไม่เปิดข้อมูลดิบให้นักวิจัยอิสระ ภาพรวมการใช้ AI ก็จะยังถูกกำหนดจาก “เรื่องเล่า” ของบริษัทมากกว่าข้อเท็จจริงเชิงประจักษ์


