Google อัปเกรด Gemini Audio ด้วยโมเดลถอดเสียงใหม่ ตัดคำฟุ่มเฟือยและรองรับกว่า 85 ภาษา
Google ปรับปรุง Gemini Audio ด้วยโมเดลตระกูล Gemini 3.5 ชุดใหม่ เพื่อยกระดับความสามารถด้านการถอดเสียงและคำสั่งเสียงให้แม่นยำขึ้น โดยไฮไลต์สำคัญคือการรองรับคำศัพท์เฉพาะทางได้ดีขึ้น และครอบคลุมมากกว่า…

Google ปรับปรุง Gemini Audio ด้วยโมเดลตระกูล Gemini 3.5 ชุดใหม่ เพื่อยกระดับความสามารถด้านการถอดเสียงและคำสั่งเสียงให้แม่นยำขึ้น โดยไฮไลต์สำคัญคือการรองรับคำศัพท์เฉพาะทางได้ดีขึ้น และครอบคลุมมากกว่า 85 ภาษา
การอัปเดตครั้งนี้ประกอบด้วย Gemini 3.5 Live, Gemini 3.5 Live Experimental และ Gemini 3.5 Transcribe ซึ่ง Google ออกแบบมาเพื่อเพิ่มความแม่นยำในการทำงานกับเสียงพูดจริงในสภาพแวดล้อมที่ไม่สมบูรณ์ เช่น มีเสียงรบกวน พูดแทรก หรือพูดไม่ต่อเนื่อง โมเดลเหล่านี้จึงเหมาะกับการใช้งานด้านผู้ช่วยเสียงและการแปลงเสียงเป็นข้อความในสถานการณ์จริงมากขึ้น
จุดที่น่าสนใจคือ Gemini 3.5 Transcribe เป็นโมเดลใหม่ที่เข้ามาเสริมตระกูล Gemini โดยเฉพาะ และมุ่งเน้นการถอดเสียงให้ลื่นไหลเป็นธรรมชาติมากขึ้น รวมถึงลดคำพูดไม่จำเป็นอย่าง “um” และ “ah” ออกไปในการถอดความ ซึ่งช่วยให้ข้อความที่ได้อ่านง่ายและพร้อมใช้งานมากขึ้น
การเปิดตัวนี้เกิดขึ้นในช่วงที่หลายฝ่ายยังรอ Google ปล่อย Gemini 3.5 Pro ตามที่เคยระบุไว้ก่อนหน้านี้ ทำให้การอัปเดตด้านเสียงรอบนี้ถูกมองว่าเป็นอีกก้าวสำคัญในการขยายความสามารถของ Gemini แม้จะยังไม่ใช่รุ่นโปรหลักที่ตลาดคาดหวังก็ตาม
โดยรวมแล้ว การเปลี่ยนแปลงครั้งนี้สะท้อนว่ากูเกิลกำลังเร่งปรับปรุงความสามารถของ AI ด้านเสียงให้ใช้งานได้จริงมากขึ้น ทั้งในแง่ความแม่นยำ รองรับหลายภาษา และจัดการกับสัญญาณเสียงที่ซับซ้อนได้ดีขึ้น ซึ่งอาจส่งผลโดยตรงต่อผลิตภัณฑ์และบริการที่พึ่งพาการสั่งงานด้วยเสียงของบริษัทในอนาคต


