OpenAI กำลังขยับความสามารถด้านเสียงของ ChatGPT จากเครื่องมือสนทนาไปสู่ผู้ช่วยส่วนตัวที่ลงมือทำงานได้จริง โดยในวันพุธ บริษัทจะเชื่อมระบบเสียงรุ่นใหม่ GPT-Live เข้ากับ ChatGPT บนเว็บไซต์และแอปมือถือ ผู้ใช้สามารถออกคำสั่งด้วยเสียงให้ระบบทำงานที่ต้องอาศัยหลายขั้นตอน การเปิดเบราว์เซอร์ และการทำงานร่วมกับแอปต่าง ๆ ได้ การอัปเดตนี้ทำให้ OpenAI เข้าใกล้ตลาดผู้ช่วยอัจฉริยะส่วนบุคคลมากขึ้น และอาจเป็นส่วนหนึ่งของการเตรียมความพร้อมด้านฮาร์ดแวร์ในอนาคต
GPT-Live เชื่อมเบราว์เซอร์กับโมเดลทำงาน
การเปิดตัวครั้งนี้เชื่อมโมเดลเสียง GPT-Live ของ OpenAI เข้ากับโมเดลปัญญาประดิษฐ์ที่สามารถควบคุมคอมพิวเตอร์หรือเบราว์เซอร์ได้ GPT-Live สามารถฟังผู้ใช้และตอบกลับไปพร้อมกัน ก่อนหน้านี้ระบบถูกใช้ในโหมดสนทนาด้วยเสียงพื้นฐานของ ChatGPT และเชื่อมต่อกับโมเดลที่มีความสามารถด้านการทำงานผ่านแอปเดสก์ท็อปมาแล้ว
Atty Eleti ผู้ดูแลผลิตภัณฑ์เสียงของ ChatGPT สาธิตการใช้งาน โดยใช้เพียงคำสั่งเสียงให้ระบบวิเคราะห์รายการใช้จ่ายของเขาบน DoorDash ชำระเงิน 5 ดอลลาร์เพื่อจองสนามพิกเคิลบอล และจัดตารางในปฏิทินใหม่ งานเหล่านี้ครอบคลุมข้อมูลการใช้จ่าย การชำระเงิน และการจัดการตารางส่วนตัว สะท้อนว่าเป้าหมายของฟังก์ชันเสียงไม่ได้จำกัดอยู่ที่การตอบคำถาม แต่รวมถึงการทำธุรกรรมออนไลน์หลายขั้นตอนแทนผู้ใช้
Eleti กล่าวว่า OpenAI ต้องการให้ผู้ใช้มีปฏิสัมพันธ์กับปัญญาประดิษฐ์ผ่านเสียงเป็นหลักในอนาคต โดยมองว่าเสียงจะเป็นหนึ่งในช่องทางสำคัญระหว่างมนุษย์กับระบบ AI แนวทางดังกล่าวเป็นทิศทางระยะยาวที่ทีมงานกำลังพัฒนา
ผู้ใช้กว่า 150 ล้านคนใช้ฟังก์ชันเสียงและการบอกข้อความ
Eleti ระบุว่า ปัจจุบันมีผู้ใช้ ChatGPT มากกว่า 150 ล้านคนที่ใช้เครื่องมือบอกข้อความและโหมดเสียง สำหรับผู้ใช้ จุดเด่นโดยตรงของการป้อนข้อมูลด้วยเสียงคือความเร็วและความเป็นธรรมชาติ ผู้ใช้สามารถพูดความคิดออกมาได้โดยไม่ต้องหยิบอุปกรณ์ขึ้นมา และยังจัดการงานบางอย่างระหว่างเดินทางหรือเดินเล่นได้
OpenAI ยังย้ำว่าโหมดเสียงไม่ได้หมายความว่าการป้อนข้อมูลและผลลัพธ์ทั้งหมดต้องอยู่ในรูปแบบเสียง ผู้ใช้สามารถพูดคำขอ แล้วให้ระบบตอบกลับเป็นข้อความ เสียง หรือผสมผสานทั้งสองรูปแบบตามลักษณะของงาน Eleti กล่าวว่า ทีมงานคำนึงถึงความแตกต่างในการใช้งานจริง โดยทั่วไปการพูดเร็วกว่าการพิมพ์ ขณะที่การอ่านข้อความมักใช้เวลาน้อยกว่าการฟังคำตอบแบบเสียงจนจบ
การแข่งขันผู้ช่วยส่วนตัวขยายสู่การใช้งานบนมือถือ
ตลาดในซิลิคอนแวลลีย์กำลังให้ความสนใจกับผู้ช่วย AI ส่วนบุคคลอย่างต่อเนื่อง ผลิตภัณฑ์จาก Instinct และ Muse ของ Meta ต่างพยายามช่วยผู้ใช้จัดการงานออนไลน์ที่ยุ่งยาก ChatGPT มีความสามารถหลายด้านในลักษณะเดียวกันอยู่แล้ว แต่ OpenAI ยังไม่ได้เปิดตัวผลิตภัณฑ์ผู้ช่วยส่วนตัวแบบแยกเดี่ยวที่มีขอบเขตการใช้งานแคบกว่า
การอัปเดตด้านเสียงครั้งนี้จึงนำความสามารถในการทำงานที่มีอยู่ของ ChatGPT เข้ามาสู่ช่องทางการใช้งานที่เหมาะกับมือถือมากขึ้น ในระยะสั้น ผู้ใช้สามารถมอบหมายงานออนไลน์บางส่วนให้ ChatGPT ระหว่างเดิน เดินทางไปทำงาน หรือในช่วงที่ไม่สะดวกใช้มือควบคุมอุปกรณ์ นอกจากงานผ่านเว็บแล้ว โหมดเสียงยังเหมาะกับการเรียนภาษาและการฝึกพูดหรือการนำเสนอ ซึ่งเป็นกิจกรรมที่ต้องใช้การพูดออกเสียง ทีมผลิตภัณฑ์ของ OpenAI เองก็ใช้ฟังก์ชันนี้ระหว่างเดินทางและเดินเล่น
ข้อจำกัดยังอยู่ที่อุปกรณ์และพฤติกรรมการใช้งาน
การขยายตัวของผู้ช่วยเสียงยังมีข้อจำกัด ตลาดลำโพงอัจฉริยะพิสูจน์แล้วว่าการสั่งงานด้วยเสียงสามารถรักษาฐานผู้ใช้บางส่วนไว้ได้ แต่สถานที่ทำงานส่วนใหญ่ยังสร้างขึ้นรอบคอมพิวเตอร์ตั้งโต๊ะและแป้นพิมพ์ แม้การป้อนข้อมูลด้วยเสียงจะสะดวก แต่ก็อาจไม่เหมาะกับงานที่ต้องตรวจสอบข้อมูลจำนวนมาก จัดการข้อมูลอ่อนไหว หรือผ่านขั้นตอนยืนยันที่ซับซ้อน
แผนฮาร์ดแวร์ของ OpenAI ก็อาจผลักดันให้ความสามารถด้านเสียงขยายไปสู่อุปกรณ์แยกต่างหากมากขึ้น บริษัทมีแผนเปิดตัวลำโพงอัจฉริยะในปี 2027 หากแผนดังกล่าวเกิดขึ้นจริง การทำงานร่วมกันระหว่าง GPT-Live กับโมเดลที่ลงมือทำงานได้อาจเป็นช่องทางปฏิสัมพันธ์สำคัญของผลิตภัณฑ์ฮาร์ดแวร์ดังกล่าว อย่างไรก็ตาม ปัจจุบันผู้ใช้ยังคงเข้าถึงความสามารถนี้ผ่านเว็บไซต์ แอปมือถือ และแอปเดสก์ท็อปของ ChatGPT ขณะที่ขอบเขตการชำระเงิน การอนุญาตบัญชี และการทำงานข้ามแอปยังขึ้นอยู่กับสิทธิ์ของผลิตภัณฑ์และสภาพแวดล้อมการใช้งานจริง