OpenAI sedang mengubah fungsi suara ChatGPT daripada sekadar alat perbualan kepada pembantu peribadi yang boleh melaksanakan urusan sebenar. Mulai Rabu, syarikat itu akan menghubungkan sistem suara yang lebih maju kepada ChatGPT di web dan aplikasi mudah alih. Pengguna hanya perlu memberikan arahan secara suara untuk tugasan yang memerlukan beberapa langkah, pelayaran pelayar dan penggunaan aplikasi berbeza.
Kemas kini ini mengembangkan persaingan dalam pasaran pembantu peribadi berasaskan kecerdasan buatan, selain menjadi sebahagian daripada persediaan OpenAI untuk mengembangkan penggunaan teknologinya pada peranti khusus pada masa depan.
GPT-Live digabungkan dengan model pelaksana tugasan
Pelancaran itu menghubungkan model suara OpenAI, GPT-Live, dengan model kecerdasan buatan yang boleh mengendalikan komputer atau pelayar. GPT-Live boleh mendengar percakapan pengguna dan memberikan respons secara serentak. Sebelum ini, teknologi tersebut digunakan dalam mod suara asas ChatGPT dan telah disepadukan dalam aplikasi desktop dengan model yang mempunyai keupayaan melaksanakan tugasan.
Atty Eleti, ketua produk suara ChatGPT, menunjukkan beberapa kegunaan dalam satu demonstrasi. Dengan arahan suara sahaja, beliau meminta sistem menganalisis rekod perbelanjaannya di DoorDash, membuat bayaran sebanyak AS$5 untuk menempah gelanggang pickleball dan menyusun semula kalendar.
Tugasan itu melibatkan maklumat perbelanjaan, tindakan pembayaran dan pengurusan jadual peribadi. Ia menunjukkan bahawa sasaran fungsi suara tersebut bukan lagi sekadar menjawab soalan, tetapi membantu pengguna menyelesaikan rangkaian urusan dalam talian.
Eleti berkata OpenAI mahu pengguna pada masa depan lebih banyak berinteraksi dengan kecerdasan buatan melalui suara. Menurutnya, suara berpotensi menjadi antara kaedah utama untuk berhubung dengan sistem komputer, dan perkara itu merupakan hala tuju jangka panjang pasukannya.
Lebih 150 juta pengguna menggunakan input suara
Eleti berkata lebih 150 juta orang kini menggunakan alat imlak dan mod suara ChatGPT. Bagi pengguna, kelebihan langsung input suara ialah kelajuan dan cara penyampaian yang lebih semula jadi. Mereka boleh menyatakan fikiran tanpa perlu mengangkat atau menaip pada peranti, termasuk ketika berulang-alik ke tempat kerja atau berjalan kaki.
OpenAI turut menegaskan bahawa mod suara tidak bermakna semua input dan output mesti disampaikan dalam bentuk audio. Pengguna boleh memberikan arahan secara suara, manakala sistem boleh mengembalikan jawapan dalam bentuk teks, suara atau gabungan kedua-duanya, bergantung pada tugasan.
Eleti berkata pasukan produk mengambil kira perbezaan praktikal antara bercakap dan membaca ketika mereka bentuk respons. Bercakap biasanya lebih pantas daripada menaip, tetapi membaca teks selalunya lebih cepat daripada mendengar keseluruhan respons audio.
Persaingan pembantu peribadi beralih kepada penggunaan mudah alih
Pasaran pembantu kecerdasan buatan peribadi menjadi tumpuan berterusan di Silicon Valley. Produk seperti Instinct dan Muse keluaran Meta turut cuba mengendalikan urusan dalam talian yang rumit bagi pihak pengguna.
ChatGPT sudah mempunyai sebahagian daripada keupayaan itu, namun OpenAI masih belum melancarkan produk pembantu peribadi berasingan yang mempunyai skop fungsi lebih khusus. Kemas kini suara ini membawa keupayaan pelaksanaan tugasan sedia ada ke saluran interaksi yang lebih sesuai untuk penggunaan mudah alih.
Dalam jangka pendek, pengguna boleh menyerahkan sebahagian urusan dalam talian kepada ChatGPT ketika berjalan, berulang-alik atau ketika kedua-dua tangan mereka tidak mudah digunakan untuk mengendalikan peranti. Selain mengurus tugasan di laman web, mod suara juga sesuai untuk aktiviti seperti pembelajaran bahasa dan latihan ucapan yang memerlukan pengguna bercakap.
Anggota pasukan produk OpenAI turut menggunakan fungsi itu ketika berulang-alik dan berjalan kaki.
Peranti dan tabiat pengguna masih menjadi kekangan
Penggunaan pembantu suara secara meluas masih berdepan beberapa batasan. Pasaran pembesar suara pintar menunjukkan bahawa interaksi suara boleh mengekalkan kumpulan pengguna tertentu, namun kebanyakan persekitaran pejabat masih dibina berasaskan komputer meja dan papan kekunci.
Walaupun input suara lebih mudah dalam sesetengah keadaan, kaedah itu tidak semestinya sesuai untuk tugasan yang memerlukan semakan maklumat secara terperinci, pengendalian data sensitif atau beberapa langkah pengesahan yang kompleks.
Rancangan perkakasan OpenAI juga boleh mendorong fungsi suara itu berkembang kepada peranti kendiri. Syarikat tersebut merancang melancarkan pembesar suara pintar pada 2027. Jika rancangan itu direalisasikan, gabungan GPT-Live dengan model pelaksanaan tugasan mungkin menjadi antara kaedah interaksi utama bagi produk perkakasan berkenaan.
Buat masa ini, pengguna masih mengakses keupayaan tersebut terutamanya melalui ChatGPT di web, aplikasi mudah alih dan aplikasi desktop. Skop sebenar bagi pembayaran, kebenaran akaun dan operasi merentas aplikasi pula masih bergantung pada kebenaran produk serta keadaan penggunaan setiap pengguna.