OpenAI正把ChatGPT的語音能力從對話工具推進為可執行具體事務的個人助理。公司將於週三把更先進的語音系統接入ChatGPT網頁版與行動應用程式,讓用戶只需以語音下達指令,便可處理需要多個步驟、瀏覽器及不同應用程式協作完成的任務。這項更新也讓OpenAI進一步切入個人AI助理市場,並為未來的硬體布局鋪路。
GPT-Live接入瀏覽器與任務模型
此次發布將OpenAI的語音模型GPT-Live,連接至能夠操作電腦或瀏覽器的人工智慧模型。GPT-Live可以同時聆聽用戶說話並作出回應,過去已用於ChatGPT的基本對話語音模式,也已在桌面應用程式中與具備任務執行能力的模型連接。
ChatGPT語音產品負責人Atty Eleti在示範中展示了具體用法。他完全透過語音操作,讓系統分析自己在DoorDash上的消費紀錄、支付5美元預訂一個匹克球場地,並重新安排行事曆。這些任務涵蓋消費資訊、付款操作及個人日程管理,顯示語音功能的定位已不只是回答問題,而是代替用戶完成一連串線上操作。
Eleti表示,OpenAI希望未來用戶主要透過語音與人工智慧互動,語音將成為人機互動的主要方式之一。這也是團隊目前推進的長期方向。
超過1.5億人使用聽寫與語音功能
Eleti表示,目前已有超過1.5億人使用ChatGPT的聽寫及語音模式工具。對用戶而言,語音輸入的直接優勢在於速度快、表達自然;用戶不必拿起裝置便能說出想法,也可以在通勤或散步時處理任務。
OpenAI也強調,語音模式並不代表所有輸入與輸出都必須是聲音。用戶可以以語音提出要求,系統再按任務類型回傳文字、語音,或兩者結合的結果。Eleti表示,團隊在設計回應方式時特別考慮到一項實際差異:說話通常比打字快,但閱讀文字往往又比聽完一整段語音更快。
個人助理競爭延伸至行動場景
矽谷近期持續關注個人AI助理。Instinct及Meta的Muse等產品,都在嘗試代替用戶處理繁瑣的網路事務。ChatGPT已具備其中不少能力,但OpenAI尚未推出一款獨立、功能較集中的個人助理產品。此次語音更新,等於把現有的任務執行能力帶入更適合行動場景的互動入口。
短期而言,用戶可以在步行、通勤或雙手不便操作裝置時,把部分線上事務交由ChatGPT處理。除了執行網頁任務,語音模式也適合語言學習及演講練習等需要開口表達的場景。OpenAI產品團隊成員也會在通勤及散步時使用這項功能。
語音入口仍受裝置與使用習慣限制
語音助理的普及仍有一定限制。智慧音箱市場已顯示,語音互動可以維持一定用戶基礎,但多數辦公環境仍以桌上型電腦及鍵盤為核心。語音輸入雖然便利,卻未必適合所有涉及大量資訊核對、敏感資料處理或複雜確認步驟的工作。
OpenAI的硬體規劃也推動語音能力持續延伸至獨立裝置。公司計劃於2027年推出智慧音箱。若這項規劃落實,GPT-Live與任務執行模型的結合,可能成為其硬體產品的重要互動方式。不過目前用戶仍主要透過ChatGPT網頁版、行動應用程式及桌面應用程式使用相關功能;付款、帳戶授權及跨應用程式操作的具體範圍,仍取決於產品權限與實際使用環境。