OpenAI正在把ChatGPT的语音能力从对话工具推进为可执行具体事务的个人助手。公司将于周三把更先进的语音系统接入ChatGPT网页端和移动应用,用户只需通过语音下达指令,便可让系统处理需要多个步骤、浏览器和不同应用配合完成的任务。这项更新也让OpenAI进一步进入个人智能助手市场,并为其未来的硬件布局铺路。
GPT-Live连接浏览器与任务模型
此次发布将OpenAI的语音模型GPT-Live连接至能够操作电脑或浏览器的人工智能模型。GPT-Live可以同时听取用户讲话并作出回应,此前已用于ChatGPT的基础对话语音模式,也已经在桌面应用中与具备任务执行能力的模型连接。
ChatGPT语音产品负责人Atty Eleti在演示中展示了具体用法。他只通过语音操作,就让系统分析自己在DoorDash上的消费记录、支付5美元预订一块匹克球场地,并重新安排日历。上述任务涉及消费信息、付款动作和个人日程管理,显示语音功能的目标已不只是回答问题,而是代替用户完成一连串线上操作。
Eleti表示,OpenAI希望未来用户主要通过语音与人工智能互动,语音将成为人机交互的主要方式之一。这也是团队正在推进的长期方向。
1500万以上用户已使用听写和语音功能
Eleti称,目前已有超过1.5亿人使用ChatGPT的听写和语音模式工具。对用户而言,语音输入的直接优势是速度快、表达自然,用户可以在不拿起设备的情况下说出想法,也可以在通勤或散步时处理任务。
OpenAI还强调,语音模式并不意味着所有输入和输出都必须是声音。用户可以用语音提出请求,系统再根据任务类型返回文字、语音,或两者结合的结果。Eleti表示,团队在设计响应方式时特别考虑了一个实际差异:说话通常比打字快,但阅读文字往往又比听完整段语音更快。
个人助手竞争延伸到移动场景
硅谷近期持续关注个人人工智能助手。Instinct以及Meta的Muse等产品,都在尝试替用户处理繁琐的网络事务。ChatGPT已经具备其中不少能力,但OpenAI尚未推出一个独立、功能更窄的个人助手产品。此次语音更新相当于把现有的任务执行能力带入更适合移动场景的交互入口。
短期来看,用户可以在走路、通勤或双手不便操作设备时,把部分线上事务交给ChatGPT。除了处理网页任务,语音模式也适合语言学习和演讲练习等需要开口表达的场景。OpenAI产品团队成员也在通勤和散步时使用这一功能。
语音入口仍面临设备和使用习惯限制
语音助手的推广并非没有限制。智能音箱市场已经证明,语音交互可以保留一定用户基础,但多数办公环境仍围绕台式电脑和键盘建立。语音输入虽然便捷,却不一定适合所有包含大量信息核对、敏感数据处理或复杂确认步骤的工作。
OpenAI的硬件规划也在推动语音能力继续向独立设备延伸,公司计划于2027年推出智能音箱。若这一规划落地,GPT-Live与任务执行模型的结合,可能成为其硬件产品的重要交互方式。但目前,用户仍主要通过ChatGPT网页端、移动应用和桌面应用使用相关能力,付款、账户授权以及跨应用操作的具体边界,仍取决于产品权限和实际使用环境。