A OpenAI vai expandir as funções de voz do ChatGPT para tarefas que exigem várias etapas online. A partir de quarta-feira, o sistema de voz mais avançado GPT-Live ficará disponível nas aplicações web e móveis do ChatGPT, permitindo dar instruções faladas para ações que envolvem navegadores e várias aplicações. A atualização reforça a presença da empresa no mercado dos assistentes pessoais de inteligência artificial e acompanha os seus planos de longo prazo para dispositivos próprios.
GPT-Live liga voz à execução de tarefas
O lançamento integra o modelo de voz da OpenAI, GPT-Live, com um modelo de inteligência artificial capaz de operar um computador ou navegador. O GPT-Live consegue ouvir o utilizador e responder em tempo real. Até agora, era utilizado sobretudo no modo de conversação por voz do ChatGPT e já tinha sido associado a modelos de execução de tarefas na aplicação para computadores.
Atty Eleti, responsável pelo produto de voz do ChatGPT, demonstrou o funcionamento do sistema. Apenas com comandos de voz, pediu ao assistente que analisasse os seus gastos na DoorDash, pagasse 5 dólares para reservar um campo de pickleball e reorganizasse o seu calendário. A sequência combinou dados de despesas, um pagamento e gestão de agenda, mostrando que a função foi concebida não apenas para responder a perguntas, mas também para concluir várias ações online em nome do utilizador.
Eleti afirmou que a OpenAI pretende que as pessoas interajam sobretudo por voz com a inteligência artificial no futuro, tornando a fala uma das principais interfaces entre utilizadores e máquinas. Apresentou essa direção como um objetivo de longo prazo da equipa.
Mais de 150 milhões de utilizadores recorrem à voz e à ditaduração
Eleti afirmou que mais de 150 milhões de pessoas utilizam atualmente as ferramentas de ditado e modo de voz do ChatGPT. Introduzir informação por voz pode ser mais rápido e natural do que escrever, permitindo registar ideias sem pegar num dispositivo ou realizar tarefas durante uma deslocação ou caminhada.
A OpenAI sublinhou também que o modo de voz não exige que todos os pedidos e respostas sejam falados. O utilizador pode fazer um pedido verbal, enquanto o ChatGPT responde por texto, áudio ou através de uma combinação dos dois, consoante a tarefa. Eleti explicou que a equipa teve em conta uma diferença prática ao desenhar a experiência: falar é geralmente mais rápido do que escrever, mas ler texto costuma ser mais rápido do que ouvir uma resposta completa.
A concorrência pelos assistentes pessoais chega ao telemóvel
Os assistentes pessoais de inteligência artificial têm recebido atenção crescente no Vale do Silício. Produtos como o Instinct e o Muse, da Meta, também estão a ser desenvolvidos para executar tarefas online rotineiras em nome dos utilizadores. O ChatGPT já oferece muitas dessas capacidades, mas a OpenAI ainda não lançou um produto separado de assistente pessoal com um foco mais limitado. A atualização de voz coloca as ferramentas de execução de tarefas existentes numa interface mais adequada à utilização móvel.
A curto prazo, os utilizadores poderão delegar algumas tarefas online enquanto caminham, viajam ou não conseguem operar um dispositivo com as duas mãos. O modo de voz também poderá ser útil em atividades que exigem falar, como a aprendizagem de línguas e a prática de conversação. Elementos da equipa de produto da OpenAI já utilizaram a função durante deslocações e caminhadas.
Limitações dos dispositivos e hábitos dos utilizadores continuam relevantes
Os assistentes de voz continuam sujeitos a limitações práticas. O mercado das colunas inteligentes mostra que a interação por voz consegue manter uma base de utilizadores, mas a maioria dos fluxos de trabalho de escritório continua assente em computadores e teclados. A introdução de comandos por voz pode ser conveniente sem ser adequada a todas as tarefas que envolvem verificações extensas de dados, informação sensível ou várias etapas de confirmação.
Os planos de hardware da OpenAI também estão a orientar as capacidades de voz para dispositivos autónomos. A empresa planeia lançar uma coluna inteligente em 2027. Se o plano avançar, a combinação do GPT-Live com modelos de execução de tarefas poderá tornar-se um dos principais meios de interação com esse equipamento. Por enquanto, os utilizadores acedem sobretudo a estas capacidades através das aplicações web, móveis e para computadores do ChatGPT. O alcance dos pagamentos, das autorizações de conta e das ações entre aplicações continuará a depender das permissões do produto e do ambiente de utilização.