OpenAI ampliará este miércoles las funciones de voz de ChatGPT para que los usuarios puedan completar tareas que requieren varios pasos en internet. La compañía integrará su sistema de voz GPT-Live en las aplicaciones web y móviles de ChatGPT, con instrucciones habladas capaces de coordinar acciones en navegadores y distintas aplicaciones. El movimiento refuerza la presencia de OpenAI en el mercado de los asistentes personales de IA y encaja con sus planes de hardware a más largo plazo.
GPT-Live combina voz y ejecución de tareas
El lanzamiento conecta el modelo de voz de OpenAI, GPT-Live, con un sistema de IA capaz de manejar un ordenador o un navegador. GPT-Live escucha al usuario y responde en tiempo real. Hasta ahora se utilizaba en el modo de conversación por voz estándar de ChatGPT y ya se había vinculado a modelos de ejecución de tareas en la aplicación de escritorio.
Atty Eleti, responsable del producto de voz de ChatGPT, mostró el funcionamiento durante una demostración. Solo mediante órdenes habladas, pidió al sistema que analizara sus gastos en DoorDash, pagara 5 dólares para reservar una pista de pickleball y reorganizara su calendario. La secuencia combinó datos de gasto, un pago y la gestión de actividades personales, lo que muestra que la función está diseñada no solo para responder preguntas, sino también para completar varias acciones online en nombre del usuario.
Eleti afirmó que OpenAI quiere que, con el tiempo, las personas interactúen principalmente con la IA mediante la voz, que se convertiría en una de las principales interfaces entre usuarios y máquinas. Presentó esa orientación como una línea de trabajo a largo plazo para el equipo.
Más de 150 millones de usuarios utilizan voz y dictado
Eleti señaló que más de 150 millones de personas utilizan actualmente las herramientas de dictado y el modo de voz de ChatGPT. Introducir instrucciones habladas puede resultar más rápido y natural que escribir, además de permitir capturar ideas sin tener que manipular un dispositivo o realizar tareas durante un trayecto o un paseo.
OpenAI también subrayó que el modo de voz no exige que cada entrada y respuesta sea hablada. El usuario puede formular una petición oralmente y ChatGPT puede responder mediante texto, audio o una combinación de ambos, según la tarea. Eleti explicó que el equipo tuvo en cuenta una diferencia práctica al diseñar la experiencia: por lo general, hablar es más rápido que escribir, mientras que leer texto suele ser más rápido que escuchar una respuesta hablada completa.
La competencia por el asistente personal llega al móvil
Los asistentes personales basados en IA han ganado visibilidad en Silicon Valley. Productos como Instinct y Muse, de Meta, también están en desarrollo para realizar tareas online rutinarias en nombre de los usuarios. ChatGPT ya ofrece muchas de esas capacidades, pero OpenAI no ha lanzado un producto independiente de asistente personal con un enfoque más limitado. La actualización de voz coloca sus herramientas existentes de ejecución de tareas detrás de una interfaz más adecuada para el uso móvil.
A corto plazo, los usuarios podrán delegar algunas tareas online mientras caminan, se desplazan o no pueden manejar un dispositivo con las dos manos. El modo de voz también puede servir para actividades que requieren hablar, como el aprendizaje de idiomas y la práctica oral. Miembros del equipo de producto de OpenAI han utilizado la función durante desplazamientos y paseos.
Las limitaciones de los dispositivos siguen condicionando el uso
Los asistentes de voz todavía tienen límites prácticos. El mercado de los altavoces inteligentes demuestra que la interacción por voz puede mantener una base de usuarios, pero la mayoría de los flujos de trabajo de oficina siguen organizados alrededor de ordenadores de sobremesa y teclados. La entrada por voz puede ser cómoda sin resultar adecuada para todas las tareas que exigen revisar muchos datos, manejar información sensible o completar varias confirmaciones.
Los planes de hardware de OpenAI también están orientando sus funciones de voz hacia dispositivos independientes. La compañía prevé lanzar un altavoz inteligente en 2027. Si el proyecto sigue adelante, la combinación de GPT-Live y los modelos de ejecución de tareas podría convertirse en uno de los principales métodos de interacción del dispositivo. Por ahora, estas capacidades se utilizan principalmente a través de las aplicaciones web, móviles y de escritorio de ChatGPT. El alcance de los pagos, las autorizaciones de cuenta y las acciones entre aplicaciones seguirá dependiendo de los permisos del producto y del entorno operativo de cada usuario.