OpenAI в среду расширит возможности ChatGPT за пределы голосового диалога: более продвинутая система GPT-Live появится в веб- и мобильных приложениях и позволит отдавать голосовые команды для выполнения задач в браузере и нескольких приложениях. Обновление усиливает позиции компании на рынке персональных ИИ-ассистентов и связано с её долгосрочными планами по выпуску собственных устройств.
GPT-Live объединяет голос и выполнение действий
Запуск связывает голосовую модель OpenAI GPT-Live с ИИ-моделью, способной управлять компьютером или браузером. GPT-Live распознаёт речь пользователя и отвечает в реальном времени. Ранее система использовалась в стандартном голосовом режиме ChatGPT, а в настольном приложении уже работала вместе с моделями, выполняющими задачи.
Руководитель направления голосовых продуктов ChatGPT Атти Элети продемонстрировал принцип работы функции. С помощью только голосовых команд он попросил систему проанализировать свои расходы в DoorDash, перевести $5 для бронирования площадки для пиклбола и изменить расписание в календаре. Последовательность включала работу с данными о расходах, платёж и управление личным расписанием. Это показывает, что голосовой режим рассчитан не только на ответы, но и на выполнение цепочки онлайн-действий от имени пользователя.
Элети отметил, что в перспективе OpenAI хотела бы сделать голос основным способом взаимодействия людей с ИИ. По его словам, это долгосрочное направление работы команды.
Голосовые функции используют более 150 млн человек
По словам Элети, инструменты диктовки и голосового режима ChatGPT сейчас используют более 150 млн человек. Голосовой ввод может быть быстрее и естественнее набора текста: он позволяет фиксировать идеи без необходимости брать в руки устройство, а также выполнять задачи во время прогулки или поездки.
При этом голосовой режим не требует, чтобы и запрос, и ответ всегда звучали вслух. Пользователь может сформулировать просьбу голосом, а ChatGPT — ответить текстом, аудио или сочетанием обоих форматов в зависимости от задачи. При разработке интерфейса команда учитывала практическое различие: говорить обычно быстрее, чем печатать, тогда как прочитать текст часто быстрее, чем прослушать полностью озвученный ответ.
Конкуренция ассистентов переходит на мобильные сценарии
Персональные ИИ-ассистенты привлекают всё больше внимания в Кремниевой долине. Такие продукты, как Instinct и Muse от Meta, также разрабатываются для выполнения повседневных онлайн-задач за пользователя. ChatGPT уже поддерживает многие подобные функции, однако отдельный персональный ассистент с более узкой специализацией OpenAI пока не выпускала.
Новое голосовое обновление переносит существующие инструменты выполнения задач в интерфейс, который лучше подходит для мобильного использования. В ближайшей перспективе пользователь сможет поручить системе часть онлайн-действий во время прогулки, поездки или в ситуации, когда невозможно управлять устройством обеими руками. Голосовой режим может быть полезен и в занятиях, где требуется говорить, например при изучении языков или тренировке речи. Сотрудники продуктовой команды OpenAI уже использовали функцию во время поездок и прогулок.
Ограничения устройств и привычки пользователей сохраняются
У голосовых ассистентов остаются практические ограничения. Рынок умных колонок показывает, что голосовое взаимодействие может сохранять устойчивую аудиторию, однако большинство рабочих процессов по-прежнему рассчитано на компьютеры, клавиатуру и экран. Голосовой ввод удобен не для каждой задачи, особенно если она требует подробной проверки данных, работы с чувствительной информацией или нескольких подтверждений.
Аппаратные планы OpenAI также подталкивают компанию к развитию голосовых возможностей для автономных устройств. Компания планирует выпустить умную колонку в 2027 году. Если этот план будет реализован, связка GPT-Live с моделями выполнения задач может стать одним из ключевых способов взаимодействия с устройством.
Пока доступ к этим функциям в основном осуществляется через веб-, мобильное и настольное приложения ChatGPT. Возможности платежей, авторизации аккаунтов и действий между разными приложениями по-прежнему будут зависеть от разрешений продукта и настроек среды, в которой работает пользователь.