OpenAI sẽ đưa hệ thống giọng nói GPT-Live vào ChatGPT trên nền tảng web và ứng dụng di động từ thứ Tư, mở rộng sản phẩm từ công cụ hội thoại thành trợ lý có thể thực hiện các công việc nhiều bước. Người dùng có thể ra lệnh bằng giọng nói để ChatGPT phối hợp trình duyệt và nhiều ứng dụng, qua đó xử lý các tác vụ như phân tích chi tiêu, đặt địa điểm và sắp xếp lịch cá nhân.
Bản cập nhật đưa OpenAI tiến sâu hơn vào thị trường trợ lý cá nhân bằng AI, đồng thời tạo nền tảng cho định hướng phần cứng của công ty.
GPT-Live kết nối với mô hình thực thi tác vụ
Trong lần triển khai này, mô hình giọng nói GPT-Live được kết nối với một mô hình AI có khả năng thao tác trên máy tính hoặc trình duyệt. GPT-Live có thể nghe người dùng nói và phản hồi đồng thời. Công nghệ này trước đó đã được sử dụng trong chế độ hội thoại bằng giọng nói cơ bản của ChatGPT và trên ứng dụng máy tính để bàn, nơi nó kết nối với các mô hình có khả năng thực hiện tác vụ.
Atty Eleti, người phụ trách sản phẩm giọng nói của ChatGPT, đã trình diễn cách sử dụng tính năng này. Chỉ bằng khẩu lệnh, ông yêu cầu hệ thống phân tích lịch sử chi tiêu trên DoorDash, thanh toán 5 USD để đặt một sân pickleball và sắp xếp lại lịch. Chuỗi thao tác này bao gồm dữ liệu chi tiêu, giao dịch thanh toán và quản lý lịch cá nhân, cho thấy mục tiêu của tính năng không còn dừng ở việc trả lời câu hỏi mà là thay người dùng hoàn tất nhiều công việc trực tuyến liên tiếp.
Eleti cho biết OpenAI muốn người dùng trong tương lai tương tác với AI chủ yếu thông qua giọng nói. Theo ông, giọng nói sẽ trở thành một trong những phương thức chính để con người giao tiếp với hệ thống AI, và đây là hướng phát triển dài hạn mà nhóm đang theo đuổi.
Hơn 150 triệu người đã dùng đọc chính tả và giọng nói
Eleti cho biết hiện có hơn 150 triệu người sử dụng các công cụ đọc chính tả và chế độ giọng nói của ChatGPT. Với người dùng, lợi thế trực tiếp của việc nhập liệu bằng giọng nói là tốc độ và cách diễn đạt tự nhiên. Họ có thể nói ra ý tưởng mà không cần cầm thiết bị, hoặc xử lý công việc trong lúc đi làm, đi bộ.
OpenAI cũng nhấn mạnh rằng chế độ giọng nói không buộc toàn bộ dữ liệu đầu vào và đầu ra phải ở dạng âm thanh. Người dùng có thể nói yêu cầu, còn hệ thống sẽ trả kết quả bằng văn bản, giọng nói hoặc kết hợp cả hai, tùy theo loại tác vụ.
Eleti cho biết nhóm phát triển đặc biệt cân nhắc sự khác biệt trong tốc độ tiếp nhận thông tin: con người thường nói nhanh hơn gõ, nhưng đọc văn bản lại thường nhanh hơn nghe toàn bộ một đoạn phản hồi bằng âm thanh.
Cuộc cạnh tranh trợ lý cá nhân chuyển sang thiết bị di động
Thị trường công nghệ tại Thung lũng Silicon gần đây chú ý nhiều hơn đến các trợ lý AI cá nhân. Các sản phẩm như Instinct và Muse của Meta đều đang thử xử lý thay người dùng những công việc trực tuyến tốn thời gian. ChatGPT đã có nhiều năng lực tương tự, nhưng OpenAI chưa ra mắt một sản phẩm trợ lý cá nhân độc lập với phạm vi chức năng hẹp hơn.
Bản cập nhật giọng nói lần này đưa năng lực thực thi tác vụ hiện có của ChatGPT vào một giao diện phù hợp hơn với bối cảnh di động. Trong ngắn hạn, người dùng có thể giao cho ChatGPT một phần công việc trực tuyến khi đang đi bộ, di chuyển hoặc không tiện thao tác bằng tay.
Ngoài các tác vụ trên web, chế độ giọng nói cũng phù hợp với những hoạt động cần thực hành nói, chẳng hạn học ngôn ngữ và luyện thuyết trình. Các thành viên trong nhóm sản phẩm của OpenAI cũng sử dụng tính năng này khi đi làm hoặc đi bộ.
Giọng nói vẫn bị giới hạn bởi thiết bị và thói quen sử dụng
Việc phổ biến trợ lý giọng nói vẫn gặp một số hạn chế. Thị trường loa thông minh cho thấy giao tiếp bằng giọng nói có thể duy trì một nhóm người dùng nhất định, nhưng phần lớn môi trường làm việc vẫn được xây dựng quanh máy tính để bàn và bàn phím. Nhập liệu bằng giọng nói tuy thuận tiện nhưng không phải lúc nào cũng phù hợp với các công việc cần đối chiếu nhiều thông tin, xử lý dữ liệu nhạy cảm hoặc trải qua nhiều bước xác nhận.
Kế hoạch phần cứng của OpenAI cũng có thể thúc đẩy công ty mở rộng năng lực giọng nói sang các thiết bị độc lập. Công ty dự kiến ra mắt loa thông minh vào năm 2027. Nếu kế hoạch được triển khai, sự kết hợp giữa GPT-Live và mô hình thực thi tác vụ có thể trở thành một phương thức tương tác quan trọng trên sản phẩm phần cứng này.
Hiện tại, người dùng vẫn chủ yếu tiếp cận các tính năng liên quan thông qua ChatGPT trên web, ứng dụng di động và ứng dụng máy tính để bàn. Phạm vi thực tế của việc thanh toán, cấp quyền tài khoản và thao tác giữa nhiều ứng dụng vẫn phụ thuộc vào quyền hạn của sản phẩm cũng như môi trường sử dụng.