OpenAI ChatGPT की वॉयस क्षमताओं को बातचीत से आगे बढ़ाकर ऐसे कामों तक ले जा रहा है जिनमें कई ऑनलाइन चरण शामिल होते हैं। बुधवार से कंपनी का उन्नत GPT-Live वॉयस सिस्टम ChatGPT के वेब और मोबाइल ऐप्स में उपलब्ध होगा। इसके जरिए यूजर ब्राउज़र और अलग-अलग ऐप्स से जुड़े कामों के लिए बोलकर निर्देश दे सकेंगे। यह कदम व्यक्तिगत AI असिस्टेंट बाजार में OpenAI की मौजूदगी बढ़ाता है और कंपनी की दीर्घकालिक हार्डवेयर योजनाओं से भी जुड़ा है।
GPT-Live अब आवाज के साथ काम भी करेगा
इस लॉन्च में OpenAI के वॉयस मॉडल GPT-Live को ऐसे AI मॉडल से जोड़ा गया है जो कंप्यूटर या ब्राउज़र संचालित कर सकता है। GPT-Live यूजर की बात सुनकर रियल टाइम में जवाब दे सकता है। इसका इस्तेमाल पहले ChatGPT के सामान्य बातचीत वाले वॉयस मोड में होता था और इसे डेस्कटॉप ऐप में काम पूरा करने वाले मॉडलों से भी जोड़ा जा चुका है।
ChatGPT के वॉयस उत्पाद का नेतृत्व करने वाले Atty Eleti ने सिस्टम का प्रदर्शन किया। उन्होंने केवल वॉयस कमांड का इस्तेमाल करते हुए ChatGPT से DoorDash पर अपने खर्च का विश्लेषण करने, पिकलबॉल कोर्ट बुक करने के लिए 5 डॉलर का भुगतान करने और अपना कैलेंडर व्यवस्थित करने को कहा। इस क्रम में खर्च से जुड़ा डेटा, भुगतान और निजी शेड्यूलिंग शामिल थे। इससे संकेत मिलता है कि यह सुविधा केवल सवालों के जवाब देने तक सीमित नहीं है, बल्कि यूजर की ओर से ऑनलाइन कार्रवाइयों की श्रृंखला पूरी करने के लिए बनाई गई है।
Eleti ने कहा कि OpenAI लंबे समय में चाहता है कि लोग AI के साथ मुख्य रूप से आवाज के जरिए बातचीत करें। उनके अनुसार, बोलना यूजर और मशीन के बीच प्रमुख इंटरफेस में से एक बन सकता है। उन्होंने इसे टीम की दीर्घकालिक दिशा बताया।
15 करोड़ से अधिक लोग वॉयस और डिक्टेशन का इस्तेमाल कर रहे हैं
Eleti के मुताबिक, फिलहाल 150 मिलियन से अधिक लोग ChatGPT के डिक्टेशन और वॉयस-मोड टूल्स का इस्तेमाल करते हैं। टाइप करने की तुलना में वॉयस इनपुट कई स्थितियों में तेज और स्वाभाविक हो सकता है। इससे यूजर बिना डिवाइस उठाए विचार दर्ज कर सकते हैं या चलते-फिरते और यात्रा के दौरान कुछ काम कर सकते हैं।
OpenAI ने यह भी स्पष्ट किया कि वॉयस मोड में हर इनपुट और जवाब बोलकर देना जरूरी नहीं है। यूजर आवाज से अनुरोध कर सकता है, जबकि ChatGPT काम के अनुसार टेक्स्ट, ऑडियो या दोनों के संयोजन में जवाब दे सकता है। Eleti ने कहा कि अनुभव तैयार करते समय टीम ने एक व्यावहारिक अंतर को ध्यान में रखा: आम तौर पर बोलना टाइप करने से तेज होता है, जबकि पूरा जवाब सुनने की तुलना में टेक्स्ट पढ़ना अक्सर जल्दी हो जाता है।
व्यक्तिगत AI असिस्टेंट की प्रतिस्पर्धा मोबाइल तक पहुंची
सिलिकॉन वैली में व्यक्तिगत AI असिस्टेंट पर ध्यान बढ़ रहा है। Instinct और Meta का Muse जैसे उत्पाद भी यूजर की ओर से नियमित ऑनलाइन काम संभालने के लिए विकसित किए जा रहे हैं। ChatGPT में पहले से ऐसी कई क्षमताएं मौजूद हैं, लेकिन OpenAI ने अभी तक केवल व्यक्तिगत असिस्टेंट पर केंद्रित कोई अलग उत्पाद लॉन्च नहीं किया है। नया वॉयस अपडेट उसके मौजूदा काम-निष्पादन टूल्स को मोबाइल इस्तेमाल के लिए अधिक उपयुक्त इंटरफेस देता है।
निकट अवधि में यूजर चलते समय, यात्रा के दौरान या दोनों हाथों से डिवाइस संचालित न कर पाने की स्थिति में कुछ ऑनलाइन काम ChatGPT को सौंप सकते हैं। वॉयस मोड भाषा सीखने और बोलने के अभ्यास जैसे उन कार्यों में भी उपयोगी हो सकता है जिनमें बोलना स्वाभाविक रूप से शामिल है। OpenAI की उत्पाद टीम के सदस्यों ने यात्रा और पैदल चलते समय इस सुविधा का इस्तेमाल किया है।
डिवाइस की सीमाएं और यूजर की आदतें अब भी अहम
वॉयस असिस्टेंट के सामने व्यावहारिक सीमाएं बनी हुई हैं। स्मार्ट-स्पीकर बाजार ने दिखाया है कि वॉयस इंटरैक्शन के लिए लगातार यूजर आधार मौजूद हो सकता है, लेकिन अधिकांश ऑफिस वर्कफ्लो अब भी डेस्कटॉप कंप्यूटर और कीबोर्ड पर आधारित हैं। वॉयस इनपुट सुविधाजनक हो सकता है, पर विस्तृत डेटा जांच, संवेदनशील जानकारी या कई पुष्टि चरणों वाले हर काम के लिए यह उपयुक्त नहीं होगा।
OpenAI की हार्डवेयर योजनाएं भी उसकी वॉयस क्षमताओं को अलग डिवाइस की दिशा में ले जा रही हैं। कंपनी 2027 में एक स्मार्ट स्पीकर लॉन्च करने की योजना बना रही है। यह योजना आगे बढ़ती है तो GPT-Live और काम पूरा करने वाले AI मॉडल उस हार्डवेयर के प्रमुख इंटरैक्शन माध्यमों में शामिल हो सकते हैं। फिलहाल यूजर इन क्षमताओं का इस्तेमाल मुख्य रूप से ChatGPT के वेब, मोबाइल और डेस्कटॉप ऐप्स के जरिए करते हैं। भुगतान, अकाउंट की अनुमति और अलग-अलग ऐप्स में की जाने वाली कार्रवाइयों का दायरा उत्पाद की अनुमतियों और यूजर के ऑपरेटिंग वातावरण पर निर्भर रहेगा।