OpenAI erweitert die Sprachfunktionen von ChatGPT um mehrstufige Online-Aufgaben. Ab Mittwoch integriert das Unternehmen sein fortgeschritteneres Sprachsystem GPT-Live in die Web- und Mobil-Apps von ChatGPT. Nutzer können damit per Sprache Anweisungen für Vorgänge geben, die Browser und mehrere Anwendungen einbeziehen. Das stärkt OpenAIs Position im Markt für persönliche KI-Assistenten und unterstützt die langfristigen Hardwarepläne des Unternehmens.
GPT-Live verbindet Sprache mit konkreten Aktionen
Mit der Einführung wird OpenAIs Sprachmodell GPT-Live an ein KI-Modell angebunden, das Computer und Browser bedienen kann. GPT-Live hört den Nutzern zu und antwortet in Echtzeit. Zuvor kam das System bereits im normalen Sprachmodus von ChatGPT zum Einsatz und war in der Desktop-Anwendung mit Modellen für die Ausführung von Aufgaben verknüpft.
Atty Eleti, der bei OpenAI für das Sprachprodukt von ChatGPT verantwortlich ist, demonstrierte die Funktionsweise. Ausschließlich per Sprachbefehl ließ er seine Ausgaben bei DoorDash analysieren, 5 US-Dollar für die Reservierung eines Pickleball-Platzes bezahlen und seinen Kalender neu organisieren. Die Abfolge umfasste Finanzdaten, eine Zahlung und persönliche Terminplanung. Damit soll die Sprachfunktion nicht nur Fragen beantworten, sondern auch mehrere Online-Aktionen nacheinander ausführen können.
Eleti zufolge möchte OpenAI, dass Menschen künftig vor allem per Sprache mit KI interagieren. Sprache soll demnach zu einer der wichtigsten Schnittstellen zwischen Nutzern und Geräten werden. Er bezeichnete dies als langfristige Ausrichtung seines Teams.
Mehr als 150 Millionen Nutzer verwenden Spracheingabe
Nach Angaben von Eleti nutzen derzeit mehr als 150 Millionen Menschen die Diktier- und Sprachfunktionen von ChatGPT. Spracheingabe kann schneller und natürlicher sein als Tippen. Nutzer können Gedanken festhalten, ohne ein Gerät in die Hand zu nehmen, oder Aufgaben während des Pendelns und Gehens erledigen.
OpenAI betont zugleich, dass nicht jede Eingabe und Antwort gesprochen werden muss. Nutzer können eine Anfrage mündlich stellen, während ChatGPT je nach Aufgabe mit Text, Audio oder einer Kombination aus beidem antwortet. Bei der Entwicklung habe das Team einen praktischen Unterschied berücksichtigt: Sprechen ist meist schneller als Tippen, während das Lesen einer Textantwort häufig weniger Zeit beansprucht als das vollständige Anhören.
Wettbewerb um persönliche Assistenten erreicht das Smartphone
Persönliche KI-Assistenten stoßen im Silicon Valley auf wachsendes Interesse. Auch Produkte wie Instinct und Metas Muse sollen Routineaufgaben im Internet im Auftrag der Nutzer erledigen. ChatGPT bietet bereits viele dieser Funktionen, OpenAI hat bislang jedoch kein eigenständiges Produkt mit einem enger gefassten Assistenten-Schwerpunkt auf den Markt gebracht. Das Sprach-Update legt die bestehenden Werkzeuge zur Aufgabenausführung hinter eine Oberfläche, die sich besser für die mobile Nutzung eignet.
Kurzfristig können Nutzer bestimmte Online-Aufgaben abgeben, während sie unterwegs sind oder ein Gerät nicht mit beiden Händen bedienen können. Der Sprachmodus kann zudem bei Tätigkeiten nützlich sein, bei denen Sprechen selbst im Mittelpunkt steht, etwa beim Sprachenlernen und beim Sprechtraining. Mitglieder des OpenAI-Produktteams haben die Funktion nach Unternehmensangaben beim Pendeln und Gehen eingesetzt.
Geräte und Nutzungsgewohnheiten setzen weiterhin Grenzen
Sprachassistenten sind jedoch mit praktischen Einschränkungen konfrontiert. Der Markt für intelligente Lautsprecher zeigt zwar, dass Sprachinteraktion eine Nutzerbasis halten kann. Viele Arbeitsabläufe im Büro sind jedoch weiterhin auf Desktop-Computer und Tastaturen ausgerichtet. Spracheingabe kann bequem sein, eignet sich aber nicht zwangsläufig für Aufgaben mit umfangreichen Datenprüfungen, sensiblen Informationen oder mehreren Bestätigungsschritten.
Auch OpenAIs Hardwarepläne verstärken den Fokus auf sprachgesteuerte Funktionen für eigenständige Geräte. Das Unternehmen plant für 2027 die Einführung eines intelligenten Lautsprechers. Sollte dieser Plan umgesetzt werden, könnte die Kombination aus GPT-Live und Modellen zur Aufgabenausführung zu einer zentralen Bedienmethode der Hardware werden. Vorerst greifen Nutzer hauptsächlich über die Web-, Mobil- und Desktop-Apps von ChatGPT auf die Funktionen zu. Welche Zahlungen, Kontofreigaben und anwendungsübergreifenden Aktionen möglich sind, hängt weiterhin von den Produktberechtigungen und der jeweiligen technischen Umgebung des Nutzers ab.