OpenAIは、ChatGPTの音声機能を会話ツールから実務をこなす個人向けアシスタントへと拡張する。今週水曜日、より高度な音声システムをChatGPTのウェブ版とモバイルアプリに導入し、ユーザーが音声で指示するだけで、ブラウザーや複数のアプリをまたぐ複数段階の作業を処理できるようにする。今回の更新は、個人向けAIアシスタント市場への参入を深めるとともに、将来のハードウエア展開を見据えた動きでもある。
GPT-Liveと作業実行モデルを接続
今回の発表では、OpenAIの音声モデル「GPT-Live」を、コンピューターやブラウザーを操作できるAIモデルと接続する。GPT-Liveはユーザーの発話を聞きながら応答できる仕組みで、これまではChatGPTの基本的な音声対話モードに使われていたほか、デスクトップアプリでは作業実行能力を持つモデルとも連携していた。
ChatGPTの音声製品責任者であるAtty Eleti氏は、デモンストレーションで具体的な利用例を示した。同氏は音声だけを使い、DoorDashで自身の支出履歴を分析させ、5ドルを支払ってピックルボールコートを予約し、さらにカレンダーの予定を組み直した。支出情報の確認、決済、個人のスケジュール管理を一連の操作で処理したことは、音声機能が質問への回答にとどまらず、オンライン上の作業を代行する方向へ広がっていることを示す。
Eleti氏は、OpenAIが将来的に、ユーザーとAIの主な接点を音声にしたいと考えていると説明した。音声を人とAIの主要な対話手段の一つに位置付けることは、チームが進める長期的な方向性だという。
音声入力と読み上げの利用者は1億5,000万人超
Eleti氏によると、現在、ChatGPTのディクテーション機能と音声モードは1億5,000万人を超えるユーザーが利用している。音声入力の利点は、入力が速く自然なことだ。端末を手に取らずに考えを伝えられるため、通勤中や散歩中に作業を進める用途にも向く。
OpenAIは、音声モードを使った場合でも、入力と出力のすべてが音声になるわけではないと説明している。ユーザーは音声で依頼し、システムは作業内容に応じて、テキスト、音声、または両方を組み合わせて返答できる。Eleti氏は、応答形式の設計では、話す方が通常はタイピングより速い一方、長い音声を最後まで聞くより、文章を読む方が速い場合もあるという実用上の違いを考慮したと述べた。
個人向けAIアシスタントの競争がモバイルへ
シリコンバレーでは最近、個人向けAIアシスタントへの関心が高まっている。InstinctやMetaの「Muse」などの製品は、煩雑なウェブ上の作業をユーザーに代わって処理することを目指している。ChatGPTはすでにその一部の機能を備えているが、OpenAIはこれまで、機能を絞り込んだ独立型の個人向けアシスタントを投入していない。
今回の音声機能の拡張は、ChatGPTが持つ作業実行能力を、モバイル環境に適した操作入口へ移すものとなる。短期的には、ユーザーが歩行中や通勤中、あるいは両手がふさがって端末を操作しにくい状況で、一部のオンライン作業をChatGPTに任せられる。ウェブ上の作業に加えて、音声モードは語学学習やスピーチ練習のように、声に出して取り組む用途にも適している。OpenAIの製品チームも、通勤や散歩の際にこの機能を利用しているという。
音声操作には端末と利用環境の制約も
音声アシスタントの普及には、なお制約がある。スマートスピーカー市場は、音声による操作に一定の利用者を定着させられることを示した一方、オフィスの多くは依然としてデスクトップパソコンとキーボードを中心に設計されている。音声入力は手軽だが、大量の情報を照合する作業、機密性の高いデータを扱う作業、複雑な確認手順を伴う作業のすべてに適しているとは限らない。
OpenAIのハードウエア計画も、音声機能を独立した端末へ広げる動きを後押ししている。同社は2027年にスマートスピーカーを発売する計画だ。計画が実現すれば、GPT-Liveと作業実行モデルの組み合わせが、ハードウエア製品の主要な操作手段になる可能性がある。ただし現時点でユーザーが関連機能を利用する主な経路は、ChatGPTのウェブ版、モバイルアプリ、デスクトップアプリだ。決済、アカウント認証、アプリをまたぐ操作の範囲は、製品の権限設定と実際の利用環境に左右される。