音声モードで沖縄旅行を相談したら、
地名が耳を素通りした

  • 二泊三日のプランを声で相談したら、知らない地名と数字が流れていくだけで、何も残りませんでした。
  • なめらかになった理由は二段階です。文字起こしを挟むのをやめて音声をそのまま扱うようになり、次に聞くことと話すことを同時にやるようになりました。
  • 2026年7月のGPT-Liveは、会話のテンポを自分で持ちながら、検索や込み入った推論は裏の大きなモデルに渡します。
  • キーボード、マウス、タッチと同じで、声も前の操作を追い出しません。主役が入れ替わる途中の、まだ大仰に見える段階です。

関連記事

1. 沖縄旅行の相談を、声だけでやってみた

二泊三日で沖縄に行こうと思って、ChatGPTの音声モードに聞いてみました1。 返ってきたのは、斎場御嶽、奥武島の天ぷら、瀬長島ウミカジテラス、備瀬のフクギ並木。 どれも初めて聞く名前で、耳を通り過ぎていきました。

多すぎてイメージできない、と伝えると、海と街をゆったり、というテーマに絞り直してくれました。 移動を減らす、拠点は一箇所。 この抽象度なら声でも追えます。

ところが予算の話で、また同じことが起きました。 一人十万から十五万、航空券が二万から五万、ホテル二泊で二万から五万。 数字が並んだ瞬間、何も残らない。 メモを取ろうかと思って、メモを取らなくていいから声で話しているのに、と気づきました。

2. なめらかになった正体は、文字起こしをやめたこと

2.1. 音声認識と読み上げで挟んでいた頃

最初のChatGPTの音声機能は、三つのモデルを直列につないだものでした2。 音声認識でこちらの声を文字にして、言語モデルが文字で答えを作り、音声合成でそれを読み上げる。 カスケード型(cascaded:数珠つなぎ)と呼ばれる方式で、モデルの間で情報が失われ、応答は遅く硬いものになりました3

失われるものは想像がつきます。 声の高さ、ためらい、笑い。 文字に落とした時点で捨てられるので、迷いながら「うーん」と言っても、モデルが受け取るのは三文字でした。

2024年のAdvanced Voice Modeで、音声を一つのモデルが直接扱うようになり、間は縮みました4。 ただしターン制で、こちらが話し終わるのを待ってから返します。

その「話し終わった」の判定は、無音でした5。 ちょっと考え込んだだけで話をさえぎられる。 言い淀みの多い人ほど不利な仕組みです。

2.2. 聞きながら話す

2026年7月8日、OpenAIはGPT-Liveという新しい音声モデルを出して、ChatGPTの音声モードを置き換えました。 特徴は全二重(full-duplex:送受信を同時に行う方式)で、聞くことと話すことを並行して処理します6

だから相槌が打てます。 こちらが考えている間は黙っていることもできる。 実際の会話ログを見返すと、私が「〜するんだよね」と言い終わる前に「うん。」が挟まっていました。

有料プランはGPT-Live-1、無料プランはGPT-Live-1 miniが既定になっています7。 GeminiのGemini Liveも、割り込みができて話題が飛んでも文脈を保つ点を押し出しています8

2.3. 速さと賢さを分ける

気になったのは、「少々お待ちを」が異様に多いことでした。 ただの間つなぎではなくて、内部の役割分担が透けています。

会話のテンポはGPT-Liveが持ち、検索や込み入った作業は背後の大きなモデルに投げる構造になっています9。 返事の速さと考える深さを、別々のモデルが担当している。 どれくらい考えさせるかを、こちら側で選べるようにもなりました10

だから相場や地名が出てくる前には、たいてい待ちが入ります。 会話そのものは途切れないのに、待たされている感覚だけは残る。 このあたりは、まだ縫い目が見えています。

3. 得意なのは、まだ言葉になっていない段階

3.1. 話しながら考えるか、見比べながら考えるか

使い分けの軸は、目的がぼんやりしているか固まっているか、ではないと思います。 話しながら考えたいのか、見比べながら考えたいのか。 この違いの方がしっくりきます。

どこへ行こうか決めかねている段階は、声で洗い出す方が自然です。 沖縄に決めて日程を表にする段階は、画面の方が圧倒的に楽11

切り替えの合図になるのは固有名詞だと思いました。 斎場御嶽と聞いて「それ何」と思った時点で、もう見比べる側に入っています。 声で進めるなら、世界遺産をひとつ、水族館を中心に、くらいの粒度に留めておく方が疲れません。

3.2. 声の横に画面が出てくると、境目は消える

話しながら、必要なときだけ写真や地図が横に出てくる。 そうなれば、音声か画面かを選ぶ必要そのものが消えます。

3.2. 声の横に画面が出てくると、境目は消える

これは、コンセプト画像ですが、このように話しながら、リアルタイムで画像が出てくれば、人と雑誌を見ながら旅行計画をするようなイメージになります。

部分的には始まっています。 GPT-Liveでは、会話中に天気や株価、スポーツ、地図といったカードが画面に出るようになりました12。 Gemini Liveはさらに前から、カメラと画面共有に対応しています13

とはいえ、こちらから見せる方はまだ揃っていません。 GPT-Liveは登場時点でビデオや画面共有に対応しておらず、使いたければ従来の音声モードに戻る必要があります14。 つまり今は、切り替えを人間の側が意識しています。

4. 主役が入れ替わるだけで、前の操作は残る

キーボードだけでコンピューターを動かしていた時代があって、マウスとウィンドウが来て、タッチの時代になりました。 けれど、どれも消えていません。 私は今もキーボードを叩いてこの文章を書いています。

新しい操作方法が出てくると、前のものが追い出されるのではなく、主役が入れ替わる。 そして場面ごとに、勝手に選ばれるようになります。

画面を指でベタベタ触るなんて汚い、と言われていた頃がありました。 今それを言う人はいません。 スマートフォンに向かって声で喋るのは、まだ少し大仰です。

技術の方は、思っていたより先に進んでいました。 割り込めるし、相槌も返ってくる。 開発する側も、音声はもっと長く複雑な仕事に使えるようになると見ています15。 それでも使いどころが定まらないのは、慣れと場面がまだ揃っていないからだと思います。

今のところ、旅行の計画を最後まで声で済ませる気にはなれません。 それでも、地名を聞き取れないまま数分間おしゃべりが成立したこと自体、数年前には無かったことです。 使い道が見つからないまま、たまに話しかけてみる。 そのうち、理屈より先に慣れの方が来るのかもしれません。

  1. OpenAIによれば、ChatGPTのVoiceやDictationを使って話しかける人は週に1億5000万人を超えています。 – Introducing GPT‑Live
  2. 2023年9月、ChatGPTが見る・聞く・話すようになったとして音声と画像の入力が追加されたときの構成です。 – ChatGPT can now see, hear, and speak
  3. OpenAIは、この構成で初めてフロンティアモデルと会話できるようになった一方、複雑さの代償として情報の欠落と遅く不自然な応答が生じたと振り返っています。 – Introducing GPT‑Live
  4. GPT-4oの発表時に示された方式で、音声の処理と生成を単一モデル内で行うことで遅延を減らしました。 – Hello GPT-4o
  5. 沈黙を手がかりにターンの終わりを検出するため、短い間や周囲の物音を発話の終了と取り違えて、不自然なタイミングで割り込むことがあったとOpenAIは説明しています。 – Introducing GPT‑Live
  6. 入力を受け取りながら出力を生成し続ける構成で、話すか、聞き続けるか、間を置くか、割り込むか、道具を呼ぶかを毎秒何度も判断しているとされます。 – Introducing GPT‑Live
  7. Go、Plus、ProのユーザーにはGPT-Live-1、無料ユーザーにはGPT-Live-1 miniが音声モードの既定モデルとして提供されます。 – Introducing GPT‑Live
  8. Googleは、45を超える言語で自然に流れる会話ができる機能として紹介しています。 – 5 ways to use Gemini Live with camera and screen sharing
  9. 提供開始時点ではGPT-5.5を裏で使い、新しいフロンティアモデルが出るたびに差し替えていく方針が示されています。 – Introducing GPT‑Live
  10. 即答のInstantに加えて、時間をかけて考えるMediumとHighが選べます。 – Introducing GPT‑Live
  11. 音声モードのままでも検索やメモリ、画像、ファイル添付は使えるので、画面へ移りたくなる理由は機能の不足ではなく、見比べる作業そのものにあります。 – Introducing GPT‑Live
  12. 答えによっては見た方が早いものがあるとして、会話を続けたまま視覚的なカードを表示する機能が加わっています。 – Introducing GPT‑Live
  13. カメラを向けたものについて質問したり、表示中の画面を共有して相談したりでき、共有中も会話を中断せずに切り替えられます。 – Gemini Live: Use Camera & Screen Sharing on Android
  14. OpenAIは近く対応を進めるとしたうえで、当面はStandardやAdvanced Voice Modeを使うよう案内しています。 – Introducing GPT‑Live
  15. OpenAIは、この研究によって音声を使ったより複雑で長時間の、エージェント的な作業が可能になると考えていると書いています。 – Introducing GPT‑Live