2026年8月28日 金曜日
AI時短ラボ
プロダクト· 約6

OpenAI、全二重音声モデル『GPT-Live』を発表──聞きながら喋り、裏でGPT-5.5に委任する新設計

OpenAIがChatGPT Voiceの次世代モデル『GPT-Live』を全ユーザー向けに展開開始。全二重アーキテクチャで聞きながら同時に応答し、検索や推論はバックグラウンドでGPT-5.5に委任する。GPT-Live-1(有料)とGPT-Live-1 mini(無料)の2バージョン。API提供も予定。

OpenAI、全二重音声モデル『GPT-Live』を発表──聞きながら喋り、裏でGPT-5.5に委任する新設計
執筆・編集:
目次

3行まとめ

  1. OpenAIが全二重(フルデュプレックス)音声モデル「GPT-Live」を発表、ChatGPT Voice として全ユーザーに展開開始
  2. 会話担当と思考担当を分離──検索・推論が必要な質問はバックグラウンドでGPT-5.5に委任し、会話を途切れさせない
  3. GPT-Live-1(Go/Plus/Pro向け)とGPT-Live-1 mini(Free向け)の2モデル。API提供も予定

何が起きたか

OpenAIの公式発表によると、2026年7月8日、同社は音声モデルの新世代「GPT-Live」を発表し、iOS・Android・ChatGPT.comで全ユーザー向けに順次展開を開始した。GPT-Live-1がGo/Plus/Proユーザーのデフォルト、GPT-Live-1 miniがFreeユーザーのデフォルトとなる。

技術的に何が変わったか

OpenAIによると、GPT-Liveには2つのアーキテクチャ上の変更がある。

1. 全二重(フルデュプレックス)

従来の音声AIは「ユーザーが話し終わる→モデルが応答する」の交互式だった。GPT-Liveは聞きながら同時に喋れる全二重設計で、毎秒複数回「喋るか・聞き続けるか・黙るか・割り込むか・ツールを呼ぶか」を判断するとされている。

相槌(「mhmm」「got it」)を打つ、ユーザーが考え中なら待つ、といった振る舞いが可能になったとOpenAIは説明している。

2. 委任アーキテクチャ

会話のリアルタイム処理と、検索・推論などの重い処理を分離した。質問が検索や深い推論を必要とする場合、GPT-LiveはバックグラウンドでGPT-5.5に処理を委任し、結果が返るまで会話を続ける。OpenAIによると、今後新しいフロンティアモデルがリリースされるたびにバックグラウンドのモデルも更新される。

これまでの3世代

OpenAIは発表の中で、音声AIの進化を3段階で整理している。

世代 方式 制約
第1世代(旧ChatGPT Voice) カスケード型(音声→テキスト→LLM→音声合成の3モデル直列) 遅い、情報ロスが発生
第2世代(Advanced Voice Mode) ターンベース型(1モデルで音声入出力) 交互式のため沈黙を発話終了と誤検知して割り込む
第3世代(GPT-Live) 全二重+委任 後述の制限あり

評価

OpenAIによると、GPT-Live-1はAdvanced Voice Modeとの比較で以下のベンチマークを上回った。

  • GPQA(専門家レベルの科学的推論)で大幅に上回る
  • BrowseComp(エージェント型ウェブ検索)で強い改善
  • τ³-Voice Telecom(マルチターンのテレコムサポートタスク)で上回る

ただし具体的なスコアは発表に記載されておらず、ベンダー自社評価である点は留意が必要。

現時点の制限

  • ビデオ・画面共有は非対応(対応作業中とのこと。レガシー版のAdvanced Voice Modeでは引き続き利用可能)
  • 言語によってはアクセントや流暢さにムラがある
  • 声の模倣は不可(事前定義された9種の音声のみ)

安全対策

OpenAIによると、リアルタイムで安全でない出力を検知して軌道修正するセーフガードを組み込んでいる。出典のSystem Cardで実際に確認できた音声ネイティブ評価のカテゴリは、自傷(self-harm)、情緒的依存(emotional reliance)、性的内容(sexual content)、違法行為(illicit behavior)、残虐表現(gore)、詐欺・操作(scams and manipulation)、なりすまし・声のクローンなど多岐にわたり、記事の旧版が挙げていた「自傷・精神疾患・AI依存・暴力・性的内容の5領域」という整理はSystem Cardの区分と一致しなかった。10代ユーザー向けの追加保護と保護者コントロールについては、System Card内には該当する記載を確認できず、出典未確認のまま記載していた。詳細はSystem Cardに記載されている。

補足

毎週1億5,000万人以上がChatGPTの音声機能を利用しているとOpenAIは発表している。GPT-LiveのAPI提供も予定されており、通知登録フォームが公開されている。


出典: Introducing GPT-Live — OpenAI / GPT-Live System Card

本記事の情報はOpenAIの公式発表(2026年7月8日付)に基づく。ベンチマーク数値はベンダー自社評価であり、独立した第三者検証は記事執筆時点で確認されていない。

シェア: ポスト はてブ

出典・参照資料

更新・訂正履歴

  • 安全対策の5領域(自傷 精神疾患 AI依存 暴力 性的内容)という整理を削除。出典のGPT-Live System Card(deploymentsafety.openai.com)を実際に取得して確認したところ、評価カテゴリはself-harm emotional reliance sexual content illicit behavior gore scams and manipulation impersonation voice cloningなどで記事の5領域という区分とは一致しなかった。10代ユーザー向け保護と保護者コントロールの記載もSystem Card内には見当たらず出典未確認だった旨を明記した。GPT-Live-1が有料ユーザーのデフォルトでGPT-Live-1 miniが無料ユーザーのデフォルトという記述はSystem Cardの記載と一致することを確認した。なお主出典であるopenai.com配下の発表本文(introducing-gpt-live)はbot対策のブロックにより取得できず GPQA BrowseComp τ3-Voice Telecomのベンチマーク主張や週間1億5000万人以上という利用者数は今回裏取りできていない。

AIニュースの解説を動画でも

YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

新しい記事をメールで受け取る

AIの新しい発表を、出典付きで整理して届けます。

関連記事