OpenAI
このページは機械翻訳されています。元の英語の記事を表示

ChatGPT 音声モード

ChatGPT と自然で自由な音声会話ができます。

更新日: yesterday

概要

ChatGPT 音声モードとは?

ChatGPT 音声モードでは、ChatGPT と話し、音声で応答を聞くことができます。音声モードはチャット内で動作するため、応答をテキストで追いながら聞いたり、話せないときに入力したり、最初からやり直さずに以前のメッセージを確認したりできます。

1 件の録音を編集可能なテキストに変換したい場合は、ChatGPT Dictation を使用してください。

Live オプションでは、同時に聞き取りと発話ができるため、発話の交代や割り込みがより自然に感じられます。Live は、アカウントでこれらの機能を利用できる場合、ウェブ検索やメモリの使用、対応ウィジェットによる視覚的な結果の表示、テキストや画像の処理もできます。

ChatGPT は誤りを犯すことがあります。特に日付、時間、場所に左右される質問では、重要な情報を確認してください。音声モードは、「今日」や「明日」などの語句を理解するために、デバイスまたはブラウザのタイムゾーンを使用します。回答がずれているように思える場合は、タイムゾーンを確認するか、質問に正確な日付、タイムゾーン、場所を含めてください。ChatGPT と正確性について詳しく見る

利用できる音声オプションは?

設定 → 音声に次のオプションが表示される場合があります。

  • Live: 最新の音声体験です。有料プランでは GPT-Live-1、無料版では GPT-Live-1 mini により提供されます。Live は自然な双方向の会話向けに設計されており、ウェブ検索やメモリの使用、対応ウィジェットによる視覚的な結果の表示、同じチャット内でのテキストや画像の処理ができます。Live は当初、動画、画面共有、接続済みアプリ、プラグインには対応していません。

  • Advanced: 以前のリアルタイム音声体験です。動画や画面共有など、対応しているモバイル機能が必要な場合は Advanced を使用します。

  • Standard: 応答を生成する前に発話を文字起こしする、ターン制の音声体験です。

利用できるオプションは、プラン、ワークスペース設定、地域、アプリのバージョンによって異なる場合があります。

利用可能なオプションを切り替えるには、設定 → 音声を開き、LiveAdvanced、または Standard を選択します。

Business、Enterprise、Edu、Healthcare ワークスペースでの提供状況

ChatGPT 音声モードは、ワークスペース設定に従い、対象となる Business、Enterprise、Edu、Healthcare ワークスペースで利用できます。

2 種類の音声体験を利用できます。

  • Chat の音声モード: 自然なリアルタイム会話で、質問したり、ブレインストーミングしたり、アイデアを探求したりできます。GPT-Live により提供される Chat の音声モードは、Desktop Chat と、対応しているウェブ、iOS、Android の体験で利用できます。

  • Work と Codex の音声モード: 音声を使ってタスクを開始し、進捗を確認し、エージェントについて質問し、1 つの会話で複数のエージェントを調整できます。macOS と Windows の ChatGPT デスクトップアプリで利用でき、ペアリングされた iOS リモートアクセスにも対応しています。Work と Codex のスタンドアロン音声モードは、ウェブまたはモバイルでは利用できません。

Enterprise、Edu、Healthcare ワークスペースでは、Live は 2 週間の早期アクセス期間から開始されます。この期間中、メンバーが Live を使用するには、ワークスペースのオーナーが高度な音声機能Early Model Access の両方を有効にする必要があります。

両方の設定を有効にすると、メンバーは設定 → 音声で Live を選択できます。既存の高度な音声モードの会話は、早期アクセス期間中に自動的に Live に切り替わることはありません。

高度な音声機能がオフの場合、音声モードは利用できません。高度な音声機能が有効で Early Model Access がオフの場合、メンバーは Advanced Voice を引き続き使用できますが、Live は利用できません。

早期アクセス期間の終了後、高度な音声機能が有効なワークスペースでは Live がデフォルトの音声体験になります。ワークスペースのオーナーは、高度な音声機能を無効にすることで音声モード全体をオフにできます。

使用制限

Live の使用量はローリング方式の 24 時間単位で測定され、制限は変更される場合があります。制限に達すると ChatGPT から通知されます。

  • ChatGPT Pro($200/月): GPT-Live-1 への無制限アクセス。

  • ChatGPT Pro($100/月): 即時モードの応答性能で GPT-Live-1 を最大 12 時間、中程度または高の応答性能で 12 時間、GPT-Live-1 mini を 24 時間まで利用できます。

  • ChatGPT Go および Plus: 即時モードの応答性能で GPT-Live-1 を最大 1 時間、中程度または高の応答性能で 1 時間、GPT-Live-1 mini を 2 時間まで利用できます。

  • ChatGPT 無料版: ローリング方式の各 24 時間内で GPT-Live-1 mini への限定アクセス。この制限は変更される場合があります。

  • ChatGPT Business: 即時モードの応答性能を使用する Live を最大 1 時間、中程度または高の応答性能を使用する Live を 1 時間まで利用できます。追加使用分は 1 分あたり 5 クレジットを消費します。

  • 従量課金の ChatGPT Enterprise、Edu、Healthcare ワークスペース: Live は 1 分あたり 5 クレジットを消費します。

  • 従来の ChatGPT Enterprise および Edu プラン: Live を最大 1 時間、Live mini を 2 時間まで利用できます。

1 回の Live 会話は最大 2 時間続けられます。

詳しくは、Business、Enterprise、Edu 向け ChatGPT 料金表をご覧ください。

音声会話の開始

iOS と Android の場合

  • メッセージバーの音声アイコンを選択します。

  • 求められたら、ChatGPT アプリによるマイクへのアクセスを許可します。

  • 初めての音声会話の場合は、優先する音声を選択します。

  • 音声モードが開いたら、話し始めて会話を開始します。

会話中は、マイクコントロールを選択して自分をミュートまたはミュート解除します。音声会話を終了するには、終了コントロールを選択します。

ウェブの場合

  • ChatGPT.com にアクセスします。

  • プロンプトウィンドウの音声アイコンを選択します。

  • 求められたら、ブラウザによるマイクへのアクセスを許可します。

  • 音声モードが開いたら、話し始めて会話を開始します。

会話中は、マイクコントロールを選択して自分をミュートまたはミュート解除します。音声会話を終了するには、終了コントロールを選択します。

Live でテキストと画像を使用

Live では、音声会話と同じチャットでテキストと画像を受け付けることができます。音声モードが有効な間は、メッセージバーの追加ボタンを使用して利用可能な画像を添付するか、話す代わりにメッセージを入力します。ChatGPT は別のチャットを開始せずに音声で応答できます。

利用できる画像の種類と制限は、プランとアカウントによって異なります。

現在、Live は ChatGPT Library からファイルを検索または追加できません。アカウントによっては、対応しているファイルを手動でチャットに添付できる場合があります。

動画または画面の共有

Live はリリース時点では動画や画面共有に対応していません。

動画と画面共有は、Advanced を使用している場合、対象のサブスクライバーが ChatGPT iOS および Android アプリで引き続き利用できます。

  • ライブ動画を共有するには、音声会話中にカメラボタンを選択します。共有を停止するには、もう一度選択します。

  • 画面を共有するには、その他のオプションメニューを選択し、画面を共有を選択して、デバイスの案内に従います。

  • 画面共有を停止するには、ChatGPT に戻り、画面共有コントロールをもう一度選択します。デバイスのシステム画面共有コントロールから共有を停止することもできます。

動画または画面共有の制限に達した場合でも、新しい動画または画面共有入力を開始せずに音声会話を続けられる場合があります。

優先する音声の変更

設定 → 音声を開き、音声を選択して次のオプションから選びます。

  • Arbor — 親しみやすく万能

  • Breeze — 表情豊かで誠実

  • Cove — 落ち着きがあり率直

  • Ember — 自信があり前向き

  • Juniper — オープンで明るい

  • Maple — 陽気で率直

  • Sol — 気が利いてリラックスした雰囲気

  • Spruce — 穏やかで肯定的

  • Vale — 明るく好奇心旺盛

音声会話中に選択中の音声を変更すると、同じチャット内で新しい音声通話が開始されます。

優先する言語の変更

設定 → 音声を開き、言語を選択します。最もよく話す言語を選択すると、ChatGPT が音声をより正確に理解しやすくなります。音声会話中に、別の言語で話すよう ChatGPT に依頼することもできます。

応答スタイルの変更

現在、ChatGPT のプリセットのパーソナリティは Live には適用されません。

個別の音声会話中に、口調、話す速さ、応答スタイルの変更を ChatGPT に依頼することはできます。

ChatGPT に話す速度を速くまたは遅くするよう依頼できますが、現在、正確な再生速度コントロールは利用できません。

応答性能レベルの変更

お使いのアカウントで応答性能設定を利用できる場合は、設定 → 音声 → 応答性能を開き、即時モード中程度、またはを選択します。この設定は、音声会話中に ChatGPT がより難しい質問をどのように処理するかを制御します。利用できるレベルはプランによって異なる場合があります。

応答性能レベルが高いほど、特に音声モードでウェブを検索する場合、応答に時間がかかることがあります。

CarPlay で音声モードを使用

対応している iPhone の Apple CarPlay で ChatGPT を利用できます。CarPlay 画面から、音声会話を開始したり、最近のチャットやピン留めしたチャットを続けたり、プロジェクト内で会話を開始したりできます。CarPlay での ChatGPT の使用について詳しく見る

モバイルデバイスは、法律で認められ、安全に使用できる状況でのみ使用してください。運転前にアプリを設定し、車両の走行中はデバイスを操作しないでください。

バックグラウンドで会話を継続

他のアプリを使用している間やスマートフォンがロックされている間も音声会話を続けるには、設定 → 音声バックグラウンド会話をオンにします。

バックグラウンド会話は、ユーザーが終了したとき、アプリを強制終了したとき、使用制限に達したとき、または最大セッション時間に達したときに終了します。Advanced で画面を共有している場合、共有を停止したとき、または画面をロックしたときにも画面共有は終了します。

ChatGPT を音声モードで開始

対応しているモバイルアプリのバージョンでは、設定 → 音声音声で開始をオンにします。この設定がオンの場合、新規または空の会話で ChatGPT を開くと、音声モードが自動的に開始されます。

CarPlay で音声モードを自動開始するには、設定 → 音声CarPlay で自動的に開始をオンにします。この設定は、CarPlay で ChatGPT を使用した後に表示されます。

データコントロール

OpenAI は音声クリップと動画クリップをどのくらい保持しますか?

Live および高度な音声モードの会話の音声クリップと、高度な音声モードの会話の動画クリップは、チャット履歴に表示される文字起こしとともに保存されます。クリップは 30 日間保持されます。

チャットを削除すると、当社のプライバシーポリシーに記載されているセキュリティ、安全性、法的理由により保持する必要がある場合、またはモデルのトレーニングに役立てるために以前クリップの共有を選択し、すでにアカウントとの関連付けが解除されている場合を除き、関連する音声クリップと動画クリップも 30 日以内に削除されます。

関連する音声または動画データを含め、チャットの削除は元に戻せません。アーカイブはチャットをサイドバーから削除するだけで、チャットや関連する音声クリップまたは動画クリップを削除するものではありません。

Standard では、ChatGPT が応答を生成する前に音声が文字起こしされます。モデルのトレーニングに役立てるために音声の共有を選択している場合を除き、文字起こしが完了すると音声は削除されます。文字起こしに失敗した場合でも、音声は削除されます。

OpenAI は音声クリップや動画クリップをモデルのトレーニングに使用しますか?

モデルのトレーニングに役立てるために音声クリップまたは動画クリップの共有を選択した場合、または OpenAI アカウント設定で「音声録音を含める」または「動画録画を含める」トグルを有効にした場合を除き、使用しません。データコントロールについて詳しくはこちらをご覧ください。

すべての人のためにモデルを改善するがオンの場合、プランと設定によっては、音声会話の文字起こしやその他のファイルをモデルのトレーニングに使用することがあります。上記のとおり、モデル改善のために共有することを選択しない限り、関連する音声クリップまたは動画クリップをトレーニングに使用することはありません。

個人ワークスペースの Free、Plus、Pro ユーザーは、設定 → データコントロールを開き、すべての人のためにモデルを改善するをオンにしてから、音声録音を含めるまたは動画録画を含めるをオンにすることで、クリップの共有を選択できます。ChatGPT Business、Enterprise、または Edu ワークスペースでは、ユーザーは音声会話の音声クリップや動画クリップを共有できません。

音声クリップまたは動画クリップの共有を選択した場合、ChatGPT が聞き間違えたり解釈を誤ったりした箇所を理解するなど、モデルの動作改善に役立てるため、当社のチームが共有クリップを確認することがあります。共有クリップをトレーニングに使用する前に、クリップ内の個人情報の量を減らすための措置を講じます。

共有を停止すると、新しいクリップは当社のモデルのトレーニングに使用されなくなります。以前にお客様のアカウントとの関連付けが解除されたクリップは、引き続き使用される場合があります。この選択はアカウントに紐づけられ、ログインしているすべてのデバイスに適用されます。

データコントロールについて詳しく見るおよびモデルのパフォーマンス向上のためにデータがどのように使用されるかをご覧ください。

よくある質問

ChatGPT が話している間に話せますか?

はい。Live は同時に聞き取りと発話ができるため、ChatGPT が応答している間に割り込んだり、話し続けたりできます。ChatGPT は会話の最新部分に沿うように動作しますが、発話の重なり、背景音、ネットワーク状況、マイク設定によって、聞き取る内容が影響を受けることがあります。

複数の人が同時に ChatGPT に話しかけられますか?

Live は主に 1 対 1 の会話向けに設計されています。背景音には対応できますが、複数の話者との会話にはまだ最適化されていません。人々が ChatGPT ではなく互いに話しているときに、応答する場合があります。

ChatGPT が割り込んだり、話すのをやめたりするのはなぜですか?

背景音、長い沈黙、別の話者の音声がある場合などは、割り込みが発生することがあります。ヘッドフォンを使用する、より静かな場所に移動する、デバイスの音量を上げるなどをお試しください。iPhone では、音声会話中にコントロールセンターを開き、マイクモードを選択して、声を分離をオンにすることもできます。

考えを声に出している間、音声モードに待ってもらえますか?

会話の開始時に、応答の準備ができるまで待つよう Live に依頼できます。たとえば、「私が答えてと言うまで待ってください」と伝えます。ただし、長い沈黙、背景の話し声、その他の音によって Live が応答する場合があります。

Live は GPTs、Work、Codex で使えますか?

macOS と Windows の ChatGPT デスクトップアプリから、ChatGPT 音声モードは Work または Codex で利用可能なツールと権限を使って、コンピューターを操作し、複数のエージェント間で連携できます。

Work と Codex の ChatGPT 音声モードでは、次のことができます。

  • 作業をバックグラウンドで続けながら、タスクの開始、優先順位付け、中断、方向転換を行う

  • 進行中の会話やプロジェクトをまたいで複数のエージェントを調整する

  • ドキュメント、カレンダー、連絡先、コミュニケーションなど、利用可能なプロジェクトコンテキストと対応する接続済みツールを使って既存の作業を再開する

  • タスクがブロックされたときや完了したときなどに、音声または画面上で進捗状況の更新を受け取る

  • ChatGPT が聞き取っているタイミングを確認し、会話中にマイクをミュートまたは停止する

Work と Codex の音声モードでは、Work または Codex の別個の使用枠と料金が適用されます。従量課金の Business および Enterprise ワークスペースでは、使用コストは 1 分あたり約 6 クレジットです。従来の Enterprise ワークスペースには、5 時間枠ごとに約 45 分が含まれます。委任されたタスクは、既存の共有使用プールから標準料金で消費されます。

Work と Codex のスタンドアロン音声モードはウェブまたはモバイルでは利用できませんが、ペアリングされた iOS リモートアクセスには対応しています。

Enterprise ワークスペースで Work と Codex の音声モードを使用するには、高度な音声機能と Early Model Access の両方を有効にする必要があります。

Live はカスタム GPTs では利用できません。GPTs との音声会話では、引き続き高度な音声モードと Shimmer の音声が使用されます。ファイルや写真のアップロードは、アカウントとセッションによっては利用できる場合があります。GPTs との音声会話では、画像生成、データ分析、カスタムアクションは利用できません。

Dictation ではなく音声モードを使うべき場面は?

リアルタイムの双方向の会話や、アイデアを話しながら整理したい場合は音声モードを使用します。プロンプトを録音し、その文字起こしを確認・編集してからテキストとして送信したい場合は、ChatGPT Dictation を使用します。音声モードの文字起こしは逐語記録ではなく、話された内容と完全には一致しない場合があります。

文字起こしが会話と完全に一致しないのはなぜですか?

音声会話の後、文字起こしがチャットに追加されます。特に発話が重なったり、背景音があったり、会話の進行が速かったりする場合、あなたや ChatGPT が話した内容と完全には一致しないことがあります。

Live では、ChatGPT の応答も読み上げられている間にチャット内にテキストとして表示されます。音声会話を終了した後、チャット履歴で会話を確認できます。

音声会話にキャプションはありますか?

Live では、ChatGPT の応答が読み上げられている間、チャット内にテキストとして表示されます。iOS と Android の Advanced では、音声会話中に cc ボタンを選択すると、ChatGPT の応答のキャプションが表示されます。

音声会話を終了すると、その文字起こしがチャットに追加され、チャット履歴で確認できます。

音声会話が終了したのはなぜですか?

音声会話は、使用制限、最大セッション時間、または長い会話のコンテキスト制限に達したときに終了する場合があります。可能な場合、ChatGPT は通知を表示します。テキストで続けるか、音声モードを再開できます。

音声会話は同時にいくつできますか?

音声会話は一度に 1 件まで利用できます。

音声設定に Live が表示されないのはなぜですか?

Live は段階的に展開されています。利用可否は、プラン、地域、ワークスペース、アプリのバージョンによって異なります。ChatGPT が最新の状態であることを確認してください。Live を利用できない場合でも、Advanced または Standard Voice を引き続き使用できます。

この記事は役に立ちましたか?