概览
什么是 ChatGPT 语音?
ChatGPT 语音可让你与 ChatGPT 说话,并听到语音回复。语音在聊天中运行,因此你可以一边听一边查看文本回复,无法说话时也可以输入,并且无需重新开始就能查看之前的消息。
如果你只是想把一段录音转成可编辑文本,请使用 ChatGPT 听写。
Live 选项可以同时听和说,让轮流发言与打断感觉更自然。Live 还可以使用网页搜索和记忆,通过受支持的小组件显示可视化结果,并在你的账户可用时处理文本和图像。
ChatGPT 可能会出错。请核实重要信息,尤其是对日期、时间或位置敏感的问题。语音会使用你的设备或浏览器时区来理解“今天”或“明天”等词。如果回答看起来不对,请检查你的时区,或在问题中提供确切日期、时区或位置。详细了解 ChatGPT 与准确性。
有哪些语音选项?
在设置 → 语音下,你可能会看到以下选项:
Live 由 GPT-Live-1 或 GPT-Live-1 mini 提供支持,具体取决于你的套餐。Live 专为自然流畅的对话而设计,可以使用网页搜索和记忆功能,通过支持的小组件显示可视化结果,还能在同一聊天中处理文本和图像。Live 暂不支持视频、屏幕共享、已连接的应用或插件。
高级:此前的实时语音体验。需要使用视频或屏幕共享等受支持的移动端功能时,请选择“高级”。
标准:一种轮流交互的语音体验,会先将你的语音转写为文字,再生成回复。
可用选项可能取决于你的套餐、工作空间设置、地区、应用版本和家长控制。对于已关联的青少年账号,家长或监护人可以通过家长控制管理语音功能的使用权限。
要切换可用选项,请打开设置 → 语音,然后选择 Live、高级或标准。
Business、Enterprise、Edu 和 Healthcare 工作空间的可用情况
符合条件的 Business、Enterprise、Edu 和 Healthcare 工作空间可使用 ChatGPT 语音,具体取决于工作空间设置。
提供两种语音体验:
聊天中的语音:通过自然的实时对话提问、集思广益和探索想法。聊天中的语音由 GPT-Live 提供支持,可在网页版、iOS 和 Android 版中使用。
桌面版语音:通过语音启动任务、查看进度、询问有关智能体的问题,并在一次对话中协调多个智能体。可在 macOS 和 Windows 版 ChatGPT 桌面应用中使用,并支持配对远程访问。
对于 Enterprise、Edu 和 Healthcare 工作空间,当工作空间所有者启用语音时,Live 将成为默认语音体验。无需启用模型抢先体验。工作空间所有者可以通过停用语音来彻底关闭语音功能。
使用限额
聊天中的语音
在聊天模式下,Live 使用量按滚动的 24 小时周期计算。达到限额时,ChatGPT 会通知你。
| 套餐 | 用量 |
|---|---|
| 免费版 | 可有限使用 GPT-Live-1 mini。限额可能会调整。 |
| Go | GPT-Live-1 mini 可使用 3 小时 |
| Plus | GPT-Live-1 可使用 3 小时 |
| Pro(每月 100 美元) | GPT-Live-1 可使用 15 小时 |
| Pro(每月 200 美元) | 无限使用 GPT-Live-1 |
| Business 标准版 | GPT-Live-1 可使用 3 小时。额外用量每分钟消耗 1.25 额度。 |
| Business 高级版 | GPT-Live-1 可使用 15 小时。额外用量每分钟消耗 1.25 额度。 |
| 中小学教师 | GPT-Live-1 可使用 3 小时 |
| 采用额度计价的 Enterprise、Edu 和 Clinicians 套餐 | 每分钟 1.25 额度 |
| 采用按用量美元计价的 Enterprise 套餐 | 每分钟 0.05 美元 |
| 旧版 Enterprise 和 Edu 套餐 | GPT-Live-1 可使用 3 小时 |
桌面版语音
有关当前可用范围、套餐配额和使用限额,请参阅ChatGPT 桌面版语音定价。
开始语音对话
在 iOS 和 Android 上
选择消息栏中的语音图标。
如果系统提示,请允许 ChatGPT 应用访问你的麦克风。
如果这是你的首次语音对话,请选择首选语音。
语音打开后,开始说话即可开始对话。
对话期间,选择麦克风控件可将自己静音或取消静音。选择退出控件即可结束语音对话。
在网页上
前往 ChatGPT.com。
选择提示窗口中的语音图标。
如果系统提示,请允许浏览器访问你的麦克风。
语音打开后,开始说话即可开始对话。
对话期间,选择麦克风控件可将自己静音或取消静音。选择退出控件即可结束语音对话。
在 Live 中使用文本和图像
Live 可以在与你的语音对话相同的聊天中接收文本和图像。语音处于活动状态时,可使用消息栏中的添加按钮附加可用图像,或改为输入消息而不是说话。ChatGPT 可以通过语音回复,而无需开始单独的聊天。
可用的图像类型和限制取决于你的计划和账户。
Live 目前无法从你的 ChatGPT 库中查找或添加文件。根据你的账户,你仍可能可以手动将受支持的文件附加到聊天中。
共享视频或屏幕
Live 不支持视频或屏幕共享。
符合条件的订阅用户在 ChatGPT iOS 和 Android 应用中使用高级模式时,仍可使用视频和屏幕共享功能:
要共享实时视频,请在语音对话期间选择相机按钮。再次选择该按钮即可停止共享。
要共享屏幕,请选择“更多选项”菜单,然后选择共享屏幕,并按照设备上的提示操作。
要停止共享屏幕,请返回 ChatGPT,然后再次选择屏幕共享控件。你也可以通过设备的系统屏幕共享控件停止共享。
如果达到视频或屏幕共享限额,你或许仍可继续语音对话,无需发起新的视频或屏幕共享输入。
更改首选语音
打开设置 → 语音,然后选择语音,即可从以下选项中进行选择:
Arbor — 随和且多变
Breeze — 活泼且真诚
Cove — 沉稳且直率
Ember — 自信且乐观
Juniper — 坦率且开朗
Maple — 欢快且坦诚
Sol — 干练且放松
Spruce — 平静且鼓舞人心
Vale — 开朗且好奇
在巴西,你可能还会看到以下语音:
Viola — 轻快、自然且好奇
Rio — 温暖、亲切且乐于助人
在语音对话期间更改所选语音,会在同一聊天中发起新的语音通话。
更改首选语言
打开 设置 → 语音,然后选择语言。选择你最常说的语言,有助于 ChatGPT 更准确地理解你的语音。你也可以在语音对话期间要求 ChatGPT 使用其他语言说话。
更改回复风格
预设的 ChatGPT 个性目前不适用于 Live。
你仍可以在单次语音对话中要求 ChatGPT 更改语气、语速或回复风格。
你可以要求 ChatGPT 说得更快或更慢,但目前不提供精确的播放速度控制。
在 CarPlay 中使用语音
ChatGPT 可在受支持的 iPhone 上通过 Apple CarPlay 使用。你可以从 CarPlay 屏幕开始语音对话、继续最近或置顶的聊天,或在项目中开始对话。详细了解如何在 CarPlay 中使用 ChatGPT。
仅在法律允许且条件适合安全使用时使用移动设备。请在驾驶前设置好应用,并避免在车辆行驶时操作设备。
让对话在后台继续
若要在使用其他应用或手机锁定时继续语音对话,请在 设置 → 语音 下开启后台对话。
后台对话会在你结束对话、强制关闭应用、达到使用限制或达到最长会话时长时结束。如果你正在 Advanced 中共享屏幕,当你停止共享或锁定屏幕时,屏幕共享也会结束。
通过语音启动 ChatGPT
在受支持的移动应用版本中,在 设置 → 语音 下开启以语音启动。开启此设置后,打开 ChatGPT 进入新对话或空对话时会自动启动语音。
若要在 CarPlay 中自动启动语音,请在 设置 → 语音 下开启在 CarPlay 中自动启动。使用过 CarPlay 中的 ChatGPT 后,此设置才会显示。
数据控制
OpenAI 会保留音频和视频片段多久?
Live 和高级语音对话中的音频片段,以及高级语音对话中的视频片段,会与聊天记录中显示的转录文本一起存储。片段会保留 30 天。
删除聊天后,我们也会在 30 天内删除其关联的音频和视频片段,除非出于安全、防护或法律原因需要保留,如我们的隐私政策所述;或除非你此前选择共享片段以帮助训练我们的模型,并且这些片段已与你的账户解除关联。
删除聊天(包括关联的音频或视频数据)后无法撤销。归档只会将聊天从侧边栏移除;不会删除聊天或其关联的音频、视频片段。
使用 Standard 时,音频会先转录,然后 ChatGPT 才会生成回复。转录完成后,我们会删除音频,除非你已选择共享音频以帮助训练我们的模型。即使转录失败,音频也会被删除。
OpenAI 会用音频或视频片段训练模型吗?
不会,除非你选择共享音频或视频片段来帮助训练我们的模型,或者你在 OpenAI 账户设置中启用了“包含你的音频录音”或“包含你的视频录制”开关。你可以在此处详细了解你的数据控制。
如果已开启为所有人改进模型,我们可能会使用你的语音对话中的转录文本和其他文件来训练我们的模型,具体取决于你的计划和设置。除非你按上述方式选择共享相关音频或视频片段以改进模型,否则我们不会将其用于训练。
个人工作空间中的 Free、Plus 和 Pro 用户可以打开 设置 → 数据控制,开启为所有人改进模型,然后开启包含你的音频录音或包含你的视频录制来选择共享片段。ChatGPT Business、Enterprise 或 Edu 工作空间中的用户无法共享语音对话中的音频或视频片段。
如果你选择共享音频或视频片段,我们的团队可能会审核共享片段,以帮助改进模型行为,例如了解 ChatGPT 在哪里听错或误解了内容。在使用共享片段进行训练前,我们会采取措施减少片段中的个人信息量。
如果你停止共享,新的片段将不再用于训练我们的模型。此前已与你的账户解除关联的片段可能会继续被使用。你的选择与账户绑定,并适用于你已登录的所有设备。
常见问题
ChatGPT 说话时我可以说话吗?
可以。Live 可以同时听和说,因此你可以在 ChatGPT 回复时打断或继续说话。ChatGPT 应会跟随对话的最新部分,但语音重叠、背景噪音、网络状况和麦克风设置都可能影响它听到的内容。
多人可以同时和 ChatGPT 说话吗?
Live 主要为一对一对话而设计。它可以处理背景噪音,但尚未针对多人说话的对话进行优化。当人们彼此交谈而不是对 ChatGPT 说话时,它可能会作出回应。
为什么 ChatGPT 会打断我或停止说话?
仍可能出现打断,尤其是在有背景噪音、长时间停顿或其他说话者的音频时。可以尝试使用耳机、换到更安静的环境,或调高设备音量。在 iPhone 上,你也可以在语音对话期间打开控制中心,选择麦克风模式,并开启语音隔离。
我能让语音在我边想边说时等待吗?
在对话开始时,你可以要求 Live 等到你准备好再回复,例如:“等我请你回复时再回复。”长时间停顿、背景语音或其他声音仍可能导致 Live 回复。
什么时候应该使用语音而不是听写?
使用语音进行实时来回对话,或用来讨论想法。当你想录制提示、查看并编辑转录文本,然后以文本形式发送时,请使用 ChatGPT 听写。语音转录文本不是逐字记录,可能与实际说出的内容不完全一致。
为什么转录文本与对话不完全一致?
语音对话结束后,转录文本会添加到聊天中。它可能与你或 ChatGPT 所说的内容不完全一致,尤其是在语音重叠、有背景噪音或对话进行很快时。
使用 Live 时,ChatGPT 的回复也会在朗读的同时以文本形式显示在聊天中。结束语音对话后,你可以在聊天记录中查看对话。
语音对话是否包含字幕?
使用 Live 时,ChatGPT 的回复会在朗读的同时以文本形式显示在聊天中。在 iOS 和 Android 上使用 Advanced 时,在语音对话期间选择 cc 按钮,即可显示 ChatGPT 回复的字幕。
结束语音对话后,转录文本会添加到聊天中,方便你在聊天记录中查看。
为什么我的语音对话结束了?
当你达到使用限制、最长会话时长,或较长对话达到上下文限制时,语音对话可能会结束。在可能的情况下,ChatGPT 会显示通知。你可以继续使用文本,或再次启动语音。
我一次可以进行多少个语音对话?
你一次只能进行一个语音对话。
