OpenAI
Trang này được dịch bằng máy học. Xem bài viết gốc bằng tiếng Anh.

ChatGPT Voice

Trò chuyện với ChatGPT bằng giọng nói tự nhiên, linh hoạt.

Đã cập nhật: 5 days ago

Tổng quan

ChatGPT Voice là gì?

ChatGPT Voice cho phép bạn nói chuyện với ChatGPT và nghe phản hồi bằng giọng nói. Giọng nói hoạt động trong một cuộc trò chuyện, nên bạn có thể nghe trong khi theo dõi phản hồi bằng văn bản, nhập khi không thể nói và xem lại các tin nhắn trước đó mà không cần bắt đầu lại.

Nếu thay vào đó bạn muốn chuyển một bản ghi âm thành văn bản có thể chỉnh sửa, hãy dùng ChatGPT Dictation.

Tùy chọn Live có thể nghe và nói cùng lúc, giúp việc luân phiên nói và ngắt lời trở nên tự nhiên hơn. Live cũng có thể dùng tìm kiếm trên web và bộ nhớ, hiển thị kết quả trực quan qua các tiện ích được hỗ trợ, và làm việc với văn bản cũng như hình ảnh khi các tính năng đó có sẵn cho tài khoản của bạn.

ChatGPT có thể mắc lỗi. Hãy kiểm tra thông tin quan trọng, đặc biệt với các câu hỏi nhạy cảm về ngày, giờ hoặc địa điểm. Giọng nói dùng múi giờ của thiết bị hoặc trình duyệt để hiểu các từ như “hôm nay” hoặc “ngày mai”. Nếu câu trả lời có vẻ không đúng, hãy kiểm tra múi giờ của bạn hoặc nêu rõ ngày, múi giờ hay địa điểm chính xác trong câu hỏi. Tìm hiểu thêm về ChatGPT và độ chính xác.

Có những tùy chọn Giọng nói nào?

Bạn có thể thấy các tùy chọn sau trong Cài đặt → Giọng nói:

  • Chế độ Trực tiếp sử dụng GPT-Live-1 hoặc GPT-Live-1 mini, tùy theo gói của bạn. Chế độ Trực tiếp được thiết kế để trò chuyện qua lại một cách tự nhiên, có thể tìm kiếm trên web và sử dụng bộ nhớ, hiển thị kết quả trực quan qua các widget được hỗ trợ, đồng thời làm việc với văn bản và hình ảnh trong cùng một cuộc trò chuyện. Chế độ Trực tiếp cũng có thể sử dụng các tiện ích và ứng dụng đã kết nối mà tài khoản của bạn có quyền truy cập. Chế độ Trực tiếp không hỗ trợ video hoặc chia sẻ màn hình.

  • Nâng cao: Trải nghiệm Giọng nói theo thời gian thực trước đây. Sử dụng chế độ Nâng cao khi bạn cần các tính năng được hỗ trợ trên thiết bị di động như video hoặc chia sẻ màn hình.

  • Tiêu chuẩn: Trải nghiệm Giọng nói theo từng lượt, chuyển lời nói của bạn thành văn bản trước khi tạo câu trả lời.

Các tùy chọn bạn có thể sử dụng phụ thuộc vào gói, cài đặt không gian làm việc, khu vực, phiên bản ứng dụng và chế độ kiểm soát của cha mẹ. Đối với tài khoản thanh thiếu niên đã liên kết, cha mẹ hoặc người giám hộ có thể quản lý quyền truy cập Giọng nói thông qua chế độ kiểm soát của cha mẹ.

Để chuyển giữa các tùy chọn có sẵn, hãy mở Cài đặt → Giọng nói và chọn Trực tiếp, Nâng cao hoặc Tiêu chuẩn.

Sử dụng tiện ích trong chế độ Trực tiếp

Trong cuộc trò chuyện ở chế độ Trực tiếp, hãy yêu cầu ChatGPT sử dụng một tiện ích mà tài khoản của bạn có quyền truy cập. Bạn có thể cần kết nối ứng dụng và đăng nhập trước khi sử dụng. Các quyền ứng dụng và hạn chế của không gian làm việc hiện có vẫn được áp dụng.

Trên web và thiết bị di động, nếu một thao tác cần bạn phê duyệt, Giọng nói sẽ nhắc bạn xem xét thao tác đó trên màn hình. Sử dụng các nút điều khiển trên màn hình để phê duyệt hoặc từ chối; tính năng phê duyệt bằng lời nói chưa được hỗ trợ.

Tính khả dụng cho các không gian làm việc Business, Enterprise, Edu và Healthcare

ChatGPT Voice có sẵn trong các không gian làm việc Business, Enterprise, Edu và Healthcare đủ điều kiện, tùy theo cài đặt của không gian làm việc.

Bạn có thể sử dụng Giọng nói trong các trải nghiệm sau, tùy theo gói và cài đặt không gian làm việc:

  • Giọng nói trong chế độ Trò chuyện: Trò chuyện tự nhiên theo thời gian thực để đặt câu hỏi, động não và khám phá ý tưởng. Sử dụng GPT-Live, Giọng nói trong chế độ Trò chuyện có sẵn trên web, iOS và Android. Chế độ Trực tiếp cũng có thể sử dụng các tiện ích và ứng dụng đã kết nối mà tài khoản của bạn có quyền truy cập.

  • Giọng nói trong chế độ Công việc trên web và thiết bị di động: Sử dụng chế độ Trực tiếp để làm việc với các ứng dụng đã kết nối, tạo tài liệu, bản trình bày và bảng tính, hoặc sử dụng trình duyệt. Nếu một tác vụ vẫn đang chạy khi bạn kết thúc cuộc gọi, tác vụ đó có thể tiếp tục trong cuộc trò chuyện bằng văn bản. Bạn cần có quyền truy cập cả Giọng nói lẫn Công việc.

  • Giọng nói trong ứng dụng máy tính: Sử dụng giọng nói để bắt đầu tác vụ, kiểm tra tiến độ, đặt câu hỏi về các tác nhân của bạn và điều phối nhiều tác nhân trong một cuộc trò chuyện. Có sẵn trong ứng dụng ChatGPT dành cho máy tính trên macOS và Windows, hỗ trợ truy cập từ xa qua thiết bị đã ghép đôi.

Việc sử dụng Giọng nói không làm thay đổi quyền truy cập của bạn vào các tiện ích hoặc ứng dụng đã kết nối. Các quyền truy cập dữ liệu và hạn chế thao tác hiện có vẫn được áp dụng.

Giới hạn sử dụng

Giọng nói trong chế độ Trò chuyện

Trong chế độ Trò chuyện, thời lượng sử dụng Trực tiếp được tính trong khoảng 24 giờ gần nhất tại mỗi thời điểm. ChatGPT sẽ thông báo khi bạn đạt giới hạn.

GóiMức sử dụng
FreeQuyền truy cập có giới hạn vào GPT-Live-1 mini. Giới hạn có thể thay đổi.
Go3 giờ sử dụng GPT-Live-1 mini
Plus3 giờ sử dụng GPT-Live-1
Pro (100 USD/tháng)15 giờ sử dụng GPT-Live-1
Pro (200 USD/tháng)Sử dụng GPT-Live-1 không giới hạn
Business Standard3 giờ sử dụng GPT-Live-1. Thời lượng sử dụng thêm tiêu tốn 1,25 credit mỗi phút.
Business Premium15 giờ sử dụng GPT-Live-1. Thời lượng sử dụng thêm tiêu tốn 1,25 credit mỗi phút.
Giáo viên từ mầm non đến lớp 123 giờ sử dụng GPT-Live-1
Enterprise, Edu và Clinicians áp dụng cách tính phí theo credit1,25 credit mỗi phút
Enterprise áp dụng cách tính phí bằng USD theo mức sử dụng0,05 USD mỗi phút
Các gói Enterprise và Edu cũ3 giờ sử dụng GPT-Live-1

Giọng nói trong chế độ Công việc trên web và thiết bị di động

Giọng nói trong chế độ Công việc tuân theo giới hạn và cách tính phí Giọng nói của gói bạn đang dùng. Các tác vụ trong chế độ Công việc cũng được tính vào mức sử dụng Công việc thông thường của bạn, giống như khi bạn nhập bằng văn bản. Giọng nói trong ứng dụng máy tính có mức giá và giới hạn riêng.

Giọng nói trong ứng dụng máy tính

Xem mức giá ChatGPT Voice trong ứng dụng máy tính và các giới hạn để biết tính khả dụng hiện tại, hạn mức theo gói và giới hạn sử dụng.

Bắt đầu cuộc trò chuyện bằng giọng nói

Trên iOS và Android

  • Chọn biểu tượng Giọng nói trong thanh tin nhắn.

  • Nếu được nhắc, hãy cho phép ứng dụng ChatGPT truy cập micrô của bạn.

  • Nếu đây là cuộc trò chuyện bằng giọng nói đầu tiên của bạn, hãy chọn giọng nói mong muốn.

  • Sau khi Giọng nói mở, hãy bắt đầu nói để bắt đầu cuộc trò chuyện.

Trong cuộc trò chuyện, chọn điều khiển micrô để tắt hoặc bật tiếng của bạn. Chọn điều khiển thoát để kết thúc cuộc trò chuyện bằng giọng nói.

Trên web

  • Truy cập ChatGPT.com.

  • Chọn biểu tượng Giọng nói trong cửa sổ câu lệnh.

  • Nếu được nhắc, hãy cho phép trình duyệt truy cập micrô của bạn.

  • Sau khi Giọng nói mở, hãy bắt đầu nói để bắt đầu cuộc trò chuyện.

Trong cuộc trò chuyện, chọn điều khiển micrô để tắt hoặc bật tiếng của bạn. Chọn điều khiển thoát để kết thúc cuộc trò chuyện bằng giọng nói.

Sử dụng văn bản và hình ảnh với Live

Live có thể nhận văn bản và hình ảnh trong cùng cuộc trò chuyện với cuộc trò chuyện bằng giọng nói của bạn. Khi Giọng nói đang hoạt động, hãy dùng nút thêm trong thanh tin nhắn để đính kèm một hình ảnh có sẵn, hoặc nhập tin nhắn thay vì nói. ChatGPT có thể phản hồi bằng Giọng nói mà không cần bắt đầu cuộc trò chuyện riêng.

Các loại hình ảnh và giới hạn có sẵn phụ thuộc vào gói và tài khoản của bạn.

Live hiện chưa thể tìm hoặc thêm tệp từ Thư viện ChatGPT của bạn. Bạn vẫn có thể đính kèm thủ công một tệp được hỗ trợ vào cuộc trò chuyện, tùy thuộc vào tài khoản của bạn.

Chia sẻ video hoặc màn hình

Live không hỗ trợ video hoặc chia sẻ màn hình.

Tính năng chia sẻ video và màn hình vẫn dành cho những người đăng ký đủ điều kiện trong ứng dụng ChatGPT trên iOS và Android khi dùng chế độ Nâng cao:

  • Để chia sẻ video trực tiếp, hãy chọn nút camera trong khi đàm thoại bằng giọng nói. Chọn lại nút này để dừng chia sẻ.

  • Để chia sẻ màn hình, hãy chọn trình đơn tùy chọn khác, sau đó chọn Chia sẻ màn hình và làm theo hướng dẫn trên thiết bị.

  • Để dừng chia sẻ màn hình, hãy quay lại ChatGPT và chọn lại nút điều khiển chia sẻ màn hình. Bạn cũng có thể dừng chia sẻ bằng các nút điều khiển chia sẻ màn hình của hệ thống trên thiết bị.

Nếu đạt đến giới hạn video hoặc chia sẻ màn hình, bạn vẫn có thể tiếp tục đàm thoại bằng giọng nói mà không cần bắt đầu một phiên video hoặc chia sẻ màn hình mới.

Thay đổi giọng nói bạn ưa thích

Mở Cài đặt → Giọng nói, rồi chọn Giọng nói để chọn một trong các tùy chọn sau:

  • Arbor — Thoải mái và linh hoạt

  • Breeze — Sinh động và chân thành

  • Cove — Điềm đạm và thẳng thắn

  • Ember — Tự tin và lạc quan

  • Juniper — Cởi mở và vui tươi

  • Maple — Vui vẻ và chân thật

  • Sol — Hiểu biết và thư thái

  • Spruce — Điềm tĩnh và khích lệ

  • Vale — Tươi sáng và ham tìm hiểu

Tại Brazil, bạn cũng có thể thấy các giọng nói sau:

  • Viola — Nhẹ nhàng, tự nhiên và tò mò

  • Rio — Ấm áp, thân thiện và nhiệt tình

Nếu thay đổi giọng nói đã chọn trong một cuộc Đàm thoại bằng giọng nói, một cuộc gọi thoại mới sẽ bắt đầu trong cùng cuộc trò chuyện.

Thay đổi ngôn ngữ bạn muốn dùng

Mở Cài đặt → Giọng nói, rồi chọn Ngôn ngữ. Việc chọn ngôn ngữ bạn nói thường xuyên nhất có thể giúp ChatGPT hiểu lời nói của bạn chính xác hơn. Bạn cũng có thể yêu cầu ChatGPT nói một ngôn ngữ khác trong cuộc trò chuyện bằng giọng nói.

Thay đổi phong cách phản hồi

Các tính cách ChatGPT đặt sẵn hiện chưa áp dụng cho Live.

Bạn vẫn có thể yêu cầu ChatGPT thay đổi giọng điệu, nhịp độ hoặc phong cách phản hồi trong từng cuộc trò chuyện bằng giọng nói.

Bạn có thể yêu cầu ChatGPT nói nhanh hơn hoặc chậm hơn, nhưng hiện chưa có các điều khiển tốc độ phát chính xác.

Sử dụng Giọng nói trong CarPlay

ChatGPT có sẵn trong Apple CarPlay trên các iPhone được hỗ trợ. Bạn có thể bắt đầu một cuộc trò chuyện bằng giọng nói, tiếp tục một cuộc trò chuyện gần đây hoặc đã ghim, hoặc bắt đầu một cuộc trò chuyện trong dự án từ màn hình CarPlay. Tìm hiểu thêm về cách sử dụng ChatGPT trong CarPlay.

Chỉ sử dụng thiết bị di động khi pháp luật cho phép và khi điều kiện cho phép sử dụng an toàn. Thiết lập ứng dụng trước khi lái xe và tránh tương tác với thiết bị khi xe đang di chuyển.

Tiếp tục cuộc trò chuyện trong nền

Để tiếp tục cuộc trò chuyện bằng giọng nói khi dùng ứng dụng khác hoặc khi điện thoại bị khóa, hãy bật Cuộc trò chuyện trong nền trong Cài đặt → Giọng nói.

Một cuộc trò chuyện trong nền sẽ kết thúc khi bạn kết thúc cuộc trò chuyện, buộc đóng ứng dụng, đạt giới hạn sử dụng hoặc đạt thời lượng phiên tối đa. Nếu bạn đang chia sẻ màn hình trong Nâng cao, việc chia sẻ màn hình cũng kết thúc khi bạn dừng chia sẻ hoặc khóa màn hình.

Khởi động ChatGPT bằng Giọng nói

Trên các phiên bản ứng dụng di động được hỗ trợ, hãy bật Bắt đầu bằng Giọng nói trong Cài đặt → Giọng nói. Khi cài đặt này bật, việc mở ChatGPT vào một cuộc trò chuyện mới hoặc trống sẽ tự động khởi động Giọng nói.

Để tự động khởi động Giọng nói trong CarPlay, hãy bật Tự động bắt đầu trong CarPlay trong Cài đặt → Giọng nói. Cài đặt này xuất hiện sau khi bạn đã dùng ChatGPT trong CarPlay.

Kiểm soát dữ liệu

OpenAI lưu giữ các đoạn âm thanh và video trong bao lâu?

Các đoạn âm thanh từ cuộc trò chuyện Live và Giọng nói nâng cao, cùng các đoạn video từ cuộc trò chuyện Giọng nói nâng cao, được lưu cùng bản chép lời xuất hiện trong lịch sử trò chuyện của bạn. Các đoạn được lưu giữ trong 30 ngày.

Khi bạn xóa một cuộc trò chuyện, chúng tôi cũng xóa các đoạn âm thanh và video liên quan trong vòng 30 ngày, trừ khi cần giữ lại vì lý do bảo mật, an toàn hoặc pháp lý như mô tả trong Chính sách quyền riêng tư của chúng tôi, hoặc trừ khi trước đó bạn đã chọn chia sẻ các đoạn để giúp huấn luyện mô hình và chúng đã được tách khỏi tài khoản của bạn.

Việc xóa cuộc trò chuyện, bao gồm dữ liệu âm thanh hoặc video liên quan, không thể hoàn tác. Lưu trữ chỉ xóa cuộc trò chuyện khỏi thanh bên; thao tác này không xóa cuộc trò chuyện hoặc các đoạn âm thanh hay video liên quan.

Với Tiêu chuẩn, âm thanh được chép lời trước khi ChatGPT tạo phản hồi. Chúng tôi xóa âm thanh sau khi hoàn tất chép lời, trừ khi bạn đã chọn chia sẻ âm thanh để giúp huấn luyện mô hình của chúng tôi. Âm thanh vẫn bị xóa ngay cả khi chép lời không thành công.

OpenAI có huấn luyện mô hình trên các đoạn âm thanh hoặc video không?

Không, trừ khi bạn chọn chia sẻ đoạn âm thanh hoặc video để giúp huấn luyện các mô hình của chúng tôi, hoặc bạn đã bật nút chuyển “Bao gồm bản ghi âm của bạn” hoặc “Bao gồm bản ghi video của bạn” trong cài đặt tài khoản OpenAI. Bạn có thể tìm hiểu thêm về các quyền kiểm soát dữ liệu của mình tại đây.

Nếu Cải thiện mô hình cho mọi người được bật, chúng tôi có thể dùng bản chép lời và các tệp khác từ cuộc trò chuyện bằng giọng nói của bạn để huấn luyện mô hình, tùy thuộc vào gói và cài đặt của bạn. Chúng tôi không dùng các đoạn âm thanh hoặc video liên quan để huấn luyện, trừ khi bạn chọn chia sẻ chúng để cải thiện mô hình như mô tả ở trên.

Người dùng Free, Plus và Pro trong không gian làm việc cá nhân có thể chọn chia sẻ đoạn bằng cách mở Cài đặt → Kiểm soát dữ liệu, bật Cải thiện mô hình cho mọi người, rồi bật Bao gồm bản ghi âm của bạn hoặc Bao gồm bản ghi video của bạn. Người dùng không thể chia sẻ đoạn âm thanh hoặc video từ cuộc trò chuyện bằng giọng nói trong không gian làm việc ChatGPT Business, Enterprise hoặc Edu.

Nếu bạn chọn chia sẻ đoạn âm thanh hoặc video, các nhóm của chúng tôi có thể xem xét các đoạn được chia sẻ để giúp cải thiện hành vi của mô hình, chẳng hạn như hiểu khi nào ChatGPT nghe nhầm hoặc diễn giải sai điều gì đó. Trước khi dùng các đoạn được chia sẻ để huấn luyện, chúng tôi thực hiện các bước nhằm giảm lượng thông tin cá nhân trong đoạn đó.

Nếu bạn ngừng chia sẻ, các đoạn mới sẽ không còn được dùng để huấn luyện mô hình của chúng tôi. Các đoạn trước đây đã được tách khỏi tài khoản của bạn có thể tiếp tục được sử dụng. Lựa chọn của bạn gắn với tài khoản và áp dụng cho mọi thiết bị mà bạn đã đăng nhập.

Tìm hiểu thêm về Kiểm soát dữ liệu và cách dữ liệu của bạn được dùng để cải thiện hiệu suất mô hình.

Câu hỏi thường gặp

Tôi có thể nói khi ChatGPT đang nói không?

Có. Live có thể nghe và nói cùng lúc, nên bạn có thể ngắt lời hoặc tiếp tục nói trong khi ChatGPT đang phản hồi. ChatGPT sẽ cố gắng theo sát phần mới nhất của cuộc trò chuyện, nhưng lời nói chồng lên nhau, tiếng ồn nền, điều kiện mạng và cài đặt micrô có thể ảnh hưởng đến những gì ChatGPT nghe được.

Nhiều người có thể nói với ChatGPT cùng lúc không?

Live được thiết kế chủ yếu cho cuộc trò chuyện một-một. Live có thể xử lý tiếng ồn nền, nhưng chưa được tối ưu hóa cho các cuộc trò chuyện có nhiều người nói. Live có thể phản hồi khi mọi người đang nói chuyện với nhau thay vì nói với ChatGPT.

Vì sao ChatGPT ngắt lời tôi hoặc ngừng nói?

Tình trạng ngắt quãng vẫn có thể xảy ra, đặc biệt khi có tiếng ồn nền, khoảng lặng dài hoặc âm thanh từ người nói khác. Hãy thử dùng tai nghe, chuyển đến nơi yên tĩnh hơn hoặc tăng âm lượng thiết bị. Trên iPhone, bạn cũng có thể mở Trung tâm điều khiển trong cuộc trò chuyện bằng giọng nói, chọn Chế độ micrô và bật Tách giọng nói.

Tôi có thể yêu cầu Giọng nói chờ trong khi tôi suy nghĩ thành tiếng không?

Khi bắt đầu cuộc trò chuyện, bạn có thể yêu cầu Live chờ đến khi bạn sẵn sàng nhận phản hồi—ví dụ: “Hãy chờ đến khi tôi yêu cầu bạn trả lời”. Các khoảng lặng dài, lời nói nền hoặc âm thanh khác vẫn có thể khiến Live phản hồi.

Khi nào tôi nên dùng Giọng nói thay vì Dictation?

Dùng Giọng nói cho cuộc trò chuyện trực tiếp, qua lại hoặc để trao đổi ý tưởng. Dùng ChatGPT Dictation khi bạn muốn ghi âm một câu lệnh, xem lại và chỉnh sửa bản chép lời, rồi gửi dưới dạng văn bản. Bản chép lời Giọng nói không phải là bản ghi nguyên văn và có thể không khớp chính xác với những gì đã nói.

Vì sao bản chép lời không khớp chính xác với cuộc trò chuyện?

Bản chép lời được thêm vào cuộc trò chuyện sau một cuộc trò chuyện bằng giọng nói. Bản chép lời có thể không khớp chính xác với những gì bạn hoặc ChatGPT đã nói, đặc biệt khi lời nói chồng lên nhau, có tiếng ồn nền hoặc cuộc trò chuyện diễn ra nhanh.

Với Live, phản hồi của ChatGPT cũng xuất hiện dưới dạng văn bản trong cuộc trò chuyện trong khi được đọc thành tiếng. Sau khi kết thúc cuộc trò chuyện bằng giọng nói, bạn có thể xem lại cuộc trò chuyện trong lịch sử trò chuyện.

Cuộc trò chuyện bằng giọng nói có phụ đề không?

Với Live, phản hồi của ChatGPT xuất hiện dưới dạng văn bản trong cuộc trò chuyện trong khi được đọc thành tiếng. Trên iOS và Android với Nâng cao, chọn nút cc trong cuộc trò chuyện bằng giọng nói để hiển thị phụ đề cho phản hồi của ChatGPT.

Sau khi bạn kết thúc một cuộc trò chuyện bằng giọng nói, bản chép lời của cuộc trò chuyện đó sẽ được thêm vào cuộc trò chuyện để bạn có thể xem lại trong lịch sử trò chuyện.

Vì sao cuộc trò chuyện bằng giọng nói của tôi kết thúc?

Một cuộc trò chuyện bằng giọng nói có thể kết thúc khi bạn đạt giới hạn sử dụng, thời lượng phiên tối đa hoặc khi một cuộc trò chuyện dài đạt giới hạn ngữ cảnh. ChatGPT sẽ hiển thị thông báo khi có thể. Bạn có thể tiếp tục bằng văn bản hoặc bắt đầu lại Giọng nói.

Tôi có thể có bao nhiêu cuộc trò chuyện bằng giọng nói cùng lúc?

Bạn chỉ có thể có một cuộc trò chuyện bằng giọng nói tại một thời điểm.

Bài viết này có hữu ích không?