Các mô hình nền tảng của OpenAI, bao gồm những mô hình vận hành ChatGPT, được phát triển từ ba nguồn thông tin chính: (1) thông tin công khai trên Internet, (2) thông tin mà chúng tôi hợp tác với bên thứ ba để truy cập và (3) thông tin do người dùng, chuyên viên huấn luyện và nhà nghiên cứu của chúng tôi cung cấp hoặc tạo ra.
Quá trình phát triển các mô hình nền tảng như những mô hình dùng trong ChatGPT gồm nhiều giai đoạn, bao gồm chuẩn bị dữ liệu huấn luyện, đào tạo trước và đào tạo sau, cũng như liên tục đánh giá và cải thiện sau khi triển khai. Ở các giai đoạn này, nhiều loại thông tin có thể được sử dụng cho nhiều mục đích, bao gồm cải thiện hiệu suất, độ tin cậy và độ an toàn của mô hình.
Bài viết này trình bày tổng quan về thông tin chúng tôi sử dụng để hỗ trợ phát triển các mô hình này, cách chúng tôi thu thập và sử dụng thông tin đó theo luật về quyền riêng tư, cũng như các biện pháp bảo vệ được áp dụng trong suốt quá trình huấn luyện. Để tìm hiểu cách chúng tôi thu thập và sử dụng thông tin từ người dùng dịch vụ, bao gồm cách từ chối cho phép sử dụng các cuộc trò chuyện trên ChatGPT để cải thiện mô hình, vui lòng xem Chính sách quyền riêng tư và bài viết này trong Trung tâm Trợ giúp.
ChatGPT là gì và hoạt động như thế nào?
ChatGPT là một dịch vụ dựa trên trí tuệ nhân tạo mà bạn có thể truy cập qua Internet hoặc ứng dụng. Bạn có thể dùng ChatGPT cho nhiều nhiệm vụ, như sắp xếp và tóm tắt thông tin, hỗ trợ dịch thuật, lập trình, nghiên cứu và phân tích, hoàn thành các nhiệm vụ nhiều bước trên nhiều công cụ, phân tích hoặc tạo hình ảnh, khơi nguồn sáng tạo và ý tưởng, cùng các hoạt động thường ngày khác. ChatGPT được thiết kế để hiểu và phản hồi câu hỏi cũng như hướng dẫn của người dùng bằng cách học các quy luật từ lượng lớn thông tin, bao gồm văn bản, hình ảnh, âm thanh và video.
Trong quá trình huấn luyện, mô hình phân tích các mối quan hệ trong dữ liệu này—chẳng hạn như cách các từ thường xuất hiện cùng nhau trong một ngữ cảnh—rồi vận dụng hiểu biết đó để dự đoán từng từ có khả năng xuất hiện tiếp theo cao nhất khi tạo câu trả lời. Văn bản có thể được chuyển thành các đơn vị nhỏ hơn, đôi khi gọi là “token”, có thể đại diện cho cả từ, một phần của từ hoặc dấu câu. Token là các đơn vị cấu thành văn bản mà mô hình xử lý. Tương tự, các mô hình tạo ra dạng nội dung khác như hình ảnh sẽ học quy luật về mối liên hệ giữa các pixel với nhau và với chú thích tương ứng trong dữ liệu huấn luyện.
Ví dụ, trong quá trình học của mô hình (gọi là “huấn luyện”), mô hình có thể được yêu cầu hoàn thành một câu như: “Thay vì rẽ trái, cô ấy rẽ ___.” Ở giai đoạn đầu của quá trình huấn luyện, câu trả lời của mô hình phần lớn là ngẫu nhiên. Tuy nhiên, khi xử lý và học từ một lượng lớn văn bản, mô hình ngày càng nhận diện quy luật và dự đoán từ tiếp theo có khả năng xuất hiện cao nhất tốt hơn. Quá trình này được lặp lại trên hàng triệu câu để tinh chỉnh hiểu biết và nâng cao độ chính xác của mô hình.
Vì một câu có thể được hoàn thành hợp lý theo nhiều cách—chẳng hạn như “Thay vì rẽ trái, cô ấy rẽ phải”, “quay vòng” hoặc “quay lại”—nên phản hồi của mô hình vốn có yếu tố ngẫu nhiên. Do đó, cùng một câu hỏi có thể cho ra những câu trả lời khác nhau ở những lần truy vấn khác nhau.
Các mô hình học máy gồm những tập hợp số rất lớn, gọi là “trọng số” hoặc “tham số”, cùng với mã dùng để diễn giải và sử dụng các con số đó. Các mô hình này không lưu trữ hay giữ lại bản sao của dữ liệu dùng để huấn luyện chúng. Thay vào đó, khi mô hình học, giá trị các tham số của mô hình được điều chỉnh một chút để phản ánh những quy luật mà mô hình đã nhận diện. Trong ví dụ trước, mô hình chuyển từ dự đoán các từ ngẫu nhiên sang dự đoán chính xác hơn—không phải bằng cách lưu trữ các câu huấn luyện, mà bằng cách cập nhật các tham số nội bộ. Mô hình không giữ lại bản sao của các câu, hình ảnh hoặc âm thanh mà mô hình xử lý trong quá trình huấn luyện. ChatGPT không “sao chép và dán” từ dữ liệu huấn luyện—tương tự như một giáo viên sau khi nghiên cứu sâu rộng có thể giải thích khái niệm nhờ hiểu mối quan hệ giữa các ý tưởng mà không cần ghi nhớ hay lặp lại nguyên văn tài liệu gốc. Khi tạo câu trả lời cho yêu cầu của người dùng, mô hình sử dụng các trọng số đã học này để dự đoán và tạo nội dung mới.
Loại thông tin nào được dùng để dạy ChatGPT?
Đối với nội dung Internet công khai, chúng tôi chỉ sử dụng thông tin được truy cập tự do và công khai trên Internet. Thông tin này có thể bao gồm các trang web, diễn đàn, blog và bài đăng công khai, cùng những nội dung trực tuyến công khai khác. Ví dụ, nếu bạn tham gia một diễn đàn thảo luận trực tuyến công khai hoặc đăng blog hay nội dung công khai khác, chúng tôi có thể sử dụng nội dung công khai đó để huấn luyện mô hình. Tuy nhiên, chúng tôi thực hiện các biện pháp nhằm giảm việc xử lý thông tin cá nhân trong quá trình huấn luyện. Khi thu thập nội dung Internet công khai, chúng tôi không cố ý lấy dữ liệu từ những nguồn được biết là nằm sau tường phí hoặc trên dark web. Ngoài ra, chúng tôi áp dụng các bộ lọc để loại bỏ tài liệu mà chúng tôi không muốn mô hình học, chẳng hạn như ngôn từ thù ghét, nội dung người lớn, các trang tổng hợp thông tin cá nhân và thư rác. Thông tin còn lại sau đó được dùng để huấn luyện các mô hình của chúng tôi.
Chủ sở hữu trang web có thể quản lý việc nội dung công khai trên trang của họ có được truy cập để phục vụ huấn luyện hay không bằng cách dùng các công cụ kiểm soát web tiêu chuẩn như robots.txt để chặn GPTBot—bot có thể thu thập nội dung công khai nhằm hỗ trợ huấn luyện mô hình của chúng tôi. Chúng tôi cung cấp hướng dẫn để giúp chủ sở hữu trang web quản lý cách trang web và nội dung của họ tương tác với các hệ thống AI của chúng tôi.
Chúng tôi cũng sử dụng thông tin từ các đối tác bên thứ ba để hỗ trợ huấn luyện và cải thiện mô hình. Thông tin này có thể bao gồm dữ liệu trong các bộ dữ liệu mà chúng tôi được truy cập theo thỏa thuận với bên thứ ba, cũng như thông tin do chuyên viên huấn luyện và nhà nghiên cứu cung cấp hoặc tạo ra khi chính sách và thỏa thuận của chúng tôi cho phép. Điều này giúp cải thiện chất lượng, độ an toàn và hiệu suất của các mô hình. Tùy theo bộ dữ liệu, các nguồn này có thể bao gồm văn bản, hình ảnh, âm thanh, video hoặc các loại dữ liệu khác.
Chúng tôi cũng ngày càng sử dụng nhiều dữ liệu tổng hợp trong một số quy trình huấn luyện. Ví dụ, chúng tôi có thể sử dụng thông tin và các mô hình của mình để tạo câu lệnh tổng hợp, ví dụ đa ngôn ngữ hoặc tài liệu huấn luyện khác. Dữ liệu tổng hợp có thể giúp cải thiện hiệu suất mô hình, chẳng hạn bằng cách bổ sung dữ liệu huấn luyện ở những lĩnh vực còn thiếu hoặc mất cân đối dữ liệu, đồng thời có thể hỗ trợ các phương pháp tăng cường quyền riêng tư khi phát triển mô hình.
Thông tin cá nhân có được dùng để dạy ChatGPT không?
Một phần đáng kể nội dung trực tuyến chứa thông tin về con người, vì vậy dữ liệu huấn luyện của chúng tôi có thể vô tình bao gồm thông tin cá nhân. Tuy nhiên, chúng tôi thực hiện các biện pháp nhằm giảm việc xử lý thông tin cá nhân trong quá trình huấn luyện.
Chúng tôi sử dụng dữ liệu huấn luyện để phát triển các năng lực của mô hình—như dự đoán, suy luận và giải quyết vấn đề—chứ không phải để lập hồ sơ cá nhân, liên hệ với họ hoặc cá nhân hóa quảng cáo cho họ.
Trong một số trường hợp, mô hình có thể học từ thông tin cá nhân để hiểu vai trò của những yếu tố như tên và địa chỉ trong ngôn ngữ, hoặc để nhận diện nhân vật công chúng và các thực thể nổi tiếng. Điều này giúp mô hình tạo ra câu trả lời chính xác và phù hợp với ngữ cảnh hơn.
Thông tin cá nhân được bảo vệ như thế nào trong quá trình huấn luyện?
Chúng tôi chủ động thực hiện các biện pháp để hạn chế xử lý thông tin cá nhân trong quá trình huấn luyện. Ví dụ, chúng tôi loại trừ những nguồn được biết là tổng hợp lượng lớn dữ liệu cá nhân, áp dụng bộ lọc để giảm thông tin cá nhân trong quá trình huấn luyện, đồng thời xác định và loại bỏ nội dung trùng lặp nhằm giảm nguy cơ lặp lại dữ liệu huấn luyện. Ngoài ra, chúng tôi huấn luyện các mô hình để tránh phản hồi những yêu cầu cung cấp thông tin riêng tư hoặc nhạy cảm về cá nhân.
Thời gian chúng tôi lưu giữ thông tin
Chúng tôi chỉ lưu giữ thông tin trong dữ liệu huấn luyện trong khoảng thời gian hợp lý cần thiết cho các mục đích được mô tả trong bài viết này và Chính sách quyền riêng tư, bao gồm phát triển và cải thiện mô hình cũng như thực hiện các nghiên cứu khoa học liên quan. Việc lưu giữ được xem xét định kỳ để bảo đảm vẫn cần thiết, đồng thời thay đổi tùy theo loại thông tin và cách sử dụng thông tin đó. Khi xác định thời gian lưu giữ, chúng tôi cân nhắc các yếu tố như mục đích xử lý thông tin; khối lượng, tính chất và mức độ nhạy cảm của thông tin; nguy cơ gây hại tiềm ẩn từ việc sử dụng hoặc tiết lộ trái phép; cùng mọi nghĩa vụ pháp lý áp dụng cho chúng tôi.
Quá trình phát triển ChatGPT tuân thủ luật về quyền riêng tư như thế nào?
Chúng tôi sử dụng thông tin huấn luyện một cách hợp pháp. Các mô hình nền tảng của chúng tôi hỗ trợ nhiều ứng dụng hữu ích—bao gồm công cụ hỗ trợ khả năng tiếp cận, dịch vụ khách hàng, phát triển phần mềm, giáo dục cá nhân hóa và nghiên cứu khoa học. Những năng lực này phụ thuộc vào dữ liệu huấn luyện quy mô lớn, bao gồm thông tin công khai và thông tin từ các đối tác bên thứ ba. Chúng tôi áp dụng các biện pháp bảo vệ trong suốt quá trình huấn luyện, bao gồm những biện pháp được thiết kế để giảm việc xử lý thông tin cá nhân và hạn chế rủi ro, như mô tả trong bài viết này. Việc chúng tôi thu thập và sử dụng thông tin cá nhân có trong thông tin huấn luyện dựa trên lợi ích hợp pháp theo các luật về quyền riêng tư như GDPR, bao gồm việc huấn luyện và cải thiện mô hình cho người dùng và xã hội nói chung, phù hợp với sứ mệnh bảo đảm trí tuệ nhân tạo tổng hợp mang lại lợi ích cho mọi người. Nội dung này được giải thích chi tiết hơn trong Chính sách quyền riêng tư. Chúng tôi đã hoàn tất đánh giá tác động bảo vệ dữ liệu để góp phần bảo đảm rằng thông tin này được thu thập và sử dụng hợp pháp, có trách nhiệm.
Trường hợp thông tin có thể được chia sẻ hoặc chuyển giao
Chúng tôi không “bán” thông tin cá nhân và chỉ tiết lộ thông tin cá nhân trong dữ liệu huấn luyện ở những trường hợp hạn chế được nêu trong Chính sách quyền riêng tư. Ví dụ, chúng tôi có thể chia sẻ thông tin với các đơn vị liên kết, nhà cung cấp và bên cung cấp dịch vụ hỗ trợ việc phát triển, kiểm thử và cải thiện mô hình. Chúng tôi cũng có thể tiết lộ thông tin khi thực sự tin rằng việc đó là cần thiết để tuân thủ nghĩa vụ pháp lý hoặc bảo vệ quyền, sự an toàn và an ninh của chúng tôi cũng như của người dùng, nhân viên hoặc công chúng, như mô tả trong Chính sách quyền riêng tư.
Do cơ sở hạ tầng của chúng tôi hoạt động trên toàn cầu, thông tin cá nhân trong dữ liệu huấn luyện có thể được xử lý tại các quốc gia ngoài EEA, Thụy Sĩ hoặc Vương quốc Anh (bao gồm Hoa Kỳ). Trong trường hợp đó, chúng tôi áp dụng các biện pháp bảo vệ phù hợp, chẳng hạn như quyết định công nhận mức độ bảo vệ tương đương hoặc các điều khoản hợp đồng tiêu chuẩn, như mô tả trong Chính sách quyền riêng tư.
Quyền của bạn và cách thực hiện các quyền đó
Chúng tôi phản hồi các yêu cầu phản đối xử lý dữ liệu và yêu cầu thực hiện các quyền tương tự. Do học ngôn ngữ, câu trả lời của ChatGPT đôi khi có thể chứa thông tin cá nhân về những người có thông tin cá nhân xuất hiện nhiều lần trên Internet công khai (ví dụ: nhân vật công chúng). Cá nhân tại một số khu vực pháp lý có thể phản đối việc mô hình của chúng tôi xử lý thông tin cá nhân của họ hoặc gửi các yêu cầu khác liên quan đến quyền của chủ thể dữ liệu qua Cổng thông tin về quyền riêng tư. Bạn cũng có thể thực hiện các quyền này bằng cách liên hệ với privacy@openai.com.
Để giúp chúng tôi đánh giá và phản hồi yêu cầu, vui lòng cung cấp đủ thông tin để chúng tôi hiểu yêu cầu liên quan đến thông tin cá nhân nào, chẳng hạn như tên của bạn, các URL liên quan, ví dụ cụ thể về kết quả đầu ra của mô hình hoặc những chi tiết khác giúp xác định vấn đề. Trong một số trường hợp, chúng tôi có thể yêu cầu bạn xác minh danh tính hoặc xác nhận rằng thông tin đó liên quan đến bạn trước khi có thể thực hiện hành động. Bạn có thể xem thêm thông tin về cách gửi những yêu cầu này, bao gồm các phương pháp hay nhất và quy trình xem xét yêu cầu, trong bài viết của Trung tâm Trợ giúp về việc xóa dữ liệu cá nhân khỏi ChatGPT. Chúng tôi xem xét yêu cầu theo luật hiện hành về quyền riêng tư và phản hồi trong thời hạn luật định áp dụng.
Xin lưu ý rằng theo luật về quyền riêng tư, một số quyền có thể không phải là quyền tuyệt đối. Ví dụ, chúng tôi có thể không thực hiện được yêu cầu nếu không thể xác minh thông tin liên quan, yêu cầu không liên quan đến thông tin cá nhân do OpenAI xử lý, có trường hợp miễn trừ được áp dụng hoặc chúng tôi có lý do hợp pháp khác để không thực hiện. Các yêu cầu được đánh giá theo từng trường hợp và có thể cần cân bằng quyền riêng tư với những yếu tố quan trọng khác, chẳng hạn như quyền tự do biểu đạt và lợi ích công cộng.
Tuy nhiên, chúng tôi luôn nỗ lực ưu tiên bảo vệ thông tin cá nhân và tuân thủ mọi luật hiện hành về quyền riêng tư. Nếu cho rằng chúng tôi chưa giải quyết thỏa đáng một vấn đề, bạn có quyền gửi khiếu nại đến cơ quan giám sát tại địa phương.
Để biết thêm thông tin về cách OpenAI xử lý thông tin cá nhân mà chúng tôi thu thập từ bạn hoặc về bạn khi bạn sử dụng trang web, ứng dụng và dịch vụ của chúng tôi, vui lòng xem Chính sách quyền riêng tư.
