OpenAI 的基礎模型,包括為 ChatGPT 提供支援的模型,主要使用三類資料開發:(1) 互聯網上的公開資料;(2) 我們與第三方合作取得的資料;以及 (3) 使用者、人工訓練員和研究人員提供或產生的資料。
開發 ChatGPT 所採用的基礎模型涉及多個階段,包括準備訓練資料、預訓練和後期訓練,以及部署後持續評估和改進。這些階段可能會使用不同類型的資料作各種用途,包括提升模型的效能、可靠性和安全性。
本文概述我們使用哪些資料協助開發這些模型、如何在遵守私隱法律的情況下收集和使用該等資料,以及在整個訓練過程中採取的保障措施。如欲了解我們如何收集和使用服務使用者的資料,包括如何選擇不讓我們使用 ChatGPT 對話協助改進模型,請參閱我們的私隱政策及這篇說明中心文章。
ChatGPT 是甚麼?如何運作?
ChatGPT 是一項人工智能服務,可透過互聯網或應用程式使用。您可以使用 ChatGPT 執行各種工作,包括整理和總結資料、協助翻譯、支援編程、研究和分析、運用多種工具完成多步驟工作、分析或生成圖像、啟發創意和構思,以及處理其他日常事務。ChatGPT 透過學習大量文字、圖像、音訊和影片等資料中的模式,理解並回應使用者的問題和指示。
訓練期間,模型會分析這些資料內的關係,例如詞語通常如何在特定語境中一同出現,並運用所得理解,在生成回應時逐字預測最可能出現的下一個詞語。文字可以轉換成較小的單位,有時稱為「權元」,可代表完整詞語、詞語的一部分或標點符號。權元是模型處理文字時所用的基本組成單位。同樣,生成圖像等其他形式內容的模型,會從訓練資料中學習像素彼此之間及其與相關說明文字之間的模式。
例如,在模型的學習過程(稱為「訓練」)中,模型可能需要完成以下句子:「她沒有向左轉,而是轉向了___。」在訓練初期,其回應大多是隨機的。不過,隨着模型處理大量文字並從中學習,它會逐漸更善於識別模式及預測最可能出現的下一個詞語。這個過程會在數以百萬計的句子中反覆進行,從而深化模型的理解並提高準確度。
由於一句話可以有多種合理的補充方式,例如「她沒有向左轉,而是向右轉」、「轉身」或「折返」,因此模型的回應本身帶有一定程度的隨機性。因此,即使提出相同問題,每次查詢也可能得到不同答案。
機器學習模型由大量稱為「權重」或「參數」的數值,以及解讀和使用這些數值的程式碼組成。這些模型不會儲存或保留訓練資料的副本。相反,模型在學習時會略為調整參數值,以反映其識別到的模式。在上述例子中,模型由隨機預測詞語進步至作出更準確的預測,並非因為儲存了訓練句子,而是因為更新了內部參數。模型不會保留訓練期間所處理句子、圖像或音訊的副本。ChatGPT 不會從訓練資料中「複製並貼上」內容。這就像教師經過深入研習後,能透過理解各種概念之間的關係加以講解,而無須背誦或逐字重現原始材料。模型回應使用者要求時,會運用這些習得的權重來預測並創作新內容。
哪些類型的資料會用於訓練 ChatGPT?
對於互聯網上的公開內容,我們只使用可在網上自由公開存取的資料。這可能包括公開網頁、公開論壇、公開網誌、公開帖文及其他網上公開內容。例如,如果您參與網上公開討論區,或發佈公開網誌或其他公開帖文,我們可能會使用該等公開內容訓練模型。不過,我們會採取措施,減少在訓練過程中處理個人資料。 收集互聯網上的公開內容時,我們不會蓄意從已知設有付費牆的來源或暗網收集資料。此外,我們會使用篩選機制,移除不希望模型學習的材料,例如仇恨言論、成人內容、彙集個人資料的網站和垃圾內容。其餘資料其後會用於訓練模型。
網站擁有人可以使用 robots.txt 等標準網絡控制項禁止 GPTBot,以管理其網站的公開內容能否被存取並用於訓練。GPTBot 可能會檢索公開內容,以協助訓練我們的模型。我們提供指引,協助網站擁有人管理其網站和內容與我們人工智能系統的互動方式。
我們也會使用第三方合作夥伴的資料,協助訓練和改進模型。這可能包括我們透過與第三方簽訂協議而取得的數據集資料,以及在政策和協議允許下,由人工訓練員和研究人員提供或產生的資料。這有助提升模型的質素、安全性和效能。視乎數據集,這些來源可能包括文字、圖像、音訊、影片或其他類型的資料。
我們亦逐漸在部分訓練過程中增加使用合成資料。例如,我們可能運用資料和模型,生成合成提示、多語言例子或其他訓練材料。合成資料可補充資料稀少或分佈不均領域的訓練資料,從而協助提升模型效能,亦可支援更能保障私隱的模型開發方式。
個人資料會用於訓練 ChatGPT 嗎?
網上內容有相當一部分涉及人物資料,因此訓練資料可能附帶包含個人資料。不過,我們會採取措施,減少在訓練過程中處理個人資料。
我們使用訓練資料來培養模型的預測、推理和解難等能力,而非建立個人檔案、聯絡相關人士或為他們提供個人化廣告。
在某些情況下,模型可能會從個人資料中學習,以理解姓名和地址等元素在語言中的作用,或識別公眾人物和知名實體。這有助模型生成更準確且切合語境的回應。
訓練期間如何保障個人資料?
我們積極採取措施,限制在訓練期間處理個人資料。例如,我們會排除已知彙集大量個人資料的來源、使用篩選機制減少訓練過程中的個人資料,並採取措施識別和移除重複內容,以降低重複訓練資料的風險。此外,我們會訓練模型避免回應索取個人私密或敏感資料的要求。
資料保留期限
我們只會在為達到本文及私隱政策所述目的而合理必要的期間內,保留訓練資料中的資料,包括用於開發和改進模型及相關科學研究。我們會定期檢討是否仍有必要保留資料,而保留期限則視乎資料類型和使用方式而異。釐定保留期限時,我們會考慮處理資料的目的、資料的數量、性質和敏感程度、未經授權使用或披露可能造成的損害風險,以及我們須履行的任何法律義務等因素。
ChatGPT 的開發如何遵守私隱法律?
我們依法使用訓練資料。我們的基礎模型支援多種有益的應用,包括無障礙工具、客戶支援、軟件開發、個人化教育和科學研究。這些能力有賴大規模訓練資料,包括公開資料及第三方合作夥伴提供的資料。我們在整個訓練過程中採取保障措施,包括減少處理個人資料及降低風險的措施,詳情如本文所述。我們根據 GDPR 等私隱法律所訂的合法權益,收集和使用訓練資料所包含的個人資料,包括為使用者及社會大眾訓練和改進模型,以履行確保通用人工智能惠及所有人的使命。詳情請參閱我們的私隱政策。我們已完成資料保障影響評估,以協助確保依法及負責任地收集和使用這些資料。
可能分享或轉移資料的情況
我們不會「出售」個人資料,並只會在私隱政策所述的有限情況下披露訓練資料中的個人資料。例如,我們可能會與支援模型開發、測試和改進的聯屬公司、供應商和服務供應商分享資料。如我們真誠相信披露資料是履行法律義務,或保障我們及使用者、僱員或公眾的權利、安全和保安所必需,我們亦可能披露資料,詳情請參閱我們的私隱政策。
由於我們的基礎設施遍佈全球,訓練資料中的個人資料可能會在歐洲經濟區、瑞士或英國以外的國家/地區(包括美國)處理。在這些情況下,我們會採取適當的保障措施,例如充分性決定或標準合約條款,詳情請參閱我們的私隱政策。
您的權利及行使方式
我們會回應反對處理的要求及其他類似的權利要求。在學習語言的過程中,ChatGPT 的回應有時可能包含在公開互聯網上多次出現的個人資料(例如公眾人物的資料)。特定司法管轄區的個人可透過我們的私隱入口網站,反對我們的模型處理其個人資料,或提出其他資料當事人權利要求。您亦可傳送電郵至 privacy@openai.com 行使這些權利。
為協助我們評估和回應您的要求,請提供足夠資料,讓我們了解要求涉及哪些個人資料,例如您的姓名、相關網址、模型輸出的具體例子,或其他有助識別問題的詳情。在某些情況下,我們可能要先請您驗證身分或確認資料與您有關,方可採取行動。如欲進一步了解如何提出這些要求,包括最佳做法和審核方式,請參閱說明中心有關從 ChatGPT 移除個人資料的文章。我們會按照適用的私隱法律審核要求,並在適用的法定期限內回應。
請注意,根據私隱法律,部分權利可能並非絕對。例如,如果我們無法核實相關資料、要求與 OpenAI 處理的個人資料無關、適用豁免情況,或我們另有合法理由,便可能無法履行要求。我們會按個別情況評估要求,當中可能需要在私隱權與言論自由和公眾利益等其他重要考慮因素之間取得平衡。
不過,我們致力優先保障個人資料,並遵守所有適用的私隱法律。如果您認為我們未有妥善處理問題,您有權向當地監管機構提出投訴。
如欲進一步了解您使用我們的網站、應用程式和服務時,OpenAI 如何處理由您提供或關於您的個人資料,請參閱我們的私隱政策。
