ChatGPT चालवणाऱ्या मॉडेल्ससह OpenAI ची पायाभूत मॉडेल्स माहितीच्या तीन प्रमुख स्रोतांचा वापर करून विकसित केली जातात: (1) इंटरनेटवर सार्वजनिकरीत्या उपलब्ध असलेली माहिती, (2) तृतीय पक्षांसोबत भागीदारीतून आम्हाला उपलब्ध होणारी माहिती आणि (3) आमचे वापरकर्ते, मानवी प्रशिक्षक व संशोधक पुरवत किंवा तयार करत असलेली माहिती.
ChatGPT मध्ये वापरल्या जाणाऱ्या पायाभूत मॉडेल्सच्या विकासात प्रशिक्षण डेटा तयार करणे, प्री-ट्रेनिंग आणि प्रशिक्षणोत्तर प्रक्रिया अशा अनेक टप्प्यांचा समावेश होतो. उपयोजनानंतर त्यांचे सातत्याने मूल्यमापन आणि सुधारणा केली जाते. या टप्प्यांवर मॉडेलची कामगिरी, विश्वासार्हता आणि सुरक्षितता सुधारण्यासह विविध उद्देशांसाठी वेगवेगळ्या प्रकारची माहिती वापरली जाऊ शकते.
या मॉडेल्सच्या विकासासाठी आम्ही वापरत असलेल्या माहितीचा, गोपनीयताविषयक कायद्यांचे पालन करून ती माहिती कशी गोळा व वापरतो याचा आणि संपूर्ण प्रशिक्षण प्रक्रियेत लागू करत असलेल्या सुरक्षात्मक उपायांचा आढावा या लेखात दिला आहे. आमच्या सेवांच्या वापरकर्त्यांकडून आम्ही माहिती कशी गोळा करतो आणि वापरतो, तसेच आमची मॉडेल्स सुधारण्यासाठी ChatGPT मधील संभाषणे वापरली जाऊ नयेत हा पर्याय कसा निवडावा, हे समजून घेण्यासाठी आमची प्रायव्हसी पॉलिसी आणि हेल्प सेंटरमधील हा लेख पाहा.
ChatGPT म्हणजे काय आणि ते कसे काम करते?
ChatGPT ही कृत्रिम बुद्धिमत्तेवर आधारित सेवा असून, तुम्ही इंटरनेट किंवा अनुप्रयोगाद्वारे ती वापरू शकता. माहिती व्यवस्थित मांडणे आणि तिचा सारांश करणे, भाषांतरात मदत घेणे, आज्ञावली लेखन, संशोधन व विश्लेषणासाठी साहाय्य मिळवणे, विविध साधनांमधून बहुपदरी कामे पूर्ण करणे, प्रतिमांचे विश्लेषण किंवा निर्मिती करणे, सर्जनशीलता व कल्पनांना चालना देणे आणि इतर दैनंदिन कामे अशा अनेक गोष्टींसाठी तुम्ही ChatGPT वापरू शकता. मजकूर, प्रतिमा, ध्वनी आणि दृकश्राव्य सामग्रीसह मोठ्या प्रमाणातील माहितीमधून आकृतिबंध शिकून वापरकर्त्यांचे प्रश्न व सूचना समजून घेण्यासाठी आणि त्यांना प्रतिसाद देण्यासाठी ChatGPT तयार केले आहे.
प्रशिक्षणादरम्यान मॉडेल या डेटामधील परस्परसंबंधांचे विश्लेषण करते—उदाहरणार्थ, संदर्भानुसार कोणते शब्द सहसा एकत्र येतात—आणि या आकलनाच्या आधारे प्रतिसाद तयार करताना प्रत्येक वेळी पुढील सर्वाधिक संभाव्य शब्दाचा अंदाज लावते. मजकुराचे लहान घटकांत रूपांतर केले जाऊ शकते. त्यांना कधीकधी “टोकन” म्हणतात आणि ते पूर्ण शब्द, शब्दांचे भाग किंवा विरामचिन्हे दर्शवू शकतात. टोकन हे मॉडेल प्रक्रिया करत असलेल्या मजकुराचे मूलभूत घटक असतात. त्याचप्रमाणे, प्रतिमांसारखी इतर प्रकारची सामग्री तयार करणारी मॉडेल्स प्रशिक्षण डेटामधील दृश्यबिंदूंचा एकमेकांशी आणि संबंधित मथळ्यांशी असलेला संबंध शिकतात.
उदाहरणार्थ, मॉडेलच्या शिकण्याच्या प्रक्रियेत (जिला “प्रशिक्षण” म्हणतात) त्याला असे वाक्य पूर्ण करण्यास सांगितले जाऊ शकते: “डावीकडे वळण्याऐवजी ती ___ वळली.” प्रशिक्षणाच्या सुरुवातीला त्याचे प्रतिसाद बहुतांशी अनियमित असतात. मात्र, मोठ्या प्रमाणातील मजकुरावर प्रक्रिया करून त्यातून शिकत गेल्याने मॉडेल आकृतिबंध अधिक चांगल्या प्रकारे ओळखू लागते आणि पुढील सर्वाधिक संभाव्य शब्दाचा अधिक अचूक अंदाज लावते. त्याचे आकलन अधिक परिष्कृत करण्यासाठी आणि अचूकता सुधारण्यासाठी ही प्रक्रिया लाखो वाक्यांवर पुन्हा पुन्हा केली जाते.
एखादे वाक्य पूर्ण करण्याचे अनेक योग्य मार्ग असू शकतात—उदाहरणार्थ, “डावीकडे वळण्याऐवजी ती उजवीकडे वळली,” “वळून गेली” किंवा “मागे वळली”—त्यामुळे मॉडेलच्या प्रतिसादात स्वाभाविकपणे काही प्रमाणात अनियमितता असते. त्यामुळे एकच प्रश्न वेगवेगळ्या वेळी विचारल्यास वेगवेगळी उत्तरे मिळू शकतात.
यंत्र-अध्ययन मॉडेल्समध्ये “भार” किंवा “मापदंड” म्हणून ओळखल्या जाणाऱ्या संख्यांचे मोठे संच आणि त्या संख्यांचा अर्थ लावून त्यांचा वापर करणारी आज्ञावली असते. ही मॉडेल्स ज्या डेटावर प्रशिक्षित केली जातात, त्याच्या प्रती साठवत किंवा जतन करत नाहीत. त्याऐवजी, मॉडेल शिकत असताना त्याने ओळखलेले आकृतिबंध प्रतिबिंबित करण्यासाठी त्याच्या मापदंडांची मूल्ये किंचित बदलली जातात. आधीच्या उदाहरणात, प्रशिक्षणातील वाक्ये साठवून नव्हे, तर अंतर्गत मापदंड अद्ययावत करून मॉडेलने अनियमित शब्दांच्या अंदाजाऐवजी अधिक अचूक अंदाज लावण्यास सुरुवात केली. प्रशिक्षणादरम्यान प्रक्रिया केलेली वाक्ये, प्रतिमा किंवा ध्वनी यांच्या प्रती मॉडेल जतन करत नाही. ChatGPT त्याच्या प्रशिक्षण डेटामधून मजकूर “नकल करून चिकटवत” नाही. जसे एखादा शिक्षक सखोल अभ्यासानंतर मूळ सामग्री तोंडपाठ न करता किंवा शब्दशः पुन्हा न सांगता कल्पनांमधील संबंध समजून संकल्पना स्पष्ट करू शकतो, तसेच ते काम करते. वापरकर्त्याच्या विनंतीला प्रतिसाद तयार करताना मॉडेल शिकलेल्या भारांचा वापर करून अंदाज लावते आणि नवीन सामग्री तयार करते.
ChatGPT ला शिकवण्यासाठी कोणत्या प्रकारची माहिती वापरली जाते?
इंटरनेटवरील सार्वजनिक सामग्रीपैकी आम्ही केवळ मुक्तपणे आणि विनामूल्य उपलब्ध असलेली माहिती वापरतो. यामध्ये सार्वजनिकरीत्या उपलब्ध वेबपृष्ठे, चर्चा मंच, अनुदिन्या, पोस्ट आणि इतर ऑनलाइन सामग्रीचा समावेश असू शकतो. उदाहरणार्थ, तुम्ही सार्वजनिक ऑनलाइन चर्चा मंचात सहभागी झालात किंवा सार्वजनिक अनुदिनी अथवा अन्य पोस्ट प्रकाशित केली, तर आम्ही ती सार्वजनिक सामग्री मॉडेलच्या प्रशिक्षणासाठी वापरू शकतो. मात्र, आमच्या प्रशिक्षण प्रक्रियेत वैयक्तिक माहितीवर होणारी प्रक्रिया कमी करण्यासाठी आम्ही उपाय करतो. इंटरनेटवरील सार्वजनिक सामग्री गोळा करताना सशुल्क प्रवेशामागे असलेल्या ज्ञात स्रोतांमधून किंवा गुप्त जालावरून आम्ही जाणीवपूर्वक डेटा गोळा करत नाही. द्वेषपूर्ण वक्तव्ये, प्रौढांसाठीची सामग्री, वैयक्तिक माहिती एकत्रित करणारी संकेतस्थळे आणि अवांछित संदेश अशा ज्या सामग्रीमधून आमच्या मॉडेल्सनी शिकू नये, ती काढून टाकण्यासाठी आम्ही गाळणेही लागू करतो. त्यानंतर उरलेली माहिती आमच्या मॉडेल्सच्या प्रशिक्षणासाठी वापरली जाते.
संकेतस्थळांचे मालक robots.txt सारख्या प्रमाणित जाल-नियंत्रणांचा वापर करून, त्यांच्या संकेतस्थळावरील सार्वजनिक सामग्री प्रशिक्षणासाठी उपलब्ध होऊ द्यायची की नाही हे ठरवू शकतात. त्यासाठी आमच्या मॉडेल्सच्या प्रशिक्षणास मदत करण्यासाठी सार्वजनिक सामग्री शोधू शकणाऱ्या GPTBot ला प्रतिबंध करता येतो. संकेतस्थळांचे मालक त्यांच्या संकेतस्थळांचा आणि सामग्रीचा आमच्या कृत्रिम बुद्धिमत्ता प्रणालींशी होणारा परस्परसंवाद व्यवस्थापित करू शकावेत यासाठी आम्ही मार्गदर्शन पुरवतो.
आमच्या मॉडेल्सना प्रशिक्षित आणि सुधारण्यासाठी आम्ही तृतीय-पक्ष भागीदारांकडील माहितीही वापरतो. यामध्ये तृतीय पक्षांशी केलेल्या करारांद्वारे आम्हाला उपलब्ध होणाऱ्या डेटासंचांतील माहिती आणि आमची धोरणे व करारांनुसार परवानगी असेल तेथे मानवी प्रशिक्षक व संशोधकांनी पुरवलेली किंवा तयार केलेली माहिती समाविष्ट असू शकते. यामुळे आमच्या मॉडेल्सची गुणवत्ता, सुरक्षितता आणि कामगिरी सुधारण्यास मदत होते. डेटासंचानुसार या स्रोतांमध्ये मजकूर, प्रतिमा, ध्वनी, दृकश्राव्य सामग्री किंवा इतर प्रकारचा डेटा असू शकतो.
काही प्रशिक्षण प्रक्रियांमध्ये आम्ही कृत्रिम डेटाचाही वाढत्या प्रमाणात वापर करत आहोत. उदाहरणार्थ, कृत्रिम सूचना, बहुभाषिक उदाहरणे किंवा इतर प्रशिक्षण सामग्री तयार करण्यासाठी आम्ही माहिती आणि आमची मॉडेल्स वापरू शकतो. डेटा कमी किंवा असंतुलित असलेल्या क्षेत्रांतील प्रशिक्षण डेटाला पूरक ठरून कृत्रिम डेटा मॉडेलची कामगिरी सुधारू शकतो. तसेच, मॉडेलच्या विकासातील गोपनीयता वाढवणाऱ्या पद्धतींनाही तो साहाय्य करू शकतो.
ChatGPT ला शिकवण्यासाठी वैयक्तिक माहिती वापरली जाते का?
ऑनलाइन सामग्रीच्या मोठ्या भागात लोकांविषयीची माहिती असते, त्यामुळे आमच्या प्रशिक्षण डेटामध्ये अनुषंगाने वैयक्तिक माहिती समाविष्ट होऊ शकते. मात्र, आमच्या प्रशिक्षण प्रक्रियेत वैयक्तिक माहितीवर होणारी प्रक्रिया कमी करण्यासाठी आम्ही उपाय करतो.
आम्ही प्रशिक्षण डेटा मॉडेलची अंदाज, रीझनिंग आणि समस्या-निराकरण यांसारखी क्षमता विकसित करण्यासाठी वापरतो; व्यक्तींची रूपरेषा तयार करण्यासाठी, त्यांच्याशी संपर्क साधण्यासाठी किंवा त्यांच्यासाठी जाहिराती वैयक्तिकृत करण्यासाठी नाही.
काही प्रकरणांत, नावे आणि पत्ते यांसारखे घटक भाषेत कसे वापरले जातात हे समजून घेण्यासाठी किंवा सार्वजनिक व्यक्ती व प्रसिद्ध संस्था ओळखण्यासाठी मॉडेल्स वैयक्तिक माहितीमधून शिकू शकतात. यामुळे मॉडेलला अधिक अचूक आणि संदर्भाला अनुरूप प्रतिसाद तयार करता येतात.
प्रशिक्षणादरम्यान वैयक्तिक माहितीचे संरक्षण कसे केले जाते?
प्रशिक्षणादरम्यान वैयक्तिक माहितीवर होणारी प्रक्रिया मर्यादित करण्यासाठी आम्ही सक्रिय उपाय करतो. उदाहरणार्थ, मोठ्या प्रमाणात वैयक्तिक डेटा एकत्रित करणारे ज्ञात स्रोत आम्ही वगळतो, प्रशिक्षण प्रक्रियेतील वैयक्तिक माहिती कमी करण्यासाठी गाळणे लागू करतो आणि प्रशिक्षण डेटा पुन्हा दिला जाण्याचा धोका कमी करण्यासाठी दुबार सामग्री ओळखून काढून टाकण्याचे उपाय करतो. याशिवाय, व्यक्तींविषयीच्या खाजगी किंवा संवेदनशील माहितीच्या विनंत्यांना प्रतिसाद देणे टाळण्यासाठी आम्ही आमच्या मॉडेल्सना प्रशिक्षित करतो.
आम्ही माहिती किती काळ जतन करतो
आमची मॉडेल्स विकसित व सुधारणे आणि संबंधित वैज्ञानिक संशोधन करणे यांसह या लेखात आणि आमच्या प्रायव्हसी पॉलिसीमध्ये नमूद केलेल्या उद्देशांसाठी वाजवीरीत्या आवश्यक असेपर्यंतच आम्ही प्रशिक्षण डेटामधील माहिती जतन करतो. माहिती जतन करण्याची गरज कायम आहे याची खात्री करण्यासाठी वेळोवेळी आढावा घेतला जातो. माहितीचा प्रकार आणि तिचा वापर यांनुसार जतन कालावधी बदलतो. जतन कालावधी ठरवताना माहितीवर प्रक्रिया करण्याचा आमचा उद्देश; माहितीचे प्रमाण, स्वरूप आणि संवेदनशीलता; अनधिकृत वापर किंवा प्रकटीकरणामुळे होऊ शकणाऱ्या हानीचा संभाव्य धोका; आणि आमच्यावर लागू असलेली कोणतीही कायदेशीर बंधने यांचा आम्ही विचार करतो.
ChatGPT चा विकास गोपनीयताविषयक कायद्यांचे पालन कसे करतो?
आम्ही प्रशिक्षणातील माहितीचा कायदेशीररीत्या वापर करतो. आमची पायाभूत मॉडेल्स सुलभता साधने, ग्राहक सहाय्य, संगणक आज्ञावली विकास, वैयक्तिकृत शिक्षण आणि वैज्ञानिक संशोधनासह अनेक उपयुक्त अनुप्रयोगांना चालना देतात. या क्षमता सार्वजनिकरीत्या उपलब्ध माहिती आणि तृतीय-पक्ष भागीदारांकडील माहितीसह मोठ्या प्रमाणातील प्रशिक्षण डेटावर अवलंबून असतात. या लेखात वर्णन केल्याप्रमाणे, प्रशिक्षण प्रक्रियेत वैयक्तिक माहितीवरील प्रक्रिया कमी करण्यासाठी आणि धोके मर्यादित करण्यासाठी आखलेल्या उपायांसह आम्ही संपूर्ण प्रशिक्षण प्रक्रियेत सुरक्षात्मक उपाय लागू करतो. आर्टिफिशियल जनरल इंटेलिजन्सचा लाभ प्रत्येकाला मिळेल याची खात्री करण्याच्या आमच्या ध्येयाशी सुसंगतपणे, वापरकर्ते आणि व्यापक समाजासाठी आमची मॉडेल्स प्रशिक्षित व सुधारण्यासह प्रशिक्षणातील वैयक्तिक माहिती गोळा करण्यासाठी आणि वापरण्यासाठी आम्ही GDPR सारख्या गोपनीयताविषयक कायद्यांतील वैध हितसंबंधांचा आधार घेतो. याचे अधिक तपशीलवार स्पष्टीकरण आमच्या प्रायव्हसी पॉलिसीमध्ये दिले आहे. ही माहिती आम्ही कायदेशीर आणि जबाबदार पद्धतीने गोळा व वापरत आहोत याची खात्री करण्यासाठी आम्ही डेटा संरक्षण प्रभाव मूल्यमापन पूर्ण केले आहे.
माहिती कधी सामायिक किंवा हस्तांतरित केली जाऊ शकते
आम्ही वैयक्तिक माहिती “विकत” नाही आणि आमच्या प्रायव्हसी पॉलिसीमध्ये वर्णन केलेल्या मर्यादित परिस्थितीतच प्रशिक्षण डेटामधील वैयक्तिक माहिती उघड करतो. उदाहरणार्थ, आमच्या मॉडेल्सच्या विकासाला, चाचणीला आणि सुधारणेला साहाय्य करणाऱ्या संलग्न संस्था, विक्रेते आणि सेवा प्रदात्यांसोबत आम्ही माहिती सामायिक करू शकतो. कायदेशीर बंधनाचे पालन करण्यासाठी किंवा आमचे आणि आमचे वापरकर्ते, कर्मचारी किंवा जनतेचे हक्क व सुरक्षा जपण्यासाठी अशी कृती आवश्यक आहे, असा सद्भावनेने विश्वास असल्यास आम्ही माहिती उघड करू शकतो. याचे वर्णन आमच्या प्रायव्हसी पॉलिसीमध्ये केले आहे.
आमची पायाभूत सुविधा जागतिक असल्यामुळे प्रशिक्षण डेटामधील वैयक्तिक माहितीवर EEA, स्वित्झर्लंड किंवा UK बाहेरील देशांमध्ये (अमेरिकेसह) प्रक्रिया केली जाऊ शकते. असे घडल्यास, आमच्या प्रायव्हसी पॉलिसीमध्ये वर्णन केल्याप्रमाणे पुरेशा संरक्षणासंबंधीचे निर्णय किंवा प्रमाणित करारविषयक कलमे यांसारखे योग्य सुरक्षात्मक उपाय आम्ही लागू करतो.
तुमचे हक्क आणि त्यांचा वापर कसा करावा
आम्ही आक्षेपाच्या विनंत्यांना आणि हक्कांसंबंधी तत्सम विनंत्यांना प्रतिसाद देतो. भाषा शिकण्याच्या प्रक्रियेमुळे ChatGPT च्या प्रतिसादांमध्ये कधीकधी अशा व्यक्तींची वैयक्तिक माहिती येऊ शकते, ज्यांची माहिती सार्वजनिक इंटरनेटवर अनेकदा दिसते (उदाहरणार्थ, सार्वजनिक व्यक्ती). काही अधिकारक्षेत्रांतील व्यक्ती आमच्या मॉडेल्सद्वारे त्यांच्या वैयक्तिक माहितीवर होणाऱ्या प्रक्रियेला आक्षेप घेऊ शकतात किंवा आमच्या प्रायव्हसी पोर्टलद्वारे डेटा विषयाच्या इतर हक्कांसाठी विनंत्या करू शकतात. तुम्ही privacy@openai.com वर संपर्क साधूनही हे हक्क वापरू शकता.
तुमच्या विनंतीचे मूल्यमापन करून तिला प्रतिसाद देण्यासाठी, ती कोणत्या वैयक्तिक माहितीशी संबंधित आहे हे समजण्याइतकी माहिती आम्हाला द्या. उदाहरणार्थ, तुमचे नाव, संबंधित URL, मॉडेलच्या निष्पन्नाची विशिष्ट उदाहरणे किंवा समस्या ओळखण्यास मदत करणारे इतर तपशील द्या. काही प्रकरणांत, आम्ही कारवाई करण्यापूर्वी तुम्हाला तुमची ओळख सत्यापित करण्यास किंवा माहिती तुमच्याशी संबंधित असल्याची पुष्टी करण्यास सांगू शकतो. या विनंत्या कशा सादर कराव्यात, त्यासाठीच्या उत्तम पद्धती आणि विनंत्यांचे पुनरावलोकन कसे केले जाते याविषयी अधिक माहिती ChatGPT मधून वैयक्तिक डेटा काढून टाकण्यासंबंधीच्या आमच्या हेल्प सेंटरमधील लेखात उपलब्ध आहे. आम्ही लागू गोपनीयताविषयक कायद्यांनुसार विनंत्यांचे पुनरावलोकन करतो आणि लागू कायदेशीर मुदतीत प्रतिसाद देतो.
गोपनीयताविषयक कायद्यांनुसार काही हक्क निरपवाद नसू शकतात, याची कृपया नोंद घ्या. उदाहरणार्थ, संबंधित माहिती सत्यापित करता येत नसेल, विनंती OpenAI प्रक्रिया करत असलेल्या वैयक्तिक माहितीशी संबंधित नसेल, एखादा अपवाद लागू होत असेल किंवा ती पूर्ण न करण्यासाठी आमच्याकडे अन्य कायदेशीर कारण असेल, तर आम्ही विनंती पूर्ण करू शकणार नाही. प्रत्येक विनंतीचे स्वतंत्रपणे मूल्यमापन केले जाते. यामध्ये अभिव्यक्तिस्वातंत्र्य आणि सार्वजनिक हित यांसारख्या इतर महत्त्वाच्या बाबींच्या तुलनेत गोपनीयतेच्या हक्कांचा समतोल साधावा लागू शकतो.
तरीही, वैयक्तिक माहितीच्या संरक्षणाला प्राधान्य देण्याचा आणि लागू असलेल्या सर्व गोपनीयताविषयक कायद्यांचे पालन करण्याचा आम्ही प्रयत्न करतो. आम्ही एखाद्या समस्येचे पुरेसे निराकरण केले नाही असे तुम्हाला वाटत असल्यास, तुमच्या स्थानिक पर्यवेक्षी प्राधिकरणाकडे तक्रार नोंदवण्याचा तुम्हाला हक्क आहे.
तुम्ही आमचे संकेतस्थळ, अनुप्रयोग आणि सेवा वापरताना तुमच्याकडून किंवा तुमच्याविषयी आम्ही गोळा करत असलेल्या वैयक्तिक माहितीसंदर्भातील OpenAI च्या पद्धतींबद्दल अधिक माहितीसाठी आमची प्रायव्हसी पॉलिसी पाहा.
