OpenAI
या पेजला मशीनद्वारे भाषांतरित केले आहे. मूळ इंग्रजी लेख पहा.

ChatGPT आणि आमची फाउंडेशन मॉडेल्स कशी विकसित केली जातात

आम्ही आमची मॉडेल्स कशी विकसित करतो आणि ChatGPT सारख्या उत्पादनांमध्ये त्यांचा कसा वापर करतो याबद्दल अधिक जाणून घ्या.

अपडेट केले: 8 days ago

ChatGPT ला चालना देणाऱ्या मॉडेल्ससह OpenAI ची फाउंडेशन मॉडेल्स माहितीच्या तीन प्रमुख स्रोतांचा वापर करून विकसित केली जातात: (1) इंटरनेटवर सार्वजनिकरीत्या उपलब्ध असलेली माहिती, (2) तृतीय पक्षांसोबत भागीदारी करून आम्हाला प्रवेश मिळणारी माहिती आणि (3) आमचे वापरकर्ते, मानवी प्रशिक्षक आणि संशोधक पुरवतात किंवा तयार करतात ती माहिती.

ChatGPT मध्ये वापरल्या जाणाऱ्या फाउंडेशन मॉडेल्ससारखी मॉडेल्स विकसित करताना प्रशिक्षण डेटा तयार करणे, प्री-ट्रेनिंग आणि पोस्ट-ट्रेनिंग, तसेच उपयोजनानंतर सतत मूल्यांकन आणि सुधारणा अशा अनेक टप्प्यांचा समावेश असतो. या टप्प्यांमध्ये विविध उद्देशांसाठी वेगवेगळ्या प्रकारची माहिती वापरली जाऊ शकते, ज्यात मॉडेलची कामगिरी, विश्वसनीयता आणि सुरक्षितता सुधारणे यांचा समावेश आहे. 

या लेखात आम्ही ही मॉडेल्स विकसित करण्यात मदत करण्यासाठी वापरत असलेल्या माहितीचा, गोपनीयता कायद्यांचे पालन करून ती माहिती कशी गोळा व वापरतो याचा आणि संपूर्ण प्रशिक्षण प्रक्रियेत लागू केलेल्या सुरक्षा उपायांचा आढावा दिला आहे. आमच्या सेवांच्या वापरकर्त्यांकडून आम्ही माहिती कशी गोळा व वापरतो, तसेच आमची मॉडेल्स सुधारण्यात मदत करण्यासाठी ChatGPT संभाषणे वापरण्यापासून बाहेर कसे पडावे हे समजून घेण्यासाठी, कृपया आमची प्रायव्हसी पॉलिसी आणि मदत केंद्रातील हा लेख पहा.

ChatGPT म्हणजे काय आणि ते कसे काम करते?

ChatGPT ही कृत्रिम बुद्धिमत्तेवर आधारित सेवा आहे, जी तुम्ही इंटरनेट किंवा अॅपद्वारे वापरू शकता. माहितीचे आयोजन आणि सारांश करणे, भाषांतरात मदत करणे, कोडिंग, संशोधन आणि विश्लेषणाला सहाय्य करणे, साधनांमध्ये अनेक टप्प्यांची कामे पूर्ण करणे, प्रतिमांचे विश्लेषण करणे किंवा त्या तयार करणे, सर्जनशीलता आणि कल्पनांना प्रेरणा देणे आणि इतर दैनंदिन कामे अशा विस्तृत कामांसाठी तुम्ही ChatGPT वापरू शकता. मजकूर, प्रतिमा, ऑडिओ आणि व्हिडिओ यांसह मोठ्या प्रमाणातील माहितीमधून नमुने शिकून वापरकर्त्यांचे प्रश्न आणि सूचना समजून घेण्यासाठी आणि त्यांना प्रतिसाद देण्यासाठी ChatGPT तयार केले आहे. 

प्रशिक्षणादरम्यान, मॉडेल या डेटामधील संबंधांचे विश्लेषण करते. उदाहरणार्थ, संदर्भात शब्द साधारणपणे एकत्र कसे येतात. प्रतिसाद तयार करताना, एका वेळी एक शब्द अशा प्रकारे पुढील सर्वाधिक संभाव्य शब्दाचा अंदाज लावण्यासाठी ते हे आकलन वापरते. मजकूर लहान घटकांमध्ये रूपांतरित केला जाऊ शकतो, ज्यांना कधीकधी “टोकन” म्हटले जाते. ही पूर्ण शब्द, शब्दांचे भाग किंवा विरामचिन्हे दर्शवू शकतात. टोकन हे मजकुराचे मूलभूत घटक आहेत, ज्यांवर मॉडेल प्रक्रिया करते. त्याचप्रमाणे, प्रतिमांसारख्या इतर प्रकारची सामग्री तयार करणारी मॉडेल्स प्रशिक्षण डेटामध्ये पिक्सेल एकमेकांशी आणि संबंधित कॅप्शन्सशी कसे जोडलेले असतात यातील नमुने शिकतात.

उदाहरणार्थ, मॉडेलच्या शिकण्याच्या प्रक्रियेदरम्यान, ज्याला “प्रशिक्षण” म्हणतात, मॉडेलला असे वाक्य पूर्ण करण्याचे काम दिले जाऊ शकते: “डावीकडे वळण्याऐवजी, ती ___ वळली.” प्रशिक्षणाच्या सुरुवातीला त्याचे प्रतिसाद बहुतांश यादृच्छिक असतात. मात्र, मॉडेल मोठ्या प्रमाणातील मजकुरावर प्रक्रिया करून त्यातून शिकत जाते तसे ते नमुने ओळखण्यात आणि पुढील सर्वाधिक संभाव्य शब्दाचा अंदाज लावण्यात अधिक चांगले होते. त्याचे आकलन अधिक परिष्कृत करण्यासाठी आणि अचूकता वाढवण्यासाठी ही प्रक्रिया लाखो वाक्यांवर पुन्हा पुन्हा केली जाते.

वाक्य पूर्ण करण्याचे अनेक संभाव्य मार्ग असू शकतात. उदाहरणार्थ, “डावीकडे वळण्याऐवजी, ती उजवीकडे वळली,” “मागे वळली” किंवा “परत वळली.” त्यामुळे मॉडेल कसा प्रतिसाद देते यात यादृच्छिकतेचा एक अंतर्निहित घटक असतो. परिणामी, एकाच प्रश्नाला वेगवेगळ्या क्वेरीजमध्ये वेगवेगळी उत्तरे मिळू शकतात.

मशीन लर्निंग मॉडेल्समध्ये संख्यांचे मोठे संच असतात, ज्यांना “वेट्स” किंवा “पॅरामीटर्स” म्हणतात, आणि त्या संख्यांचे अर्थ लावणारा व त्यांचा वापर करणारा कोड असतो. ही मॉडेल्स ज्या डेटावर प्रशिक्षित केली जातात, त्या डेटाच्या प्रती साठवत किंवा राखून ठेवत नाहीत. त्याऐवजी, मॉडेल शिकत असताना त्याने ओळखलेल्या नमुन्यांचे प्रतिबिंब पडावे म्हणून त्याच्या पॅरामीटर्सच्या मूल्यांमध्ये थोडे समायोजन केले जाते. पूर्वीच्या उदाहरणात, मॉडेल यादृच्छिक शब्दांचा अंदाज लावण्यापासून अधिक अचूक अंदाज लावण्यापर्यंत सुधारले. हे प्रशिक्षणातील वाक्ये साठवून नव्हे, तर त्याचे अंतर्गत पॅरामीटर्स अद्ययावत करून झाले. प्रशिक्षणादरम्यान मॉडेल ज्या वाक्यांवर, प्रतिमांवर किंवा ऑडिओवर प्रक्रिया करते, त्यांच्या प्रती ते राखून ठेवत नाही. ChatGPT आपल्या प्रशिक्षण डेटामधून “कॉपी आणि पेस्ट” करत नाही. हे त्या शिक्षकासारखे आहे, जो सखोल अभ्यासानंतर मूळ साहित्य तंतोतंत पाठ न करता किंवा पुन्हा न मांडता, कल्पनांमधील संबंध समजून घेऊन संकल्पना स्पष्ट करू शकतो. वापरकर्त्याच्या विनंतीला प्रतिसाद तयार करताना, मॉडेल अंदाज लावण्यासाठी आणि नवीन सामग्री तयार करण्यासाठी हे शिकलेले वेट्स वापरते.

ChatGPT ला शिकवण्यासाठी कोणत्या प्रकारची माहिती वापरली जाते?

सार्वजनिकरीत्या उपलब्ध इंटरनेट सामग्रीसाठी, आम्ही फक्त इंटरनेटवर मोफत आणि खुलेपणे उपलब्ध असलेली माहिती वापरतो. यात सार्वजनिकरीत्या उपलब्ध वेबपृष्ठे, सार्वजनिक फोरम, सार्वजनिक ब्लॉग, सार्वजनिक पोस्ट आणि इतर सार्वजनिकरीत्या उपलब्ध ऑनलाइन सामग्रीचा समावेश असू शकतो. उदाहरणार्थ, तुम्ही सार्वजनिकरीत्या उपलब्ध ऑनलाइन चर्चा फोरममध्ये सहभागी झालात किंवा सार्वजनिक ब्लॉग किंवा इतर पोस्ट प्रकाशित केली, तर आम्ही ती सार्वजनिकरीत्या प्रवेशयोग्य सामग्री मॉडेल प्रशिक्षणासाठी वापरू शकतो. तथापि, आमच्या प्रशिक्षण प्रक्रियेत वैयक्तिक माहितीवरील प्रक्रिया कमी करण्यासाठी आम्ही पावले उचलतो.  सार्वजनिकरीत्या उपलब्ध इंटरनेट सामग्री गोळा करताना, आम्ही पेवॉलच्या मागे असल्याचे ज्ञात असलेल्या स्रोतांमधून किंवा डार्क वेबमधून जाणूनबुजून डेटा गोळा करत नाही. याशिवाय, आमच्या मॉडेल्सनी ज्यातून शिकू नये असे आम्हाला वाटते अशी सामग्री काढण्यासाठी आम्ही फिल्टर्स लागू करतो, जसे की द्वेषपूर्ण भाषण, प्रौढांसाठीची सामग्री, वैयक्तिक माहिती एकत्र करणाऱ्या साइट्स आणि स्पॅम. उरलेली माहिती मग आमची मॉडेल्स प्रशिक्षित करण्यासाठी वापरली जाते. 

वेबसाइट मालक त्यांच्या साइटवरील सार्वजनिकरीत्या उपलब्ध सामग्री प्रशिक्षणासाठी वापरण्यासाठी अॅक्सेस केली जाऊ शकते की नाही हे व्यवस्थापित करू शकतात. यासाठी robots.txt सारख्या मानक वेब नियंत्रणांचा वापर करून GPTBot ला परवानगी नाकारता येते, जो आमची मॉडेल्स प्रशिक्षित करण्यात मदत करण्यासाठी सार्वजनिकरीत्या उपलब्ध सामग्री क्रॉल करू शकतो. वेबसाइट मालकांना त्यांच्या साइट्स आणि सामग्री आमच्या AI प्रणालींशी कशा प्रकारे परस्परसंवाद करतात हे व्यवस्थापित करण्यात मदत करण्यासाठी आम्ही मार्गदर्शन पुरवतो. 

आमची मॉडेल्स प्रशिक्षित आणि सुधारित करण्यात मदत करण्यासाठी आम्ही तृतीय-पक्ष भागीदारांकडील माहितीही वापरतो. यात तृतीय पक्षांसोबतच्या करारांद्वारे आम्हाला प्रवेश मिळणाऱ्या डेटासेट्समधील माहिती, तसेच आमच्या धोरणे आणि करारांनुसार परवानगी असेल तेथे मानवी प्रशिक्षक आणि संशोधकांनी पुरवलेली किंवा तयार केलेली माहिती समाविष्ट असू शकते. यामुळे आमच्या मॉडेल्सची गुणवत्ता, सुरक्षितता आणि कामगिरी सुधारण्यास मदत होते. डेटासेटनुसार, या स्रोतांमध्ये मजकूर, प्रतिमा, ऑडिओ, व्हिडिओ किंवा इतर डेटा प्रकारांचा समावेश असू शकतो.

आम्ही काही प्रशिक्षण प्रक्रियांमध्ये कृत्रिम डेटाचाही वाढत्या प्रमाणात वापर करतो. उदाहरणार्थ, कृत्रिम प्रॉम्प्ट्स, बहुभाषिक उदाहरणे किंवा इतर प्रशिक्षण सामग्री तयार करण्यासाठी आम्ही माहिती आणि आमची मॉडेल्स वापरू शकतो. कृत्रिम डेटा मॉडेलची कामगिरी सुधारण्यास मदत करू शकतो, जसे की डेटा कमी किंवा असंतुलित असलेल्या क्षेत्रांमध्ये प्रशिक्षण डेटाला पूरक ठरून. तसेच तो मॉडेल विकासासाठी गोपनीयता वाढवणाऱ्या पद्धतींनाही समर्थन देऊ शकतो.

ChatGPT ला शिकवण्यासाठी वैयक्तिक माहिती वापरली जाते का?

ऑनलाइन सामग्रीचा मोठा भाग लोकांबद्दलच्या माहितीशी संबंधित असतो, त्यामुळे आमच्या प्रशिक्षण डेटामध्ये प्रसंगोपात वैयक्तिक माहिती समाविष्ट असू शकते. तथापि, आमच्या प्रशिक्षण प्रक्रियेत वैयक्तिक माहितीवरील प्रक्रिया कमी करण्यासाठी आम्ही पावले उचलतो.

मॉडेलच्या क्षमता विकसित करण्यासाठी आम्ही प्रशिक्षण डेटा वापरतो, जसे की अंदाज लावणे, रीझनिंग आणि समस्या सोडवणे. तो व्यक्तींची प्रोफाइल्स तयार करण्यासाठी, त्यांच्याशी संपर्क साधण्यासाठी किंवा त्यांना जाहिराती वैयक्तिकृत करून दाखवण्यासाठी वापरत नाही.

काही प्रकरणांमध्ये, नावे आणि पत्ते यांसारखे घटक भाषेत कसे कार्य करतात हे समजण्यासाठी किंवा सार्वजनिक व्यक्तिमत्त्वे आणि सुप्रसिद्ध घटक ओळखण्यासाठी मॉडेल्स वैयक्तिक माहितीतून शिकू शकतात. यामुळे मॉडेल अधिक अचूक आणि संदर्भाला अनुरूप प्रतिसाद तयार करू शकते.

प्रशिक्षणादरम्यान वैयक्तिक माहितीचे संरक्षण कसे केले जाते?

प्रशिक्षणादरम्यान वैयक्तिक माहितीवरील प्रक्रिया मर्यादित ठेवण्यासाठी आम्ही सक्रिय पावले उचलतो. उदाहरणार्थ, मोठ्या प्रमाणात वैयक्तिक डेटा एकत्र करणारे ज्ञात स्रोत आम्ही वगळतो, प्रशिक्षण प्रक्रियेत वैयक्तिक माहिती कमी करण्यासाठी फिल्टरिंग लागू करतो आणि प्रशिक्षण डेटाची पुनरावृत्ती होण्याचा धोका कमी करण्यासाठी डुप्लिकेट सामग्री ओळखून काढून टाकण्याची पावले उचलतो. याशिवाय, व्यक्तींविषयी खाजगी किंवा संवेदनशील माहिती मागणाऱ्या विनंत्यांना प्रतिसाद देणे टाळण्यासाठी आम्ही आमची मॉडेल्स प्रशिक्षित करतो. 

आम्ही माहिती किती काळ राखून ठेवतो

या लेखात आणि आमच्या प्रायव्हसी पॉलिसी मध्ये वर्णन केलेल्या उद्देशांसाठी वाजवीरीत्या आवश्यक असेल तेवढ्याच काळासाठी आम्ही प्रशिक्षण डेटामधील माहिती राखून ठेवतो. यात आमची मॉडेल्स विकसित आणि सुधारित करणे तसेच संबंधित वैज्ञानिक संशोधन उद्देशांचा समावेश आहे. राखून ठेवणे अद्याप आवश्यक आहे का हे सुनिश्चित करण्यासाठी त्याचा नियतकालिक आढावा घेतला जातो, आणि माहितीचा प्रकार व ती कशी वापरली जाते यानुसार तो कालावधी बदलतो. माहिती किती काळ राखून ठेवावी हे ठरवताना, आम्ही त्या माहितीवर प्रक्रिया करण्यामागचा उद्देश, माहितीचे प्रमाण, स्वरूप आणि संवेदनशीलता, अनधिकृत वापर किंवा उघड केल्यामुळे होऊ शकणाऱ्या हानीचा संभाव्य धोका आणि आमच्यावर लागू असलेली कोणतीही कायदेशीर बंधने यांसारखे घटक विचारात घेतो.

ChatGPT चा विकास गोपनीयता कायद्यांचे पालन कसे करतो?

आम्ही प्रशिक्षण माहितीचा कायदेशीररीत्या वापर करतो. आमची फाउंडेशन मॉडेल्स प्रवेशयोग्यता साधने, ग्राहक समर्थन, सॉफ्टवेअर विकास, वैयक्तिकृत शिक्षण आणि वैज्ञानिक संशोधन यांसह अनेक उपयुक्त अनुप्रयोगांना चालना देतात. या क्षमतांसाठी सार्वजनिकरीत्या उपलब्ध माहिती आणि तृतीय-पक्ष भागीदारांकडील माहिती यांसह लार्ज-स्केल ट्रेनिंग डेटा आवश्यक असतो. या लेखात वर्णन केल्याप्रमाणे, प्रशिक्षण प्रक्रियेत वैयक्तिक माहितीवरील प्रक्रिया कमी करण्यासाठी आणि जोखीम कमी करण्यासाठी तयार केलेल्या पावलांसह आम्ही संपूर्ण प्रशिक्षण प्रक्रियेत सुरक्षा उपाय लागू करतो. प्रशिक्षण माहितीमध्ये समाविष्ट असलेली वैयक्तिक माहिती आम्ही गोळा आणि वापरतो, यासाठी GDPR सारख्या गोपनीयता कायद्यांखाली वैध हितसंबंध हा आधार घेतो. यात आमच्या वापरकर्त्यांसाठी आणि व्यापक समाजासाठी आमची मॉडेल्स प्रशिक्षित व सुधारित करणे समाविष्ट आहे, जे आर्टिफिशियल जनरल इंटेलिजन्सचा लाभ सर्वांना मिळावा याची खात्री करण्याच्या आमच्या ध्येयाशी सुसंगत आहे. याचे अधिक तपशीलवार स्पष्टीकरण आमच्या प्रायव्हसी पॉलिसी मध्ये दिले आहे. ही माहिती कायदेशीर आणि जबाबदारीने गोळा व वापरली जात आहे याची खात्री करण्यास मदत व्हावी म्हणून आम्ही डेटा संरक्षण परिणाम मूल्यांकन पूर्ण केले आहे.

माहिती कधी शेअर किंवा हस्तांतरित केली जाऊ शकते

आम्ही वैयक्तिक माहिती “विकत” नाही, आणि प्रशिक्षण डेटामधील वैयक्तिक माहिती आमच्या प्रायव्हसी पॉलिसीमध्ये वर्णन केलेल्या मर्यादित परिस्थितींमध्येच उघड करतो. उदाहरणार्थ, आमच्या मॉडेल्सच्या विकास, चाचणी आणि सुधारणेला समर्थन देणाऱ्या संलग्न संस्था, विक्रेते आणि सेवा पुरवठादारांसोबत आम्ही माहिती शेअर करू शकतो. कायदेशीर बंधनाचे पालन करण्यासाठी किंवा आमचे तसेच आमचे वापरकर्ते, कर्मचारी किंवा सार्वजनिक यांचे हक्क, सुरक्षा आणि संरक्षण जपण्यासाठी अशी कारवाई आवश्यक आहे असा सद्भावनेत विश्वास असल्यास आम्ही माहिती उघड करू शकतो, जसे आमच्या प्रायव्हसी पॉलिसी मध्ये वर्णन केले आहे.

आमची पायाभूत रचना जागतिक असल्यामुळे, प्रशिक्षण डेटामधील वैयक्तिक माहिती EEA, स्वित्झर्लंड किंवा UK बाहेरील देशांमध्ये, ज्यात युनायटेड स्टेट्सचा समावेश आहे, प्रक्रिया केली जाऊ शकते. असे घडल्यास, आमच्या प्रायव्हसी पॉलिसी मध्ये वर्णन केल्याप्रमाणे आम्ही पर्याप्तता निर्णय किंवा मानक करार कलमे यांसारखे योग्य सुरक्षा उपाय लागू करतो.

तुमचे हक्क आणि त्यांचा वापर कसा करावा

आम्ही आक्षेप विनंत्या आणि तत्सम हक्क विनंत्यांना प्रतिसाद देतो. भाषा शिकण्याच्या परिणामी, ChatGPT चे प्रतिसाद कधीकधी अशा व्यक्तींविषयी वैयक्तिक माहिती समाविष्ट करू शकतात ज्यांची वैयक्तिक माहिती सार्वजनिक इंटरनेटवर अनेक वेळा दिसते, उदाहरणार्थ सार्वजनिक व्यक्तिमत्त्वे. काही न्यायक्षेत्रांतील व्यक्ती त्यांच्या वैयक्तिक माहितीवर आमच्या मॉडेल्सद्वारे होणाऱ्या प्रक्रियेला आक्षेप घेऊ शकतात किंवा आमच्या प्रायव्हसी पोर्टल द्वारे इतर डेटा विषय हक्क विनंत्या करू शकतात. तुम्ही privacy@openai.com शी संपर्क साधूनही हे हक्क वापरू शकता. 

तुमच्या विनंतीचे मूल्यांकन करून प्रतिसाद देण्यास आम्हाला मदत व्हावी म्हणून, तुमची विनंती कोणत्या वैयक्तिक माहितीशी संबंधित आहे हे आम्हाला समजण्यासाठी पुरेशी माहिती द्या, जसे की तुमचे नाव, संबंधित URL, मॉडेल आउटपुटची विशिष्ट उदाहरणे किंवा समस्या ओळखण्यास मदत करणारे इतर तपशील. काही प्रकरणांमध्ये, आम्ही कारवाई करण्यापूर्वी तुम्हाला तुमची ओळख पडताळण्यास किंवा माहिती तुमच्याशी संबंधित असल्याची पुष्टी करण्यास सांगू शकतो. या विनंत्या कशा सबमिट कराव्यात, सर्वोत्तम पद्धती आणि विनंत्यांचा आढावा कसा घेतला जातो यासह अधिक माहिती, ChatGPT मधून वैयक्तिक डेटा काढून टाकण्याविषयी आमच्या हेल्प सेंटरमधील लेखात उपलब्ध आहे. लागू गोपनीयता कायद्यांनुसार आम्ही विनंत्यांचा आढावा घेतो आणि लागू कायदेशीर कालमर्यादेत प्रतिसाद देतो.

कृपया लक्षात घ्या की गोपनीयता कायद्यांनुसार काही हक्क पूर्णपणे निरपेक्ष असू शकत नाहीत. उदाहरणार्थ, संबंधित माहितीची पडताळणी आम्हाला करता येत नसेल, विनंती OpenAI द्वारे प्रक्रिया केलेल्या वैयक्तिक माहितीशी संबंधित नसेल, एखादा अपवाद लागू होत असेल किंवा तसे करण्यासाठी आमच्याकडे दुसरे कायदेशीर कारण असेल, तर आम्हाला विनंती पूर्ण करता येणार नाही. विनंत्यांचे मूल्यमापन प्रत्येक प्रकरणानुसार केले जाते आणि त्यात गोपनीयतेचे हक्क व अभिव्यक्ती स्वातंत्र्य आणि सार्वजनिक हित यांसारख्या इतर महत्त्वाच्या विचारांमध्ये संतुलन साधावे लागू शकते. 

तथापि, आम्ही वैयक्तिक माहितीच्या संरक्षणाला प्राधान्य देण्याचा प्रयत्न करतो आणि सर्व लागू गोपनीयता कायद्यांचे पालन करतो. आम्ही एखाद्या समस्येचे पुरेसे निराकरण केले नाही असे तुम्हाला वाटत असल्यास, तुम्हाला तुमच्या स्थानिक पर्यवेक्षी प्राधिकरणाकडे तक्रार दाखल करण्याचा हक्क आहे.

तुम्ही आमची वेबसाइट, अनुप्रयोग आणि सेवा वापरता तेव्हा तुमच्याकडून किंवा तुमच्याविषयी आम्ही गोळा करत असलेल्या वैयक्तिक माहितीबाबत OpenAI च्या पद्धतींबद्दल अधिक माहितीसाठी, कृपया आमची प्रायव्हसी पॉलिसी पहा.

हा लेख उपयुक्त आहे का?