OpenAI
या पेजला मशीनद्वारे भाषांतरित केले आहे. मूळ इंग्रजी लेख पहा.

कॅलिफोर्निया सिव्हिल कोड कलम 3111 नुसार प्रशिक्षण डेटाचा सारांश

अपडेट केले: 7 days ago

OpenAI कॅलिफोर्निया राज्यात सार्वजनिकरीत्या उपलब्ध जनरेटिव्ह AI प्रणाली ऑफर करते. आम्ही या प्रणाली विविध डेटा स्रोत वापरून विकसित करतो, ज्यात सार्वजनिकरीत्या उपलब्ध डेटा, तृतीय पक्षांसोबत भागीदारी करून आम्हाला अ‍ॅक्सेस मिळणारा डेटा, आणि आमचे वापरकर्ते किंवा मानवी प्रशिक्षक व संशोधक पुरवतात किंवा तयार करतात ती माहिती समाविष्ट आहे. आम्ही सिंथेटिक डेटा वापरूनही आमच्या प्रणाली विकसित करतो.

आमच्या प्रणालींना मानवी भाषा आणि जग अधिक चांगल्या प्रकारे समजण्यास मदत व्हावी म्हणून आम्ही डेटा वापरतो. त्यामुळे आमच्या प्रणालींना मानवी सर्जनशीलता वाढवणे, वैज्ञानिक शोध आणि वैद्यकीय संशोधन पुढे नेणे, आणि शेकडो लाखो लोकांना त्यांचे दैनंदिन जीवन सुधारण्यास सक्षम करणे शक्य होते. आमच्या प्रणाली मजकूर, प्रतिमा, ऑडिओ आणि ऑडिओव्हिज्युअल सामग्रीच्या ट्रिलियनो टोकन असलेल्या डेटासेटवर विकसित केल्या जातात.

आमच्या प्रणाली विकसित करण्यासाठी आम्ही विविध प्रकारचा डेटा वापरतो, ज्यात कॉपीराइटद्वारे संरक्षित असू शकणारा डेटा आणि सार्वजनिक डोमेनमधील डेटा समाविष्ट आहे. आमच्या प्रशिक्षण डेटासेटमधील वैयक्तिक माहितीचे प्रमाण कमी करण्यासाठी आम्ही पावले उचलत असलो, तरी आमच्या काही डेटामध्ये California Civil Code Section 1798.140 मध्ये परिभाषित केल्याप्रमाणे वैयक्तिक माहिती आणि एकत्रित ग्राहक माहिती असू शकते. आमच्या वापरकर्त्यांना त्यांची सामग्री प्रशिक्षणासाठी वापरली जाऊ नये म्हणून ऑप्ट-आउट करण्याची, तसेच ChatGPT प्रतिसादांमधून काही वैयक्तिक माहिती काढून टाकण्याची विनंती करण्याची क्षमता आमच्या प्रायव्हसी पोर्टलद्वारे उपलब्ध आहे. आमच्या मॉडेलची कामगिरी आणि अचूकता सुधारण्यासाठी आम्ही आमचे डेटासेट प्रक्रिया करण्यासाठी विविध तंत्रे वापरतो.

आमच्या प्रणाली विकसित करण्यासाठी आम्ही साधारणपणे 2018 मध्ये डेटा गोळा करणे सुरू केले, आणि आजही आम्ही डेटा गोळा करत आहोत. आम्ही 2021 मध्ये प्रथमच प्रणाली विकासासाठी आमचे डेटासेट वापरले.

आमच्या प्रणालींच्या विकासाबद्दल अतिरिक्त माहिती आमच्या सिस्टम कार्ड्समध्ये मिळू शकते.

हा लेख उपयुक्त आहे का?