OpenAI
Энэ хуудсыг машинаар орчуулсан. Англи хэл дээрх нийтлэлийн эх хувилбарыг үзнэ үү.

ChatGPT болон манай суурь загваруудыг хэрхэн хөгжүүлдэг вэ

Бид загваруудаа хэрхэн хөгжүүлж, ChatGPT зэрэг бүтээгдэхүүнд хэрхэн ашигладгийг дэлгэрэнгүй үзнэ үү

Шинэчилсэн: 15 days ago

OpenAI-ийн суурь загварууд, тэр дундаа ChatGPT-ийг ажиллуулдаг загваруудыг дараах үндсэн гурван эх сурвалжийн мэдээллээр хөгжүүлдэг: (1) интернэтэд нийтэд нээлттэй мэдээлэл, (2) гуравдагч талуудтай хамтран нэвтрэх эрх авсан мэдээлэл, (3) манай хэрэглэгчид, сургагч мэргэжилтнүүд болон судлаачдын өгсөн эсвэл үүсгэсэн мэдээлэл.

ChatGPT-д ашигладаг суурь загваруудыг хөгжүүлэхэд сургалтын өгөгдөл бэлтгэх, урьдчилсан сургалт болон дараах сургалт явуулах, мөн нэвтрүүлсний дараа тогтмол үнэлж, сайжруулах зэрэг хэд хэдэн үе шат багтдаг. Эдгээр үе шатанд загварын гүйцэтгэл, найдвартай байдал, аюулгүй байдлыг сайжруулах зэрэг янз бүрийн зорилгоор өөр өөр төрлийн мэдээлэл ашиглаж болно. 

Энэ нийтлэлд бид эдгээр загварыг хөгжүүлэхэд ямар мэдээлэл ашигладаг, уг мэдээллийг нууцлалын хууль тогтоомжид нийцүүлэн хэрхэн цуглуулж, ашигладаг, мөн сургалтын бүхий л явцад ямар хамгаалалтын арга хэмжээ хэрэгжүүлдгийг тоймлон тайлбарлана. Бид үйлчилгээнийхээ хэрэглэгчдийн мэдээллийг хэрхэн цуглуулж, ашигладаг, тэр дундаа ChatGPT дэх харилцан яриаг загваруудаа сайжруулахад ашиглуулахаас хэрхэн татгалзах талаар мэдэхийг хүсвэл манай Нууцлалын бодлого болон Тусламжийн төвийн энэ нийтлэлийг үзнэ үү.

ChatGPT гэж юу вэ, хэрхэн ажилладаг вэ?

ChatGPT бол интернэт эсвэл апп-аар ашиглах боломжтой, хиймэл оюун ухаанд суурилсан үйлчилгээ юм. Та ChatGPT-ийг мэдээлэл эмхлэх, хураангуйлах, орчуулгад туслуулах, код бичих, судалгаа шинжилгээ хийх, олон хэрэгсэл дамнасан олон алхамт даалгавар гүйцэтгэх, зураг шинжлэх эсвэл үүсгэх, бүтээлч сэтгэлгээ болон шинэ санаа төрүүлэх зэрэг өдөр тутмын олон төрлийн ажилд ашиглаж болно. ChatGPT нь бичвэр, зураг, аудио, видео зэрэг их хэмжээний мэдээллийн зүй тогтлыг суралцсанаар хэрэглэгчийн асуулт, зааврыг ойлгож хариулахаар бүтээгдсэн. 

Сургалтын явцад загвар энэ өгөгдөл дэх харилцан хамаарлыг, тухайлбал үгс тухайн хам сэдэвт ихэвчлэн хэрхэн хамт ордгийг шинжилдэг. Дараа нь сурсан зүйлдээ тулгуурлан хариулт үүсгэхдээ дараагийн хамгийн магадлалтай үгийг нэг нэгээр нь таамагладаг. Бичвэрийг бүтэн үг, үгийн хэсэг эсвэл цэг тэмдэгтийг илэрхийлж болох, заримдаа “токен” гэж нэрлэдэг жижиг нэгжүүдэд хувааж болно. Токенууд нь загварын боловсруулдаг бичвэрийн үндсэн бүрдэл хэсэг юм. Үүнтэй адил зураг зэрэг өөр төрлийн контент үүсгэдэг загварууд сургалтын өгөгдөл дэх пикселүүд хоорондоо болон холбогдох тайлбартайгаа хэрхэн уялддаг зүй тогтлыг сурдаг.

Жишээлбэл, загварын суралцах буюу “сургалт” гэж нэрлэдэг явцад “Тэр зүүн тийш эргэхийн оронд ___ эргэв” гэх өгүүлбэрийг гүйцээх даалгавар өгч болно. Сургалтын эхэн үед загварын хариулт ихэвчлэн санамсаргүй байдаг. Гэвч загвар их хэмжээний бичвэрийг боловсруулж, түүнээс суралцахын хэрээр зүй тогтлыг илүү сайн таньж, дараагийн хамгийн магадлалтай үгийг илүү зөв таамагладаг болно. Ойлголтыг нь нарийвчилж, таамаглалын нарийвчлалыг сайжруулахын тулд энэ үйл явцыг сая сая өгүүлбэр дээр давтана.

Өгүүлбэрийг “Тэр зүүн тийш эргэхийн оронд баруун тийш эргэв”, “тойрч эргэв” эсвэл “буцаж эргэв” гэх мэт хэд хэдэн боломжит хувилбараар гүйцээж болдог тул загварын хариултад санамсаргүй шинж угаасаа агуулагдана. Иймээс нэг асуултыг өөр өөр удаа асуухад ялгаатай хариулт гарч болно.

Машин сургалтын загварууд нь “жин” эсвэл “параметр” гэж нэрлэдэг асар олон тоо болон тэдгээрийг тайлбарлан ашиглах кодоос бүрддэг. Эдгээр загвар сургасан өгөгдлийнхөө хуулбарыг хадгалдаггүй. Харин загвар суралцах явцдаа илрүүлсэн зүй тогтлоо тусгахын тулд параметрүүдийнхээ утгыг бага багаар өөрчилдөг. Өмнөх жишээнд загвар сургалтын өгүүлбэрүүдийг хадгалснаар бус, дотоод параметрүүдээ шинэчилснээр санамсаргүй үг таамаглахаас илүү зөв таамагладаг болсон. Загвар сургалтын үеэр боловсруулсан өгүүлбэр, зураг эсвэл аудионы хуулбарыг хадгалдаггүй. ChatGPT сургалтын өгөгдлөөсөө “хуулж тавьдаггүй”. Үүнийг өргөн хүрээнд судалсан багш эх материалыг үгчлэн цээжлэх эсвэл давтахгүйгээр, санаануудын уялдаа холбоог ойлгосныхоо үндсэн дээр ухагдахууныг тайлбарлаж чаддагтай зүйрлэж болно. Загвар хэрэглэгчийн хүсэлтэд хариу үүсгэхдээ сурсан жингүүдээ ашиглан шинэ контентыг таамаглаж, бүтээдэг.

ChatGPT-ийг сургахад ямар төрлийн мэдээлэл ашигладаг вэ?

Интернэт дэх нийтэд нээлттэй контентоос бид зөвхөн үнэ төлбөргүй, чөлөөтэй үзэх боломжтой мэдээллийг ашигладаг. Үүнд нийтэд нээлттэй веб хуудас, форум, блог, нийтлэл болон бусад онлайн контент багтаж болно. Жишээлбэл, та нийтэд нээлттэй онлайн хэлэлцүүлгийн форумд оролцох, нийтийн блог эсвэл өөр нийтлэл нийтлэх тохиолдолд бид нийтэд нээлттэй уг контентыг загвар сургахад ашиглаж болно. Гэхдээ бид сургалтын явцад хувийн мэдээллийн боловсруулалтыг багасгах арга хэмжээ авдаг.  Бид интернэт дэх нийтэд нээлттэй контентыг цуглуулахдаа төлбөрийн хаалттай эх сурвалж эсвэл дарк вебээс өгөгдөл зориудаар цуглуулдаггүй. Түүнчлэн үзэн ядсан үг хэллэг, насанд хүрэгчдэд зориулсан контент, хувийн мэдээлэл нэгтгэдэг сайт, спам зэрэг загваруудаа суралцуулахыг хүсэхгүй материалыг шүүлтүүрээр хасдаг. Үлдсэн мэдээллийг дараа нь загваруудаа сургахад ашигладаг. 

Вебсайт эзэмшигчид robots.txt зэрэг вебийн стандарт хяналтын хэрэгслээр GPTBot-д хандахыг хориглож, сайтынх нь нийтэд нээлттэй контентыг сургалтад ашиглахаар нэвтрэх боломжтой эсэхийг зохицуулж болно. GPTBot нь манай загваруудыг сургахад туслахын тулд нийтэд нээлттэй контентыг мөлхөн үзэж болзошгүй. Бид вебсайт эзэмшигчдэд сайт болон контент нь манай хиймэл оюун ухааны системүүдтэй хэрхэн харилцахыг зохицуулахад туслах заавар өгдөг. 

Мөн загваруудаа сургаж, сайжруулахад туслах зорилгоор гуравдагч талын түншүүдийн мэдээллийг ашигладаг. Үүнд гуравдагч талуудтай байгуулсан гэрээгээр нэвтрэх эрх авсан өгөгдлийн багц дахь мэдээлэл, мөн манай бодлого, гэрээгээр зөвшөөрсөн тохиолдолд сургагч мэргэжилтнүүд болон судлаачдын өгсөн эсвэл үүсгэсэн мэдээлэл багтаж болно. Энэ нь манай загваруудын чанар, аюулгүй байдал, гүйцэтгэлийг сайжруулахад тусалдаг. Өгөгдлийн багцаас шалтгаалан эдгээр эх сурвалжид бичвэр, зураг, аудио, видео болон бусад төрлийн өгөгдөл багтаж болно.

Мөн бид сургалтын зарим үйл явцад синтетик өгөгдлийг улам өргөн ашиглаж байна. Жишээлбэл, бид мэдээлэл болон загваруудаа ашиглан синтетик хүсэлт, олон хэл дээрх жишээ эсвэл сургалтын бусад материал үүсгэж болно. Синтетик өгөгдөл нь өгөгдөл хомс эсвэл тэнцвэргүй салбарын сургалтын өгөгдлийг нөхөх зэргээр загварын гүйцэтгэлийг сайжруулахад тусалдаг. Мөн загвар хөгжүүлэхдээ нууцлалыг илүү сайн хамгаалах арга барилыг дэмжиж болно.

ChatGPT-ийг сургахад хувийн мэдээлэл ашигладаг уу?

Онлайн контентын нэлээд хэсэг нь хүмүүсийн тухай мэдээлэл агуулдаг тул манай сургалтын өгөгдөлд хувийн мэдээлэл санамсаргүйгээр багтаж болзошгүй. Гэхдээ бид сургалтын явцад хувийн мэдээллийн боловсруулалтыг багасгах арга хэмжээ авдаг.

Бид сургалтын өгөгдлийг хүмүүсийн профайл үүсгэх, тэдэнтэй холбоо барих эсвэл тэдэнд зар сурталчилгаа тохируулахад бус, таамаглах, сэтгэн бодох, асуудал шийдвэрлэх зэрэг загварын чадварыг хөгжүүлэхэд ашигладаг.

Зарим тохиолдолд загвар нэр, хаяг зэрэг зүйл хэлэнд хэрхэн хэрэглэгддэгийг ойлгох, эсвэл олон нийтэд танигдсан хүн, байгууллагыг танихын тулд хувийн мэдээллээс суралцаж болно. Энэ нь загварт илүү зөв, хам сэдэвт нийцсэн хариулт үүсгэхэд тусалдаг.

Сургалтын явцад хувийн мэдээллийг хэрхэн хамгаалдаг вэ?

Бид сургалтын явцад хувийн мэдээллийн боловсруулалтыг хязгаарлах идэвхтэй арга хэмжээ авдаг. Жишээлбэл, их хэмжээний хувийн өгөгдөл нэгтгэдэг нь мэдэгдсэн эх сурвалжуудыг хасаж, сургалтын явц дахь хувийн мэдээллийг багасгах шүүлтүүр хэрэглэн, сургалтын өгөгдлийг давтах эрсдэлийг бууруулахын тулд давхардсан контентыг илрүүлж устгах арга хэмжээ авдаг. Түүнчлэн хүмүүсийн хувийн эсвэл эмзэг мэдээллийг хүссэн хүсэлтэд хариу өгөхөөс зайлсхийхэд загваруудаа сургадаг. 

Мэдээллийг хэр удаан хадгалдаг вэ

Бид сургалтын өгөгдөл дэх мэдээллийг энэ нийтлэл болон манай Нууцлалын бодлогод дурдсан зорилгуудад, тухайлбал загваруудаа хөгжүүлж сайжруулах болон холбогдох шинжлэх ухааны судалгаанд үндэслэлтэйгээр шаардлагатай хугацаанд л хадгалдаг. Мэдээллийг цаашид хадгалах шаардлагатай эсэхийг тогтмол хянадаг бөгөөд хадгалах хугацаа нь мэдээллийн төрөл болон ашиглах аргаас хамаарна. Хадгалах хугацааг тогтоохдоо мэдээллийг боловсруулах зорилго, мэдээллийн хэмжээ, шинж чанар, эмзэг байдал, зөвшөөрөлгүй ашиглах эсвэл задруулахад учирч болзошгүй хохирлын эрсдэл, бидний хүлээсэн хууль зүйн үүрэг зэрэг хүчин зүйлийг харгалзан үздэг.

ChatGPT-ийн хөгжүүлэлт нууцлалын хууль тогтоомжид хэрхэн нийцдэг вэ?

Бид сургалтын мэдээллийг хуулийн дагуу ашигладаг. Манай суурь загварууд хүртээмжийн хэрэгсэл, хэрэглэгчийн дэмжлэг, программ хангамж хөгжүүлэлт, хувь хүнд тохирсон боловсрол, шинжлэх ухааны судалгаа зэрэг олон төрлийн үр өгөөжтэй хэрэглээг ажиллуулдаг. Эдгээр чадвар нь нийтэд нээлттэй мэдээлэл болон гуравдагч талын түншүүдийн мэдээллийг багтаасан өргөн цар хүрээтэй сургалтын өгөгдөлд тулгуурладаг. Энэ нийтлэлд тайлбарласанчлан, сургалтын явц дахь хувийн мэдээллийн боловсруулалтыг багасгах, эрсдэлийг бууруулах арга хэмжээ зэрэг хамгаалалтыг сургалтын бүхий л явцад хэрэгжүүлдэг. Ерөнхий хиймэл оюун ухаан хүн бүрд үр өгөөжөө өгөхийг баталгаажуулах эрхэм зорилгынхоо хүрээнд хэрэглэгчид болон нийгмийн төлөө загваруудаа сургаж, сайжруулахын тулд сургалтын мэдээлэлд багтсан хувийн мэдээллийг цуглуулах, ашиглахдаа GDPR зэрэг нууцлалын хуулиар хүлээн зөвшөөрсөн хууль ёсны ашиг сонирхолд үндэслэдэг. Үүнийг манай Нууцлалын бодлогод дэлгэрэнгүй тайлбарласан. Бид энэ мэдээллийг хууль ёсоор, хариуцлагатай цуглуулж, ашиглаж байгаагаа баталгаажуулахад туслах зорилгоор өгөгдөл хамгаалалтын нөлөөллийн үнэлгээ хийсэн.

Мэдээллийг хэзээ хуваалцаж эсвэл шилжүүлж болох вэ

Бид хувийн мэдээллийг “худалддаггүй” бөгөөд сургалтын өгөгдөл дэх хувийн мэдээллийг зөвхөн Нууцлалын бодлогод дурдсан хязгаарлагдмал нөхцөлд задруулдаг. Жишээлбэл, бид загваруудаа хөгжүүлэх, турших, сайжруулахад дэмжлэг үзүүлдэг харьяа байгууллага, нийлүүлэгч, үйлчилгээ үзүүлэгчтэй мэдээлэл хуваалцаж болно. Мөн манай Нууцлалын бодлогод тайлбарласнаар хууль зүйн үүргээ биелүүлэх, эсвэл өөрсдийн болон хэрэглэгчид, ажилтнууд, олон нийтийн эрх, аюулгүй байдал, хамгаалалтыг хангахад шаардлагатай гэж үнэнч шударгаар үзвэл мэдээллийг задруулж болно.

Манай дэд бүтэц дэлхий даяар ажилладаг тул сургалтын өгөгдөл дэх хувийн мэдээллийг EEA, Швейцар эсвэл Их Британиас бусад улсад, түүний дотор АНУ-д боловсруулж болно. Ийм тохиолдолд манай Нууцлалын бодлогод тайлбарласны дагуу хамгаалалтын түвшин хангалттайг тогтоосон шийдвэр эсвэл гэрээний стандарт заалт зэрэг зохих хамгаалалтын арга хэмжээг хэрэгжүүлдэг.

Таны эрх болон тэдгээрийг хэрхэн эдлэх вэ

Бид эсэргүүцэл гаргасан хүсэлт болон эрхээ эдлэхтэй холбоотой ижил төстэй хүсэлтэд хариу өгдөг. ChatGPT хэл суралцсаны үр дүнд нийтэд нээлттэй интернэтэд хувийн мэдээлэл нь олон удаа гардаг хүмүүсийн, жишээлбэл олны танил хүмүүсийн тухай хувийн мэдээллийг заримдаа хариултдаа оруулж болзошгүй. Зарим харьяаллын бүс дэх хүмүүс өөрсдийн хувийн мэдээллийг манай загварууд боловсруулахыг эсэргүүцэх эсвэл өгөгдлийн субъектийн бусад эрхтэй холбоотой хүсэлтийг манай Нууцлалын порталаар гаргаж болно. Мөн privacy@openai.com хаягаар холбогдон эдгээр эрхээ эдлэх боломжтой.

Хүсэлтийг тань үнэлж, хариу өгөхөд туслахын тулд таны хүсэлт ямар хувийн мэдээлэлтэй холбоотойг ойлгоход хүрэлцэхүйц мэдээлэл өгнө үү. Үүнд таны нэр, холбогдох URL-ууд, загварын гаралтын тодорхой жишээ эсвэл асуудлыг тогтооход туслах бусад дэлгэрэнгүй мэдээлэл багтаж болно. Зарим тохиолдолд арга хэмжээ авахаас өмнө бид таныг хэн болохыг баталгаажуулах эсвэл уг мэдээлэл танд хамаатайг нотлохыг хүсэж болно. Эдгээр хүсэлтийг хэрхэн гаргах, зөвлөмж болон хүсэлтийг хэрхэн хянадаг талаарх дэлгэрэнгүй мэдээллийг ChatGPT-ээс хувийн өгөгдөл устгах тухай манай Тусламжийн төвийн нийтлэлээс үзнэ үү. Бид хүсэлтийг холбогдох нууцлалын хууль тогтоомжийн дагуу хянаж, хуульд заасан хугацаанд хариу өгдөг.

Нууцлалын хууль тогтоомжийн дагуу зарим эрх хязгааргүй биш байж болохыг анхаарна уу. Жишээлбэл, холбогдох мэдээллийг баталгаажуулах боломжгүй, хүсэлт нь OpenAI-ийн боловсруулдаг хувийн мэдээлэлтэй холбоогүй, хуульд заасан чөлөөлөлт үйлчилдэг эсвэл хүсэлтийг биелүүлэхгүй байх өөр хууль ёсны үндэслэлтэй бол бид уг хүсэлтийг биелүүлэх боломжгүй байж болно. Хүсэлт бүрийг тухайн нөхцөлд нь үнэлдэг бөгөөд нууцлалын эрхийг үзэл бодлоо илэрхийлэх эрх чөлөө, нийтийн ашиг сонирхол зэрэг бусад чухал хүчин зүйлтэй тэнцвэржүүлэх шаардлагатай байж болно.

Гэсэн хэдий ч бид хувийн мэдээллийг хамгаалахыг тэргүүнд тавьж, холбогдох бүх нууцлалын хууль тогтоомжийг мөрдөхийг эрмэлздэг. Хэрэв бид асуудлыг хангалттай шийдвэрлээгүй гэж үзвэл та орон нутгийнхаа хяналтын байгууллагад гомдол гаргах эрхтэй.

Манай вебсайт, апп болон үйлчилгээг ашиглах үед танаас эсвэл таны тухай цуглуулдаг хувийн мэдээлэлтэй холбоотой OpenAI-ийн үйл ажиллагааны талаар дэлгэрэнгүй мэдэхийг хүсвэл манай Нууцлалын бодлогыг үзнэ үү.

Энэ нийтлэл танд тус болсон уу?