OpenAI
Այս էջը թարգմանվել է մեքենայական թարգմանությամբ։ Դիտել անգլերեն բնօրինակ հոդվածը.

Ինչպես են մշակվում ChatGPT-ն և մեր հիմքային մոդելները

Իմացեք ավելին, թե ինչպես ենք մշակում մեր մոդելները և կիրառում դրանք ChatGPT-ի նման արտադրանքներում

Թարմացվել է՝ 20 days ago

OpenAI-ի հիմնարար մոդելները, այդ թվում՝ ChatGPT-ի հիմքում ընկած մոդելները, մշակվում են՝ օգտագործելով տեղեկատվության երեք հիմնական աղբյուր՝ (1) համացանցում հանրամատչելի տեղեկություններ, (2) տեղեկություններ, որոնք ստանալու համար համագործակցում ենք երրորդ կողմերի հետ, և (3) տեղեկություններ, որոնք տրամադրում կամ ստեղծում են մեր օգտատերերը, մասնագետ-վարժեցնողներն ու հետազոտողները։

ChatGPT-ում օգտագործվող հիմնարար մոդելների մշակումը ներառում է մի քանի փուլ՝ վարժեցման տվյալների պատրաստում, նախնական ուսուցում և հետագա ուսուցում, ինչպես նաև գործարկումից հետո շարունակական գնահատում ու կատարելագործում։ Այս փուլերում տարբեր նպատակներով կարող են օգտագործվել տարբեր տեսակի տեղեկություններ, այդ թվում՝ մոդելի արդյունավետությունը, հուսալիությունն ու անվտանգությունը բարելավելու համար։ 

Այս հոդվածն ընդհանուր պատկերացում է տալիս այն տեղեկությունների մասին, որոնք օգտագործում ենք այս մոդելների մշակմանն աջակցելու համար, ներկայացնում է, թե ինչպես ենք գաղտնիության մասին օրենքներին համապատասխան հավաքում և օգտագործում այդ տեղեկությունները, ինչպես նաև՝ ինչ պաշտպանական միջոցներ ենք կիրառում վարժեցման ողջ ընթացքում։ Տեղեկանալու համար, թե ինչպես ենք հավաքում և օգտագործում մեր ծառայությունների օգտատերերի տեղեկությունները, այդ թվում՝ ինչպես կարող եք հրաժարվել ChatGPT-ի ձեր զրույցները մեր մոդելների կատարելագործմանն աջակցելու նպատակով օգտագործելուց, ծանոթացեք մեր Գաղտնիության քաղաքականությանը և Օգնության կենտրոնի այս հոդվածին։

Ի՞նչ է ChatGPT-ն և ինչպե՞ս է այն աշխատում

ChatGPT-ն արհեստական բանականության վրա հիմնված ծառայություն է, որից կարող եք օգտվել համացանցի կամ հավելվածի միջոցով։ ChatGPT-ն կարող եք օգտագործել բազմաթիվ առաջադրանքների համար, այդ թվում՝ տեղեկություններ կազմակերպելու և ամփոփելու, թարգմանություններին աջակցելու, ծրագրավորման, հետազոտության ու վերլուծության հարցում օգնելու, տարբեր գործիքներով բազմափուլ առաջադրանքներ կատարելու, պատկերներ վերլուծելու կամ ստեղծելու, ստեղծագործական մտքեր ու գաղափարներ խթանելու և առօրյա այլ գործերում։ ChatGPT-ն նախատեսված է օգտատերերի հարցերն ու հրահանգները հասկանալու և դրանց պատասխանելու համար՝ օրինաչափություններ սովորելով մեծածավալ տեղեկություններից, այդ թվում՝ տեքստերից, պատկերներից, ձայնանյութերից և տեսանյութերից։ 

Վարժեցման ընթացքում մոդելը վերլուծում է այս տվյալների միջև կապերը, օրինակ՝ թե բառերը սովորաբար ինչպես են գործածվում միասին տվյալ համատեքստում, և այդ ըմբռնումն օգտագործում է պատասխան ստեղծելիս ամենահավանական հաջորդ բառը հերթով կանխատեսելու համար։ Տեքստը կարող է բաժանվել ավելի փոքր միավորների, որոնք երբեմն կոչվում են «թոքեններ» և կարող են ներկայացնել ամբողջական բառեր, բառերի մասեր կամ կետադրական նշաններ։ Թոքենները տեքստի կառուցատարրերն են, որոնք մշակում է մոդելը։ Նմանապես, բովանդակության այլ տեսակներ, օրինակ՝ պատկերներ ստեղծող մոդելները սովորում են վարժեցման տվյալներում պիքսելների՝ միմյանց և համապատասխան նկարագրությունների հետ կապերի օրինաչափությունները։

Օրինակ՝ մոդելի ուսուցման գործընթացում (որը կոչվում է «վարժեցում») մոդելին կարող է հանձնարարվել ավարտել այսպիսի նախադասություն՝ «Instead of turning left, she turned ___.»։ Վարժեցման սկզբում դրա պատասխանները հիմնականում պատահական են։ Սակայն մեծածավալ տեքստ մշակելու և դրանից սովորելու ընթացքում մոդելն ավելի լավ է ճանաչում օրինաչափություններն ու կանխատեսում ամենահավանական հաջորդ բառը։ Այս գործընթացը կրկնվում է միլիոնավոր նախադասությունների համար՝ մոդելի ընկալումը կատարելագործելու և ճշգրտությունը բարձրացնելու նպատակով։

Քանի որ նախադասությունը կարելի է ավարտել մի քանի հավանական ձևով, օրինակ՝ «Instead of turning left, she turned right», «around» կամ «back», մոդելի պատասխանները որոշակիորեն պատահական են։ Հետևաբար նույն հարցը տարբեր հարցումների դեպքում կարող է տարբեր պատասխաններ ստանալ։

Մեքենայական ուսուցման մոդելները կազմված են թվերի մեծ հավաքածուներից, որոնք կոչվում են «կշիռներ» կամ «պարամետրեր», և այդ թվերը մեկնաբանող ու օգտագործող կոդից։ Այս մոդելները չեն պահում այն տվյալների պատճենները, որոնցով վարժեցվել են։ Փոխարենը, մոդելի սովորելու ընթացքում դրա պարամետրերի արժեքները փոքր-ինչ ճշգրտվում են՝ արտացոլելով հայտնաբերված օրինաչափությունները։ Նախորդ օրինակում մոդելը պատահական բառեր կանխատեսելուց անցավ ավելի ճշգրիտ կանխատեսումների՝ ոչ թե պահելով վարժեցման նախադասությունները, այլ թարմացնելով իր ներքին պարամետրերը։ Մոդելը չի պահում վարժեցման ընթացքում մշակած նախադասությունների, պատկերների կամ ձայնանյութերի պատճենները։ ChatGPT-ն իր վարժեցման տվյալներից «չի պատճենում և տեղադրում»։ Դա նման է նրան, թե ինչպես կարող է ուսուցիչը երկարատև ուսումնասիրությունից հետո բացատրել հասկացությունները՝ ըմբռնելով գաղափարների միջև կապերը, առանց սկզբնական նյութերը բառացի մտապահելու կամ վերարտադրելու։ Օգտատիրոջ հարցմանը պատասխան ստեղծելիս մոդելն օգտագործում է սովորած կշիռները՝ նոր բովանդակություն կանխատեսելու և ստեղծելու համար։

Ի՞նչ տեսակի տեղեկություններ են օգտագործվում ChatGPT-ին ուսուցանելու համար

Համացանցային հանրամատչելի բովանդակությունից օգտագործում ենք միայն համացանցում ազատ և բաց հասանելի տեղեկությունները։ Դրանք կարող են ներառել հանրամատչելի վեբէջեր, բաց ֆորումներ, հանրային բլոգներ ու գրառումներ և համացանցային այլ հանրամատչելի բովանդակություն։ Օրինակ՝ եթե մասնակցում եք հանրամատչելի առցանց քննարկման ֆորումի կամ հրապարակում եք բաց բլոգային կամ այլ գրառում, մենք կարող ենք այդ հանրամատչելի բովանդակությունն օգտագործել մոդելների վարժեցման համար։ Այնուամենայնիվ, մենք միջոցներ ենք ձեռնարկում վարժեցման ընթացքում անձնական տեղեկությունների մշակումը նվազեցնելու համար։  Համացանցային հանրամատչելի բովանդակություն հավաքելիս մենք դիտավորյալ չենք հավաքում տվյալներ այն աղբյուրներից, որոնք, մեր տեղեկություններով, հասանելի են միայն վճարովի բաժանորդագրությամբ, կամ մութ համացանցից։ Բացի այդ, զտիչների միջոցով հեռացնում ենք այն նյութերը, որոնցից չենք ցանկանում, որ մեր մոդելները սովորեն, օրինակ՝ ատելության խոսքը, մեծահասակների համար նախատեսված բովանդակությունը, անձնական տեղեկություններ համախմբող կայքերը և անցանկալի հաղորդագրությունները։ Մնացած տեղեկություններն այնուհետև օգտագործվում են մեր մոդելները վարժեցնելու համար։ 

Կայքերի սեփականատերերը կարող են ստանդարտ վեբկառավարման միջոցներով, օրինակ՝ robots.txt-ի միջոցով GPTBot-ն արգելափակելով, կառավարել՝ արդյոք իրենց կայքերի հանրամատչելի բովանդակությունը կարող է հասանելի դառնալ վարժեցման համար։ GPTBot-ը կարող է ուսումնասիրել հանրամատչելի բովանդակությունը՝ օգնելով վարժեցնել մեր մոդելները։ Մենք տրամադրում ենք ուղեցույց, որը կայքերի սեփականատերերին օգնում է կառավարել իրենց կայքերի ու բովանդակության փոխգործակցությունը մեր արհեստական բանականության համակարգերի հետ։ 

Մեր մոդելները վարժեցնելու և կատարելագործելու նպատակով օգտագործում ենք նաև երրորդ կողմ գործընկերներից ստացված տեղեկություններ։ Դրանք կարող են ներառել տվյալներ այն հավաքածուներից, որոնք մեզ հասանելի են երրորդ կողմերի հետ համաձայնագրերով, ինչպես նաև մասնագետ-վարժեցնողների և հետազոտողների տրամադրած կամ ստեղծած տեղեկությունները, երբ դա թույլատրվում է մեր քաղաքականություններով ու համաձայնագրերով։ Սա օգնում է բարելավել մեր մոդելների որակը, անվտանգությունն ու արդյունավետությունը։ Կախված տվյալների հավաքածուից՝ այս աղբյուրները կարող են ներառել տեքստեր, պատկերներ, ձայնանյութեր, տեսանյութեր կամ այլ տեսակի տվյալներ։

Վարժեցման որոշ գործընթացներում նաև ավելի ու ավելի շատ ենք օգտագործում սինթետիկ տվյալներ։ Օրինակ՝ տեղեկությունների և մեր մոդելների միջոցով կարող ենք ստեղծել սինթետիկ հարցումներ, բազմալեզու օրինակներ կամ վարժեցման այլ նյութեր։ Սինթետիկ տվյալները կարող են բարելավել մոդելի արդյունավետությունը, այդ թվում՝ լրացնելով վարժեցման տվյալներն այն ոլորտներում, որտեղ դրանք սակավ կամ անհավասարակշիռ են, ինչպես նաև նպաստել մոդելների մշակման՝ գաղտնիությունը բարելավող մոտեցումներին։

Անձնական տեղեկություններն օգտագործվո՞ւմ են ChatGPT-ին ուսուցանելու համար

Առցանց բովանդակության զգալի մասը մարդկանց մասին տեղեկություններ է պարունակում, ուստի մեր վարժեցման տվյալներում կարող են պատահաբար ներառվել անձնական տեղեկություններ։ Այնուամենայնիվ, մենք միջոցներ ենք ձեռնարկում վարժեցման ընթացքում անձնական տեղեկությունների մշակումը նվազեցնելու համար։

Վարժեցման տվյալներն օգտագործում ենք մոդելի կարողությունները, օրինակ՝ կանխատեսումը, դատողությունը և խնդիրների լուծումը զարգացնելու, այլ ոչ թե անձանց պրոֆիլներ կազմելու, նրանց հետ կապվելու կամ նրանց համար գովազդ անհատականացնելու նպատակով։

Որոշ դեպքերում մոդելները կարող են սովորել անձնական տեղեկություններից՝ հասկանալու, թե լեզվում ինչ դեր ունեն անունների ու հասցեների նման տարրերը, կամ ճանաչելու հանրային դեմքերին և հայտնի կազմակերպություններին ու այլ սուբյեկտներին։ Սա օգնում է մոդելին ստեղծել ավելի ճշգրիտ և համատեքստին համապատասխան պատասխաններ։

Ինչպե՞ս են անձնական տեղեկությունները պաշտպանվում վարժեցման ընթացքում

Մենք գործուն քայլեր ենք ձեռնարկում վարժեցման ընթացքում անձնական տեղեկությունների մշակումը սահմանափակելու համար։ Օրինակ՝ բացառում ենք մեծ քանակությամբ անձնական տվյալներ համախմբող հայտնի աղբյուրները, զտիչների միջոցով նվազեցնում ենք անձնական տեղեկությունների օգտագործումը վարժեցման ընթացքում և հայտնաբերում ու հեռացնում ենք կրկնվող բովանդակությունը՝ վարժեցման տվյալների կրկնման վտանգը նվազեցնելու համար։ Բացի այդ, մեր մոդելներին վարժեցնում ենք չպատասխանել անձանց մասնավոր կամ զգայուն տեղեկությունների վերաբերյալ հարցումներին։ 

Որքա՞ն ժամանակ ենք պահում տեղեկությունները

Վարժեցման տվյալներում տեղեկությունները պահում ենք միայն այնքան ժամանակ, որքան ողջամտորեն անհրաժեշտ է այս հոդվածում և մեր Գաղտնիության քաղաքականության մեջ նկարագրված նպատակների համար, այդ թվում՝ մեր մոդելների մշակման ու կատարելագործման և հարակից գիտական հետազոտությունների նպատակով։ Տեղեկությունները պահելու շարունակական անհրաժեշտությունը պարբերաբար վերանայվում է, իսկ պահպանման ժամկետը տարբերվում է՝ կախված տեղեկությունների տեսակից և օգտագործման եղանակից։ Պահպանման ժամկետը որոշելիս հաշվի ենք առնում այնպիսի գործոններ, ինչպիսիք են տեղեկությունները մշակելու նպատակը, դրանց ծավալը, բնույթն ու զգայունությունը, չարտոնված օգտագործման կամ բացահայտման հետևանքով հնարավոր վնասի վտանգը և մեզ վերաբերող իրավական պարտավորությունները։

ChatGPT-ի մշակումը ինչպե՞ս է համապատասխանում գաղտնիության մասին օրենքներին

Վարժեցման տեղեկություններն օգտագործում ենք օրինական կերպով։ Մեր հիմնարար մոդելների հիման վրա աշխատում են բազմաթիվ օգտակար հավելվածներ ու գործիքներ, այդ թվում՝ մատչելիության գործիքներ, հաճախորդների աջակցման համակարգեր, ծրագրային ապահովման մշակում, անհատականացված կրթություն և գիտական հետազոտություններ։ Այս հնարավորությունները կախված են լայնածավալ վարժեցման տվյալներից, այդ թվում՝ հանրամատչելի և երրորդ կողմ գործընկերներից ստացված տեղեկություններից։ Վարժեցման ողջ ընթացքում կիրառում ենք պաշտպանական միջոցներ, այդ թվում՝ այս հոդվածում նկարագրված քայլերը, որոնք նախատեսված են անձնական տեղեկությունների մշակումը նվազեցնելու և վտանգները մեղմելու համար։ Վարժեցման տեղեկություններում ներառված անձնական տվյալների հավաքումն ու օգտագործումը հիմնավորում ենք GDPR-ի նման գաղտնիության մասին օրենքներով նախատեսված օրինական շահերով։ Դրանք ներառում են մեր մոդելների վարժեցումն ու կատարելագործումը՝ ի շահ օգտատերերի և ավելի լայն հասարակության, համաձայն մեր առաքելության՝ ապահովելու, որ արհեստական ընդհանուր բանականությունն օգուտ տա բոլորին։ Այս մասին ավելի մանրամասն բացատրվում է մեր Գաղտնիության քաղաքականության մեջ։ Մենք կատարել ենք տվյալների պաշտպանության ազդեցության գնահատում՝ օգնելու ապահովել, որ այս տեղեկությունները հավաքում և օգտագործում ենք օրինական ու պատասխանատու կերպով։

Երբ կարող են տեղեկությունները տրամադրվել կամ փոխանցվել

Մենք չենք «վաճառում» անձնական տեղեկությունները և վարժեցման տվյալներում առկա անձնական տեղեկությունները բացահայտում ենք միայն մեր Գաղտնիության քաղաքականության մեջ նկարագրված սահմանափակ դեպքերում։ Օրինակ՝ կարող ենք տեղեկություններ տրամադրել փոխկապակցված ընկերություններին, մատակարարներին և ծառայություն մատուցողներին, որոնք աջակցում են մեր մոդելների մշակմանը, փորձարկմանն ու կատարելագործմանը։ Կարող ենք նաև բարեխղճորեն բացահայտել տեղեկություններ, եթե կարծում ենք, որ դա անհրաժեշտ է իրավական պարտավորություն կատարելու կամ մեր, ինչպես նաև մեր օգտատերերի, աշխատակիցների կամ հանրության իրավունքները, ապահովությունն ու անվտանգությունը պաշտպանելու համար, ինչպես նկարագրված է մեր Գաղտնիության քաղաքականության մեջ։

Քանի որ մեր ենթակառուցվածքը համաշխարհային է, վարժեցման տվյալներում պարունակվող անձնական տեղեկությունները կարող են մշակվել ԵՏՏ-ից, Շվեյցարիայից կամ Միացյալ Թագավորությունից դուրս գտնվող երկրներում, այդ թվում՝ Միացյալ Նահանգներում։ Նման դեպքերում կիրառում ենք համապատասխան պաշտպանական միջոցներ, օրինակ՝ համարժեքության մասին որոշումներ կամ ստանդարտ պայմանագրային դրույթներ, ինչպես նկարագրված է մեր Գաղտնիության քաղաքականության մեջ։

Ձեր իրավունքները և դրանց իրականացման եղանակները

Մենք պատասխանում ենք առարկության և իրավունքների իրականացման նմանատիպ հարցումներին։ Լեզու սովորելու հետևանքով ChatGPT-ի պատասխանները երբեմն կարող են ներառել անձնական տեղեկություններ այն անձանց մասին, որոնց տվյալները բազմիցս հանդիպում են բաց համացանցում, օրինակ՝ հանրային դեմքերի մասին։ Որոշ իրավազորություններում անձինք կարող են առարկել մեր մոդելների կողմից իրենց անձնական տեղեկությունների մշակման դեմ կամ ներկայացնել տվյալների սուբյեկտի իրավունքներին վերաբերող այլ հարցումներ մեր Գաղտնիության պորտալի միջոցով։ Այս իրավունքները կարող եք իրականացնել նաև՝ գրելով privacy@openai.com հասցեին։

Որպեսզի կարողանանք գնահատել ձեր հարցումը և պատասխանել դրան, տրամադրեք բավարար տեղեկություններ՝ հասկանալու, թե ինչ անձնական տվյալների է այն վերաբերում, օրինակ՝ ձեր անունը, համապատասխան URL-ները, մոդելի արդյունքների կոնկրետ օրինակները կամ խնդիրը նույնականացնելու համար օգտակար այլ մանրամասներ։ Որոշ դեպքերում, նախքան որևէ քայլ ձեռնարկելը, կարող ենք խնդրել հաստատել ձեր ինքնությունը կամ այն, որ տեղեկությունները վերաբերում են ձեզ։ Այս հարցումները ներկայացնելու, այդ թվում՝ լավագույն գործելակերպի և հարցումների դիտարկման մասին լրացուցիչ տեղեկությունները հասանելի են ChatGPT-ից անձնական տվյալների հեռացման վերաբերյալ մեր Օգնության կենտրոնի հոդվածում։ Հարցումները դիտարկում ենք գաղտնիության մասին կիրառելի օրենքներին համապատասխան և պատասխանում օրենքով սահմանված ժամկետներում։

Խնդրում ենք նկատի ունենալ, որ գաղտնիության մասին օրենքների համաձայն՝ որոշ իրավունքներ կարող են բացարձակ չլինել։ Օրինակ՝ հնարավոր է՝ չկարողանանք կատարել հարցումը, եթե չենք կարող հաստատել համապատասխան տեղեկությունները, եթե հարցումը չի վերաբերում OpenAI-ի մշակած անձնական տեղեկություններին, եթե կիրառվում է բացառություն կամ եթե այն չկատարելու այլ օրինական հիմք ունենք։ Հարցումները գնահատվում են անհատապես և կարող են պահանջել հավասարակշռել գաղտնիության իրավունքներն այլ կարևոր նկատառումների, օրինակ՝ արտահայտվելու ազատության և հանրային շահի հետ։

Այնուամենայնիվ, մենք ձգտում ենք առաջնահերթ համարել անձնական տեղեկությունների պաշտպանությունը և պահպանել գաղտնիության մասին բոլոր կիրառելի օրենքները։ Եթե կարծում եք, որ մենք պատշաճ կերպով չենք լուծել որևէ խնդիր, իրավունք ունեք բողոք ներկայացնելու ձեր տեղական վերահսկող մարմնին։

Մեր կայքը, հավելվածներն ու ծառայություններն օգտագործելիս ձեզնից կամ ձեր մասին հավաքվող անձնական տեղեկությունների նկատմամբ OpenAI-ի գործելակերպի մասին լրացուցիչ տեղեկությունների համար ծանոթացեք մեր Գաղտնիության քաղաքականությանը։

Այս հոդվածն օգտակա՞ր էր։