OpenAI
Այս էջը թարգմանվել է մեքենայական թարգմանությամբ։ Դիտել անգլերեն բնօրինակ հոդվածը.

Ինչպես են մշակվում ChatGPT-ն և մեր հիմքային մոդելները

Իմացեք ավելին, թե ինչպես ենք մշակում մեր մոդելները և կիրառում դրանք ChatGPT-ի նման արտադրանքներում

Թարմացվել է՝ 8 days ago

OpenAI-ի հիմնարար մոդելները, այդ թվում՝ ChatGPT-ն աշխատեցնող մոդելները, մշակվում են տեղեկատվության երեք հիմնական աղբյուրների հիման վրա՝ (1) համացանցում հրապարակայնորեն հասանելի տեղեկատվություն, (2) տեղեկատվություն, որին հասանելիություն ենք ստանում երրորդ կողմերի հետ համագործակցությամբ, և (3) տեղեկատվություն, որը տրամադրում կամ ստեղծում են մեր օգտատերերը, մարդկային վարժեցնողներն ու հետազոտողները։

ChatGPT-ում օգտագործվողների նման հիմնարար մոդելների մշակումը ներառում է մի քանի փուլ, այդ թվում՝ վարժեցման տվյալների պատրաստում, նախնական ուսուցում և հետուսուցում, ինչպես նաև գործարկումից հետո շարունակական գնահատում և բարելավում։ Այս փուլերում տարբեր նպատակներով կարող են օգտագործվել տեղեկատվության տարբեր տեսակներ, այդ թվում՝ մոդելի արդյունավետությունը, հուսալիությունն ու անվտանգությունը բարելավելու համար։ 

Այս հոդվածը ներկայացնում է, թե ինչ տեղեկատվություն ենք օգտագործում այս մոդելների մշակմանը նպաստելու համար, ինչպես ենք հավաքում և օգտագործում այդ տեղեկատվությունը գաղտնիության մասին օրենքներին համապատասխան, և ինչ պաշտպանական միջոցներ ենք կիրառում վարժեցման ամբողջ ընթացքում։ Հասկանալու համար, թե ինչպես ենք հավաքում և օգտագործում մեր ծառայությունների օգտատերերից ստացված տեղեկատվությունը, այդ թվում՝ ինչպես հրաժարվել, որ ChatGPT-ի զրույցներն օգտագործվեն մեր մոդելների բարելավմանը նպաստելու համար, տեսեք մեր Գաղտնիության քաղաքականությունը և Օգնության կենտրոնի այս հոդվածը։

Ի՞նչ է ChatGPT-ն և ինչպե՞ս է այն աշխատում

ChatGPT-ն արհեստական բանականության վրա հիմնված ծառայություն է, որին կարող եք հասանելիություն ստանալ համացանցի կամ հավելվածի միջոցով։ ChatGPT-ն կարող եք օգտագործել առաջադրանքների լայն շրջանակի համար, այդ թվում՝ տեղեկատվություն կազմակերպելու և ամփոփելու, թարգմանություններում աջակցելու, ծրագրավորման, հետազոտության և վերլուծությանն օգնելու, տարբեր գործիքներով բազմաքայլ առաջադրանքներ կատարելու, պատկերներ վերլուծելու կամ ստեղծելու, ստեղծագործականություն ու գաղափարներ ներշնչելու և առօրյա այլ գործողությունների համար։ ChatGPT-ն նախագծված է օգտատերերի հարցերն ու հրահանգները հասկանալու և դրանց պատասխանելու համար՝ սովորելով մեծ ծավալի տեղեկատվությունից, այդ թվում՝ տեքստից, պատկերներից, ձայնագրություններից և տեսանյութերից ստացվող օրինաչափությունները։ 

Վարժեցման ընթացքում մոդելը վերլուծում է այս տվյալների ներսում առկա կապերը, օրինակ՝ ինչպես են բառերը սովորաբար միասին հայտնվում համատեքստում, և այդ ըմբռնումն օգտագործում է պատասխան ստեղծելիս հաջորդ ամենահավանական բառը կանխատեսելու համար՝ բառ առ բառ։ Տեքստը կարող է վերածվել ավելի փոքր միավորների, որոնք երբեմն կոչվում են «թոքեններ» և կարող են ներկայացնել ամբողջական բառեր, բառերի մասեր կամ կետադրական նշաններ։ Թոքենները տեքստի կառուցողական միավորներն են, որոնք մշակում է մոդելը։ Նմանապես, բովանդակության այլ ձևեր, օրինակ՝ պատկերներ ստեղծող մոդելները սովորում են օրինաչափություններ այն մասին, թե ինչպես են պիքսելները կապված միմյանց և վարժեցման տվյալներում դրանց առնչվող նկարագրությունների հետ։

Օրինակ՝ մոդելի սովորելու գործընթացում (որը հայտնի է որպես «վարժեցում») մոդելին կարող է հանձնարարվել ավարտել այսպիսի նախադասություն. «Ձախ թեքվելու փոխարեն նա թեքվեց ___»։ Վարժեցման սկզբում դրա պատասխանները մեծ մասամբ պատահական են։ Սակայն, երբ մոդելը մշակում և սովորում է մեծ ծավալի տեքստից, այն ավելի լավ է ճանաչում օրինաչափությունները և կանխատեսում հաջորդ ամենահավանական բառը։ Այս գործընթացը կրկնվում է միլիոնավոր նախադասությունների վրա՝ դրա ըմբռնումը հղկելու և ճշգրտությունը բարելավելու համար։

Քանի որ նախադասությունը ավարտելու մի քանի հավանական տարբերակ կա, օրինակ՝ «Ձախ թեքվելու փոխարեն նա թեքվեց աջ», «շրջվեց» կամ «հետ դարձավ», մոդելի պատասխաններում առկա է պատահականության ներքին տարր։ Արդյունքում նույն հարցը տարբեր հարցումների դեպքում կարող է տարբեր պատասխաններ տալ։

Մեքենայական ուսուցման մոդելները կազմված են թվերի մեծ հավաքածուներից, որոնք հայտնի են որպես «կշիռներ» կամ «պարամետրեր», ինչպես նաև կոդից, որը մեկնաբանում և օգտագործում է այդ թվերը։ Այս մոդելները չեն պահում կամ պահպանած չեն մնում այն տվյալների պատճենները, որոնցով վարժեցվել են։ Փոխարենը, երբ մոդելը սովորում է, դրա պարամետրերի արժեքները փոքր-ինչ ճշգրտվում են՝ արտացոլելու հայտնաբերված օրինաչափությունները։ Նախորդ օրինակում մոդելը պատահական բառեր կանխատեսելուց անցավ ավելի ճշգրիտ կանխատեսումների՝ ոչ թե վարժեցման նախադասությունները պահելով, այլ իր ներքին պարամետրերը թարմացնելով։ Մոդելը չի պահում այն նախադասությունների, պատկերների կամ ձայնագրությունների պատճենները, որոնք մշակում է վարժեցման ընթացքում։ ChatGPT-ն իր վարժեցման տվյալներից «պատճենել և տեղադրել» չի անում. նման է ուսուցչի, որը երկար ուսումնասիրությունից հետո կարող է բացատրել գաղափարները՝ հասկանալով դրանց միջև կապերը, առանց սկզբնական նյութերը անգիր հիշելու կամ բառացի վերարտադրելու։ Օգտատիրոջ հարցմանը պատասխան ստեղծելիս մոդելն օգտագործում է այս սովորած կշիռները՝ նոր բովանդակություն կանխատեսելու և ստեղծելու համար։

Ի՞նչ տեսակի տեղեկատվություն է օգտագործվում ChatGPT-ին սովորեցնելու համար

Համացանցում հրապարակայնորեն հասանելի բովանդակության դեպքում մենք օգտագործում ենք միայն այն տեղեկատվությունը, որը համացանցում ազատ և բաց հասանելի է։ Դա կարող է ներառել հրապարակայնորեն հասանելի վեբէջեր, հանրային ֆորումներ, հանրային բլոգներ, հանրային գրառումներ և առցանց այլ հրապարակայնորեն հասանելի բովանդակություն։ Օրինակ՝ եթե մասնակցում եք հրապարակայնորեն հասանելի առցանց քննարկման ֆորումի կամ հրապարակում եք հանրային բլոգ կամ այլ գրառում, մենք կարող ենք այդ հրապարակայնորեն հասանելի բովանդակությունն օգտագործել մոդելի վարժեցման նպատակներով։ Սակայն մենք քայլեր ենք ձեռնարկում՝ մեր վարժեցման գործընթացում անձնական տեղեկատվության մշակումը նվազեցնելու համար։  Հրապարակայնորեն հասանելի համացանցային բովանդակություն հավաքելիս մենք դիտավորյալ չենք հավաքում տվյալներ այնպիսի աղբյուրներից, որոնք հայտնի են որպես վճարային պատերի հետևում գտնվող, կամ մութ համացանցից։ Բացի այդ, մենք կիրառում ենք զտիչներ՝ հեռացնելու այն նյութերը, որոնցից չենք ցանկանում, որ մեր մոդելները սովորեն, օրինակ՝ ատելության խոսք, մեծահասակների համար նախատեսված բովանդակություն, անձնական տեղեկատվություն համախմբող կայքեր և սպամ։ Մնացած տեղեկատվությունն այնուհետև օգտագործվում է մեր մոդելները վարժեցնելու համար։ 

Կայքերի սեփականատերերը կարող են կառավարել՝ արդյոք իրենց կայքերի հրապարակայնորեն հասանելի բովանդակությունը կարող է հասանելի դառնալ վարժեցման մեջ օգտագործվելու համար՝ կիրառելով ստանդարտ վեբ կառավարման միջոցներ, օրինակ՝ robots.txt-ը՝ GPTBot-ին արգելելու համար, որը կարող է սողարկել հրապարակայնորեն հասանելի բովանդակությունը՝ մեր մոդելների վարժեցմանը նպաստելու նպատակով։ Մենք տրամադրում ենք ուղեցույց, որը կայքերի սեփականատերերին օգնում է կառավարել, թե ինչպես են իրենց կայքերն ու բովանդակությունը փոխազդում մեր ԱԲ համակարգերի հետ։ 

Մենք նաև օգտագործում ենք երրորդ կողմի գործընկերներից ստացված տեղեկատվություն՝ մեր մոդելների վարժեցմանն ու բարելավմանը նպաստելու համար։ Դա կարող է ներառել այն տվյալահավաքների տեղեկատվությունը, որոնց հասանելիություն ենք ստանում երրորդ կողմերի հետ համաձայնագրերի միջոցով, ինչպես նաև մարդկային վարժեցնողների և հետազոտողների տրամադրած կամ ստեղծած տեղեկատվությունը, երբ դա թույլատրված է մեր քաղաքականություններով և համաձայնագրերով։ Սա օգնում է բարելավել մեր մոդելների որակը, անվտանգությունն ու արդյունավետությունը։ Այս աղբյուրները կարող են ներառել տեքստ, պատկերներ, ձայնագրություններ, տեսանյութեր կամ տվյալների այլ տեսակներ՝ կախված տվյալահավաքից։

Մենք նաև որոշ վարժեցման գործընթացներում ավելի ու ավելի հաճախ օգտագործում ենք սինթետիկ տվյալներ։ Օրինակ՝ կարող ենք օգտագործել տեղեկատվություն և մեր մոդելները՝ սինթետիկ հարցումներ, բազմալեզու օրինակներ կամ վարժեցման այլ նյութեր ստեղծելու համար։ Սինթետիկ տվյալները կարող են օգնել բարելավել մոդելի արդյունավետությունը, այդ թվում՝ լրացնելով վարժեցման տվյալները այն ոլորտներում, որտեղ տվյալները սակավ են կամ անհավասարակշռված, և կարող են նաև աջակցել մոդելների մշակման՝ գաղտնիությունը բարձրացնող մոտեցումներին։

Արդյո՞ք անձնական տեղեկատվությունն օգտագործվում է ChatGPT-ին սովորեցնելու համար

Առցանց բովանդակության զգալի մասը մարդկանց մասին տեղեկատվություն է պարունակում, ուստի մեր վարժեցման տվյալները կարող են պատահաբար ներառել անձնական տեղեկատվություն։ Սակայն մենք քայլեր ենք ձեռնարկում՝ մեր վարժեցման գործընթացում անձնական տեղեկատվության մշակումը նվազեցնելու համար։

Մենք վարժեցման տվյալներն օգտագործում ենք մոդելի կարողությունները զարգացնելու համար՝ օրինակ կանխատեսում, հիմնավորում և խնդիրների լուծում, այլ ոչ թե մարդկանց պրոֆիլներ կազմելու, նրանց հետ կապվելու կամ նրանց համար գովազդները անհատականացնելու նպատակով։

Որոշ դեպքերում մոդելները կարող են սովորել անձնական տեղեկատվությունից՝ հասկանալու համար, թե ինչպես են անունների և հասցեների նման տարրերը գործում լեզվում, կամ ճանաչելու հանրային դեմքերին ու հայտնի սուբյեկտներին։ Սա օգնում է մոդելին ստեղծել ավելի ճշգրիտ և համատեքստին համապատասխան պատասխաններ։

Ինչպե՞ս է անձնական տեղեկատվությունը պաշտպանվում վարժեցման ընթացքում

Մենք ակտիվ քայլեր ենք ձեռնարկում՝ վարժեցման ընթացքում անձնական տեղեկատվության մշակումը սահմանափակելու համար։ Օրինակ՝ մենք բացառում ենք հայտնի աղբյուրները, որոնք մեծ քանակությամբ անձնական տվյալներ են համախմբում, կիրառում ենք զտում՝ վարժեցման գործընթացում անձնական տեղեկատվությունը նվազեցնելու համար, և քայլեր ենք ձեռնարկում կրկնվող բովանդակությունը հայտնաբերելու և հեռացնելու ուղղությամբ՝ վարժեցման տվյալների կրկնման ռիսկը նվազեցնելու համար։ Բացի այդ, մենք մեր մոդելներին վարժեցնում ենք խուսափել մարդկանց մասին մասնավոր կամ զգայուն տեղեկատվության հարցումներին պատասխանելուց։ 

Որքան ժամանակ ենք պահպանում տեղեկատվությունը

Մենք վարժեցման տվյալներում տեղեկատվությունը պահպանում ենք միայն այնքան ժամանակ, որքան ողջամտորեն անհրաժեշտ է այս հոդվածում և մեր Գաղտնիության քաղաքականությունում նկարագրված նպատակների համար, այդ թվում՝ մեր մոդելները մշակելու և բարելավելու, ինչպես նաև հարակից գիտական հետազոտությունների նպատակներով։ Պահպանումը ենթակա է պարբերական վերանայման՝ շարունակական անհրաժեշտությունն ապահովելու համար, և տարբերվում է՝ կախված տեղեկատվության տեսակից և դրա օգտագործման ձևից։ Պահպանման ժամկետը որոշելիս մենք հաշվի ենք առնում այնպիսի գործոններ, ինչպիսիք են տեղեկատվությունը մշակելու մեր նպատակը, տեղեկատվության քանակը, բնույթն ու զգայունությունը, չարտոնված օգտագործումից կամ բացահայտումից հնարավոր վնասի ռիսկը և մեզ վրա դրված ցանկացած իրավական պարտավորություն։

Ինչպե՞ս է ChatGPT-ի մշակումը համապատասխանում գաղտնիության մասին օրենքներին

Մենք վարժեցման տեղեկատվությունն օգտագործում ենք օրինականորեն։ Մեր հիմնարար մոդելներն ապահովում են օգտակար կիրառությունների լայն շրջանակ՝ ներառյալ հասանելիության գործիքներ, հաճախորդների աջակցություն, ծրագրակազմի մշակում, անհատականացված կրթություն և գիտական հետազոտություն։ Այս կարողությունները կախված են լայնածավալ վարժեցման տվյալներից, այդ թվում՝ հրապարակայնորեն հասանելի տեղեկատվությունից և երրորդ կողմի գործընկերներից ստացված տեղեկատվությունից։ Մենք պաշտպանական միջոցներ ենք կիրառում վարժեցման ամբողջ գործընթացում, այդ թվում՝ քայլեր, որոնք նախատեսված են վարժեցման գործընթացում անձնական տեղեկատվության մշակումը նվազեցնելու և ռիսկերը մեղմելու համար, ինչպես նկարագրված է այս հոդվածում։ Մենք վարժեցման տեղեկատվության մեջ ներառված անձնական տեղեկատվության հավաքումն ու օգտագործումը հիմնավորում ենք գաղտնիության մասին օրենքներով, օրինակ՝ GDPR-ով նախատեսված օրինական շահերով, այդ թվում՝ մեր մոդելները օգտատերերի և ավելի լայն հասարակության համար վարժեցնելու ու բարելավելու նպատակով՝ մեր առաքելությանը համապատասխան, այն է՝ ապահովել, որ արհեստական ընդհանուր բանականությունը օգուտ բերի բոլորին, ինչպես ավելի մանրամասն բացատրված է մեր Գաղտնիության քաղաքականությունում։ Մենք ավարտել ենք տվյալների պաշտպանության ազդեցության գնահատումը՝ օգնելու ապահովել, որ այս տեղեկատվությունը հավաքում և օգտագործում ենք օրինական ու պատասխանատու կերպով։

Երբ տեղեկատվությունը կարող է կիսվել կամ փոխանցվել

Մենք անձնական տեղեկատվությունը չենք «վաճառում» և վարժեցման տվյալներում առկա անձնական տեղեկատվությունը բացահայտում ենք միայն մեր Գաղտնիության քաղաքականությունում նկարագրված սահմանափակ հանգամանքներում։ Օրինակ՝ կարող ենք տեղեկատվություն կիսել փոխկապակցված ընկերությունների, մատակարարների և ծառայություններ մատուցողների հետ, որոնք աջակցում են մեր մոդելների մշակմանը, փորձարկմանը և բարելավմանը։ Մենք կարող ենք նաև բացահայտել տեղեկատվություն՝ բարեխիղճ համոզմամբ, որ այդպիսի գործողությունն անհրաժեշտ է իրավական պարտավորությունը կատարելու կամ մեր և մեր օգտատերերի, աշխատակիցների կամ հանրության իրավունքները, անվտանգությունն ու պաշտպանվածությունը պաշտպանելու համար, ինչպես նկարագրված է մեր Գաղտնիության քաղաքականությունում։

Քանի որ մեր ենթակառուցվածքը գլոբալ է, վարժեցման տվյալներում առկա անձնական տեղեկատվությունը կարող է մշակվել ԵՏՏ-ից, Շվեյցարիայից կամ Մեծ Բրիտանիայից դուրս գտնվող երկրներում (այդ թվում՝ Միացյալ Նահանգներում)։ Երբ դա տեղի է ունենում, մենք կիրառում ենք համապատասխան պաշտպանական միջոցներ, օրինակ՝ համարժեքության որոշումներ կամ ստանդարտ պայմանագրային դրույթներ, ինչպես նկարագրված է մեր Գաղտնիության քաղաքականությունում։

Ձեր իրավունքները և դրանցից օգտվելու եղանակը

Մենք արձագանքում ենք առարկությունների վերաբերյալ հարցումներին և նմանատիպ իրավունքների իրականացման հարցումներին։ Լեզու սովորելու արդյունքում ChatGPT-ի պատասխանները երբեմն կարող են ներառել անձնական տեղեկատվություն այն անձանց մասին, որոնց անձնական տեղեկատվությունը հանրային համացանցում հանդիպում է բազմաթիվ անգամներ (օրինակ՝ հանրային դեմքեր)։ Որոշ իրավազորություններում գտնվող անձինք կարող են առարկել իրենց անձնական տեղեկատվության՝ մեր մոդելների կողմից մշակմանը կամ տվյալների սուբյեկտի այլ իրավունքների հարցումներ ներկայացնել մեր Գաղտնիության պորտալի միջոցով։ Դուք կարող եք նաև օգտվել այս իրավունքներից՝ դիմելով privacy@openai.com հասցեին։ 

Որպեսզի կարողանանք գնահատել և պատասխանել ձեր հարցմանը, խնդրում ենք տրամադրել բավարար տեղեկատվություն, որ հասկանանք, թե ձեր հարցումը որ անձնական տեղեկատվությանն է վերաբերում, օրինակ՝ ձեր անունը, համապատասխան URL-ները, մոդելի ելքերի կոնկրետ օրինակները կամ խնդիրը նույնականացնելուն օգնող այլ մանրամասներ։ Որոշ դեպքերում կարող ենք խնդրել ձեզ հաստատել ձեր ինքնությունը կամ հաստատել, որ տեղեկատվությունը վերաբերում է ձեզ, նախքան կարողանանք գործողություն ձեռնարկել։ Այս հարցումները ներկայացնելու մասին լրացուցիչ տեղեկատվությունը, ներառյալ լավագույն գործելակերպերը և հարցումների վերանայման եղանակը, հասանելի է ChatGPT-ից անձնական տվյալների հեռացման վերաբերյալ մեր Օգնության կենտրոնի հոդվածում։ Մենք հարցումները վերանայում ենք կիրառելի գաղտնիության մասին օրենքներին համապատասխան և պատասխանում ենք կիրառելի իրավական ժամկետներում։

Խնդրում ենք նկատի ունենալ, որ գաղտնիության մասին օրենքների համաձայն՝ որոշ իրավունքներ կարող են բացարձակ չլինել։ Օրինակ՝ հնարավոր է չկարողանանք կատարել հարցումը, երբ չենք կարող հաստատել համապատասխան տեղեկատվությունը, երբ հարցումը չի վերաբերում OpenAI-ի կողմից մշակվող անձնական տեղեկատվությանը, երբ կիրառվում է բացառություն, կամ երբ դրա համար ունենք այլ օրինական պատճառ։ Հարցումները գնահատվում են առանձին դեպքերի հիման վրա և կարող են ներառել գաղտնիության իրավունքների հավասարակշռում այլ կարևոր նկատառումների հետ, ինչպիսիք են արտահայտվելու ազատությունը և հանրային շահը։ 

Այնուամենայնիվ, մենք ձգտում ենք առաջնահերթություն տալ անձնական տեղեկատվության պաշտպանությանը և պահպանել գաղտնիության մասին բոլոր կիրառելի օրենքները։ Եթե կարծում եք, որ մենք որևէ խնդիր պատշաճ կերպով չենք լուծել, դուք իրավունք ունեք բողոք ներկայացնել ձեր տեղական վերահսկող մարմնին։

OpenAI-ի գործելակերպի մասին լրացուցիչ տեղեկությունների համար՝ կապված այն անձնական տեղեկատվության հետ, որը հավաքում ենք ձեզանից կամ ձեր մասին, երբ օգտագործում եք մեր կայքը, հավելվածներն ու ծառայությունները, խնդրում ենք տեսնել մեր Գաղտնիության քաղաքականությունը։

Այս հոդվածն օգտակա՞ր էր։