OpenAI
Această pagină a fost tradusă automat. Vezi articolul original în limba engleză.

Cum sunt dezvoltate ChatGPT și modelele noastre fundamentale

Aflați mai multe despre cum ne dezvoltăm modelele și le aplicăm în produse precum ChatGPT

Actualizat: 6 days ago

Modelele fundamentale OpenAI, inclusiv modelele pe care se bazează ChatGPT, sunt dezvoltate folosind trei surse principale de informații: (1) informații disponibile public pe internet, (2) informații la care avem acces prin parteneriate cu terți și (3) informații furnizate sau generate de utilizatorii, instructorii umani și cercetătorii noștri.

Dezvoltarea modelelor fundamentale precum cele utilizate în ChatGPT presupune mai multe etape, inclusiv pregătirea datelor de instruire, pre-instruirea și post-instruirea, precum și evaluarea și îmbunătățirea continuă după implementare. În aceste etape pot fi utilizate diferite tipuri de informații în diverse scopuri, inclusiv pentru îmbunătățirea performanței, fiabilității și siguranței modelelor. 

Acest articol oferă o prezentare generală a informațiilor pe care le folosim pentru a contribui la dezvoltarea acestor modele, a modului în care colectăm și utilizăm informațiile în conformitate cu legislația privind confidențialitatea și a măsurilor de protecție pe care le aplicăm pe tot parcursul procesului de instruire. Pentru a înțelege cum colectăm și utilizăm informațiile provenite de la utilizatorii serviciilor noastre, inclusiv cum puteți refuza utilizarea conversațiilor ChatGPT pentru îmbunătățirea modelelor noastre, consultați Politica de confidențialitate și acest articol din Centrul de asistență.

Ce este ChatGPT și cum funcționează?

ChatGPT este un serviciu bazat pe inteligență artificială, pe care îl puteți accesa prin internet sau din aplicație. Puteți folosi ChatGPT pentru o gamă largă de activități, printre care organizarea și rezumarea informațiilor, traducerea, programarea, cercetarea și analiza, realizarea unor activități în mai mulți pași cu ajutorul diverselor instrumente, analizarea sau generarea imaginilor, stimularea creativității și găsirea de idei, precum și alte activități cotidiene. ChatGPT este conceput să înțeleagă întrebările și instrucțiunile utilizatorilor și să răspundă la acestea, învățând tipare din cantități mari de informații, inclusiv texte, imagini, materiale audio și videoclipuri. 

În timpul instruirii, modelul analizează relațiile din cadrul acestor date — de exemplu, modul în care cuvintele apar de obicei împreună într-un anumit context — și folosește această înțelegere pentru a prezice, cuvânt cu cuvânt, următorul cuvânt cel mai probabil atunci când generează un răspuns. Textul poate fi transformat în unități mai mici, numite uneori „tokenuri”, care pot reprezenta cuvinte întregi, părți de cuvinte sau semne de punctuație. Tokenurile sunt elementele constitutive ale textului procesat de model. În mod similar, modelele care generează alte tipuri de conținut, precum imagini, învață tipare privind relațiile dintre pixeli și dintre aceștia și descrierile asociate din datele de instruire.

De exemplu, în timpul procesului de învățare a modelului (numit „instruire”), acestuia i s-ar putea cere să completeze o propoziție precum: „În loc să vireze la stânga, ea a virat la ___.” La începutul instruirii, răspunsurile sale sunt în mare parte aleatorii. Însă, pe măsură ce procesează și învață dintr-un volum mare de texte, modelul recunoaște tot mai bine tiparele și prezice mai precis următorul cuvânt cel mai probabil. Acest proces se repetă pentru milioane de propoziții, pentru a-i rafina înțelegerea și a-i îmbunătăți precizia.

Deoarece o propoziție poate fi completată în mai multe moduri plauzibile — de exemplu, „În loc să vireze la stânga, ea a virat la dreapta”, „împrejur” sau „înapoi” — modul în care răspunde modelul conține în mod inerent un element aleatoriu. Prin urmare, aceeași întrebare poate primi răspunsuri diferite la interogări diferite.

Modelele de învățare automată sunt alcătuite din seturi mari de numere, numite „ponderi” sau „parametri”, precum și din codul care interpretează și utilizează aceste numere. Aceste modele nu stochează și nu păstrează copii ale datelor cu care sunt instruite. În schimb, pe măsură ce un model învață, valorile parametrilor săi sunt ajustate ușor pentru a reflecta tiparele identificate. În exemplul anterior, modelul a trecut de la prezicerea unor cuvinte aleatorii la predicții mai precise, nu prin stocarea propozițiilor folosite pentru instruire, ci prin actualizarea parametrilor săi interni. Modelul nu păstrează copii ale propozițiilor, imaginilor sau materialelor audio pe care le procesează în timpul instruirii. ChatGPT nu „copiază și lipește” din datele sale de instruire. În mod similar, după un studiu aprofundat, un profesor poate explica anumite concepte înțelegând relațiile dintre idei, fără a memora sau reproduce textual materialele originale. Atunci când generează un răspuns la solicitarea unui utilizator, modelul folosește ponderile învățate pentru a prezice și a crea conținut nou.

Ce tipuri de informații sunt folosite pentru instruirea ChatGPT?

În ceea ce privește conținutul disponibil public pe internet, folosim numai informații care pot fi accesate liber și deschis online. Acestea pot include pagini web, forumuri, bloguri și postări publice, precum și alt conținut online disponibil public. De exemplu, dacă participați la un forum online disponibil public sau publicați un blog ori o altă postare publică, putem utiliza conținutul respectiv, accesibil publicului, pentru instruirea modelelor. Totuși, luăm măsuri pentru a reduce prelucrarea informațiilor cu caracter personal în procesul nostru de instruire.  Atunci când colectăm conținut disponibil public pe internet, nu culegem în mod intenționat date din surse despre care știm că se află în spatele unor sisteme cu plată și nici de pe dark web. În plus, aplicăm filtre pentru a elimina materialele din care nu dorim ca modelele noastre să învețe, precum discursul instigator la ură, conținutul pentru adulți, site-urile care centralizează informații cu caracter personal și mesajele spam. Informațiile rămase sunt apoi utilizate pentru instruirea modelelor noastre. 

Proprietarii de site-uri pot controla dacă poate fi accesat conținutul disponibil public de pe site-urile lor pentru a fi folosit la instruire. În acest scop, pot utiliza mecanisme web standard, precum robots.txt, pentru a bloca GPTBot, care poate accesa automat conținut disponibil public pentru a contribui la instruirea modelelor noastre. Oferim îndrumări care îi ajută pe proprietarii de site-uri să gestioneze modul în care site-urile și conținutul lor interacționează cu sistemele noastre de inteligență artificială. 

Folosim și informații provenite de la parteneri terți pentru instruirea și îmbunătățirea modelelor noastre. Acestea pot include informații din seturi de date la care avem acces în baza unor acorduri cu terți, precum și informații furnizate sau generate de instructori umani și cercetători, atunci când politicile și acordurile noastre permit acest lucru. Acest lucru contribuie la îmbunătățirea calității, siguranței și performanței modelelor noastre. În funcție de setul de date, aceste surse pot include texte, imagini, materiale audio, videoclipuri sau alte tipuri de date.

De asemenea, folosim tot mai frecvent date sintetice în unele procese de instruire. De exemplu, putem folosi informații și modelele noastre pentru a genera instrucțiuni sintetice, exemple multilingve sau alte materiale de instruire. Datele sintetice pot contribui la îmbunătățirea performanței modelelor, inclusiv prin completarea datelor de instruire în domeniile în care acestea sunt insuficiente sau dezechilibrate, și pot sprijini abordări care consolidează protecția confidențialității în dezvoltarea modelelor.

Sunt folosite informații cu caracter personal pentru instruirea ChatGPT?

O parte semnificativă a conținutului online cuprinde informații despre persoane, astfel că datele noastre de instruire pot include incidental informații cu caracter personal. Totuși, luăm măsuri pentru a reduce prelucrarea informațiilor cu caracter personal în procesul nostru de instruire.

Folosim datele de instruire pentru a dezvolta capacitățile modelului — precum predicția, raţionamentul și rezolvarea problemelor — nu pentru a crea profiluri ale persoanelor, a le contacta sau a le afișa reclame personalizate.

În unele cazuri, modelele pot învăța din informații cu caracter personal pentru a înțelege rolul în limbaj al unor elemente precum numele și adresele sau pentru a recunoaște personalități publice și entități bine-cunoscute. Acest lucru ajută modelul să genereze răspunsuri mai precise și mai potrivite contextului.

Cum sunt protejate informațiile cu caracter personal în timpul instruirii?

Luăm măsuri active pentru a limita prelucrarea informațiilor cu caracter personal în timpul instruirii. De exemplu, excludem sursele cunoscute care centralizează volume mari de date cu caracter personal, aplicăm filtre pentru a reduce prezența informațiilor cu caracter personal în procesul de instruire și luăm măsuri pentru a identifica și elimina conținutul duplicat, reducând astfel riscul repetării datelor de instruire. În plus, ne instruim modelele să evite răspunsurile la solicitările de informații private sau sensibile despre persoane. 

Cât timp păstrăm informațiile

Păstrăm informațiile din datele de instruire numai atât timp cât este necesar în mod rezonabil pentru scopurile descrise în acest articol și în Politica de confidențialitate, inclusiv pentru dezvoltarea și îmbunătățirea modelelor noastre și pentru activitățile de cercetare științifică asociate. Necesitatea păstrării este revizuită periodic pentru a ne asigura că se menține, iar durata variază în funcție de tipul informațiilor și de modul în care sunt utilizate. Atunci când stabilim durata păstrării, luăm în considerare factori precum scopul prelucrării informațiilor, volumul, natura și caracterul sensibil al acestora, riscul potențial de prejudiciu rezultat din utilizarea sau divulgarea neautorizată și obligațiile legale care ni se aplică.

Cum respectă dezvoltarea ChatGPT legislația privind confidențialitatea?

Folosim în mod legal informațiile pentru instruire. Modelele noastre fundamentale stau la baza unei game largi de aplicații utile, inclusiv instrumente de accesibilitate, asistență pentru clienți, dezvoltare software, educație personalizată și cercetare științifică. Aceste capacități depind de date de instruire la scară largă, inclusiv de informații disponibile public și de informații provenite de la parteneri terți. Aplicăm măsuri de protecție pe tot parcursul procesului de instruire, inclusiv măsurile descrise în acest articol, concepute pentru a reduce prelucrarea informațiilor cu caracter personal în timpul instruirii și pentru a diminua riscurile. Colectarea și utilizarea informațiilor cu caracter personal incluse în informațiile pentru instruire se bazează pe interese legitime, în conformitate cu legislația privind confidențialitatea, precum RGPD. Printre acestea se numără instruirea și îmbunătățirea modelelor noastre în beneficiul utilizatorilor și al societății în ansamblu, în concordanță cu misiunea noastră de a ne asigura că inteligența generală artificială aduce beneficii tuturor, după cum explicăm mai detaliat în Politica de confidențialitate. Am efectuat o evaluare a impactului asupra protecției datelor pentru a contribui la colectarea și utilizarea legală și responsabilă a acestor informații.

Când pot fi divulgate sau transferate informațiile

Nu „vindem” informații cu caracter personal și divulgăm astfel de informații din datele de instruire numai în situațiile limitate descrise în Politica noastră de confidențialitate. De exemplu, putem partaja informații cu entități afiliate, furnizori și prestatori de servicii care sprijină dezvoltarea, testarea și îmbunătățirea modelelor noastre. De asemenea, putem divulga informații dacă avem convingerea de bună-credință că această acțiune este necesară pentru îndeplinirea unei obligații legale sau pentru protejarea drepturilor, siguranței și securității noastre și a celor aparținând utilizatorilor, angajaților sau publicului, conform descrierii din Politica de confidențialitate.

Deoarece infrastructura noastră este globală, informațiile cu caracter personal din datele de instruire pot fi prelucrate în țări din afara SEE, Elveției sau Regatului Unit, inclusiv în Statele Unite. În aceste situații, aplicăm măsuri de protecție adecvate, precum decizii privind caracterul adecvat al nivelului de protecție sau clauze contractuale standard, conform descrierii din Politica de confidențialitate.

Drepturile dvs. și modul în care le puteți exercita

Răspundem solicitărilor de opoziție și solicitărilor similare privind exercitarea drepturilor. În urma învățării limbajului, răspunsurile ChatGPT pot include uneori informații cu caracter personal despre persoane ale căror date apar în mod repetat pe internetul public, de exemplu personalități publice. Persoanele din anumite jurisdicții se pot opune prelucrării informațiilor lor cu caracter personal de către modelele noastre sau pot transmite alte solicitări privind drepturile persoanelor vizate prin Portalul de confidențialitate. Puteți exercita aceste drepturi și contactând privacy@openai.com.

Pentru a ne ajuta să vă evaluăm solicitarea și să răspundem la aceasta, furnizați suficiente informații pentru a înțelege la ce date cu caracter personal se referă, cum ar fi numele dvs., adrese URL relevante, exemple concrete de rezultate generate de model sau alte detalii care ajută la identificarea problemei. În unele cazuri, înainte de a putea lua măsuri, vă putem solicita să vă verificați identitatea sau să confirmați că informațiile vă privesc. Mai multe informații despre transmiterea acestor solicitări, inclusiv despre bunele practici și modul în care sunt analizate, sunt disponibile în articolul din Centrul de asistență privind eliminarea datelor cu caracter personal din ChatGPT. Analizăm solicitările în conformitate cu legislația aplicabilă privind confidențialitatea și răspundem în termenele prevăzute de lege.

Rețineți că, în conformitate cu legislația privind confidențialitatea, este posibil ca unele drepturi să nu fie absolute. De exemplu, este posibil să nu putem da curs unei solicitări dacă nu putem verifica informațiile relevante, dacă solicitarea nu se referă la informații cu caracter personal prelucrate de OpenAI, dacă se aplică o excepție sau dacă există un alt motiv legal pentru a nu-i da curs. Solicitările sunt evaluate de la caz la caz și pot necesita punerea în balanță a drepturilor la confidențialitate cu alte considerente importante, precum libertatea de exprimare și interesul public.

Cu toate acestea, ne străduim să acordăm prioritate protejării informațiilor cu caracter personal și să respectăm toate legile aplicabile privind confidențialitatea. Dacă considerați că nu am soluționat în mod adecvat o problemă, aveți dreptul de a depune o plângere la autoritatea locală de supraveghere.

Pentru mai multe informații despre practicile OpenAI privind informațiile cu caracter personal pe care le colectăm de la sau despre dvs. atunci când utilizați site-ul, aplicațiile și serviciile noastre, consultați Politica de confidențialitate.

A fost util acest articol?