OpenAI
Bu sayfanın çevirisi otomatik olarak yapılmıştır. Orijinal İngilizce makaleyi görüntüleyin.

ChatGPT ve temel modellerimiz nasıl geliştiriliyor

Modellerimizi nasıl geliştirdiğimizi ve ChatGPT gibi ürünlerde nasıl kullandığımızı öğrenin

Güncellenme zamanı: 6 days ago

OpenAI’ın temel modelleri, ChatGPT’ye güç veren modeller de dâhil olmak üzere üç ana bilgi kaynağı kullanılarak geliştirilir: (1) internette herkese açık bilgiler, (2) üçüncü taraflarla iş birliği yaparak eriştiğimiz bilgiler ve (3) kullanıcılarımızın, insan eğitmenlerin ve araştırmacıların sağladığı veya oluşturduğu bilgiler.

ChatGPT’de kullanılanlar gibi temel modellerin geliştirilmesi; eğitim verilerinin hazırlanması, ön eğitim ve son eğitim ile kullanıma sunulduktan sonra sürekli değerlendirme ve iyileştirme dâhil olmak üzere birkaç aşamadan oluşur. Bu aşamalarda model performansını, güvenilirliğini ve güvenliğini iyileştirmek gibi çeşitli amaçlarla farklı bilgi türleri kullanılabilir. 

Bu makale; söz konusu modellerin geliştirilmesine yardımcı olmak için kullandığımız bilgileri, bu bilgileri gizlilik yasalarına uygun biçimde nasıl topladığımızı ve kullandığımızı, ayrıca eğitim süreci boyunca uyguladığımız koruma önlemlerini genel hatlarıyla açıklar. Modellerimizi iyileştirmeye yardımcı olmak amacıyla ChatGPT konuşmalarının kullanılmasını nasıl devre dışı bırakabileceğiniz de dâhil olmak üzere hizmetlerimizin kullanıcılarından gelen bilgileri nasıl topladığımızı ve kullandığımızı öğrenmek için lütfen Gizlilik Politikamıza ve bu Yardım Merkezi makalesine bakın.

ChatGPT nedir ve nasıl çalışır?

ChatGPT, internet veya uygulama üzerinden erişebileceğiniz yapay zeka tabanlı bir hizmettir. ChatGPT’yi bilgileri düzenleme ve özetleme, çeviriye yardımcı olma, kodlama, araştırma ve analizi destekleme, farklı araçlar üzerinden çok adımlı görevleri tamamlama, görselleri analiz etme veya oluşturma, yaratıcılığa ve fikirlere ilham verme gibi çok çeşitli günlük işler için kullanabilirsiniz. ChatGPT; metin, görsel, ses ve video dâhil olmak üzere büyük miktarda bilgideki kalıpları öğrenerek kullanıcıların soru ve talimatlarını anlayıp yanıtlayacak şekilde tasarlanmıştır. 

Eğitim sırasında model, kelimelerin bağlam içinde genellikle nasıl birlikte kullanıldığı gibi bu verilerdeki ilişkileri analiz eder ve edindiği anlayıştan yararlanarak bir yanıt oluştururken sıradaki en olası kelimeyi tek tek tahmin eder. Metin, bazen “token” olarak adlandırılan daha küçük birimlere dönüştürülebilir. Bunlar tam kelimeleri, kelimelerin parçalarını veya noktalama işaretlerini temsil edebilir. Tokenlar, modelin işlediği metnin yapı taşlarıdır. Benzer şekilde görsel gibi başka içerik türleri oluşturan modeller de eğitim verilerindeki piksellerin birbirleriyle ve ilişkili açıklamalarla bağlantısındaki kalıpları öğrenir.

Örneğin modelden öğrenme sürecinde (“eğitim” olarak bilinir) şu tür bir cümleyi tamamlaması istenebilir: “Sola dönmek yerine ___ döndü.” Eğitimin başlarında verdiği yanıtlar büyük ölçüde rastgeledir. Ancak model büyük miktarda metni işleyip öğrendikçe kalıpları tanıma ve sıradaki en olası kelimeyi tahmin etme konusunda gelişir. Modelin anlayışını geliştirmek ve doğruluğunu artırmak için bu süreç milyonlarca cümle üzerinde tekrarlanır.

Bir cümle “Sola dönmek yerine sağa döndü”, “geri döndü” veya “arkasını döndü” gibi birden fazla makul şekilde tamamlanabildiğinden, modelin yanıt verme biçiminde doğası gereği bir miktar rastgelelik bulunur. Bu nedenle aynı soru, farklı sorgulamalarda farklı yanıtlar verebilir.

Makine öğrenimi modelleri, “ağırlıklar” veya “parametreler” olarak bilinen büyük sayı kümeleri ile bu sayıları yorumlayıp kullanan kodlardan oluşur. Bu modeller, üzerinde eğitildikleri verilerin kopyalarını saklamaz veya muhafaza etmez. Bunun yerine model öğrendikçe parametrelerinin değerleri, belirlediği kalıpları yansıtacak şekilde küçük ölçülerde ayarlanır. Önceki örnekte model, eğitim cümlelerini saklayarak değil iç parametrelerini güncelleyerek rastgele kelimeler tahmin etmekten daha doğru tahminler yapmaya geçmiştir. Model, eğitim sırasında işlediği cümlelerin, görsellerin veya seslerin kopyalarını saklamaz. ChatGPT, eğitim verilerinden “kopyalayıp yapıştırmaz”. Bu süreç, kapsamlı bir çalışmanın ardından özgün materyalleri ezberlemeden veya kelimesi kelimesine tekrarlamadan fikirler arasındaki ilişkileri anlayarak kavramları açıklayabilen bir öğretmene benzer. Model, bir kullanıcının isteğine yanıt oluştururken yeni içerikleri tahmin edip oluşturmak için öğrendiği bu ağırlıkları kullanır.

ChatGPT’yi eğitmek için ne tür bilgiler kullanılır?

Herkese açık internet içerikleri söz konusu olduğunda yalnızca internette ücretsiz ve açıkça erişilebilen bilgileri kullanırız. Bunlar arasında herkese açık web sayfaları, forumlar, bloglar, gönderiler ve diğer çevrimiçi içerikler bulunabilir. Örneğin herkese açık bir çevrimiçi tartışma forumuna katılır veya herkese açık bir blog yazısı ya da başka bir gönderi yayımlarsanız bu içeriği model eğitimi amacıyla kullanabiliriz. Bununla birlikte, eğitim sürecimizde kişisel bilgilerin işlenmesini azaltmak için önlemler alırız.  Herkese açık internet içeriklerini toplarken ödeme duvarının arkasında olduğu bilinen kaynaklardan veya karanlık ağdan kasıtlı olarak veri toplamayız. Ayrıca nefret söylemi, yetişkinlere yönelik içerik, kişisel bilgileri bir araya getiren siteler ve istenmeyen içerikler gibi modellerimizin öğrenmesini istemediğimiz materyalleri kaldırmak için filtreler uygularız. Kalan bilgiler daha sonra modellerimizi eğitmek için kullanılır. 

Web sitesi sahipleri, modellerimizi eğitmeye yardımcı olmak amacıyla herkese açık içerikleri tarayabilen GPTBot’a robots.txt gibi standart web denetimleri aracılığıyla izin vermeyerek sitelerindeki herkese açık içeriklere eğitim amacıyla erişilip erişilemeyeceğini yönetebilir. Web sitesi sahiplerinin sitelerinin ve içeriklerinin yapay zeka sistemlerimizle nasıl etkileşime gireceğini yönetmesine yardımcı olacak yönergeler sunuyoruz. 

Modellerimizi eğitmeye ve iyileştirmeye yardımcı olmak için üçüncü taraf iş ortaklarından gelen bilgileri de kullanırız. Bunlar, üçüncü taraflarla yapılan anlaşmalar kapsamında eriştiğimiz veri kümelerindeki bilgilerin yanı sıra politikalarımızın ve anlaşmalarımızın izin verdiği ölçüde insan eğitmenler ile araştırmacıların sağladığı veya oluşturduğu bilgileri içerebilir. Bu, modellerimizin kalitesini, güvenliğini ve performansını iyileştirmeye yardımcı olur. Bu kaynaklar, veri kümesine bağlı olarak metin, görsel, ses, video veya başka veri türleri içerebilir.

Ayrıca bazı eğitim süreçlerinde sentetik verileri giderek daha fazla kullanıyoruz. Örneğin sentetik istemler, çok dilli örnekler veya başka eğitim materyalleri oluşturmak için bilgilerden ve modellerimizden yararlanabiliriz. Sentetik veriler, verilerin az veya dengesiz olduğu alanlarda eğitim verilerini tamamlayarak model performansını iyileştirmeye yardımcı olabilir ve model geliştirmede gizliliği güçlendiren yaklaşımları da destekleyebilir.

ChatGPT’yi eğitmek için kişisel bilgiler kullanılıyor mu?

Çevrimiçi içeriklerin önemli bir bölümü insanlar hakkındaki bilgilerden oluştuğu için eğitim verilerimiz tesadüfen kişisel bilgiler içerebilir. Bununla birlikte, eğitim sürecimizde kişisel bilgilerin işlenmesini azaltmak için önlemler alırız.

Eğitim verilerini kişiler hakkında profil oluşturmak, onlarla iletişime geçmek veya onlara yönelik reklamları kişiselleştirmek için değil; modelin tahmin, akıl yürütme ve sorun çözme gibi yeteneklerini geliştirmek için kullanırız.

Bazı durumlarda modeller; ad ve adres gibi unsurların dildeki işlevini anlamak ya da kamuya mal olmuş kişileri ve tanınmış kuruluşları tanımak için kişisel bilgilerden öğrenebilir. Bu, modelin daha doğru ve bağlama uygun yanıtlar oluşturmasına yardımcı olur.

Eğitim sırasında kişisel bilgiler nasıl korunur?

Eğitim sırasında kişisel bilgilerin işlenmesini sınırlamak için etkin önlemler alırız. Örneğin büyük miktarda kişisel veriyi bir araya getirdiği bilinen kaynakları hariç tutar, eğitim sürecindeki kişisel bilgileri azaltmak için filtreler uygular ve eğitim verilerinin tekrarlanma riskini azaltmak amacıyla yinelenen içerikleri belirleyip kaldırmak üzere önlemler alırız. Ayrıca modellerimizi, kişiler hakkındaki özel veya hassas bilgilere yönelik isteklere yanıt vermekten kaçınacak şekilde eğitiriz. 

Bilgileri ne kadar süreyle saklarız?

Eğitim verilerindeki bilgileri yalnızca modellerimizi geliştirmek ve iyileştirmek ile ilgili bilimsel araştırmalar yapmak dâhil olmak üzere bu makalede ve Gizlilik Politikamızda açıklanan amaçlar için makul ölçüde gerekli olduğu sürece saklarız. Saklama ihtiyacının devam edip etmediği düzenli olarak gözden geçirilir; saklama süresi, bilginin türüne ve nasıl kullanıldığına bağlı olarak değişir. Saklama süresini belirlerken bilgileri işleme amacımızı; bilgilerin miktarını, niteliğini ve hassasiyetini; yetkisiz kullanım veya ifşadan doğabilecek olası zarar riskini ve tabi olduğumuz yasal yükümlülükleri dikkate alırız.

ChatGPT’nin geliştirilmesi gizlilik yasalarına nasıl uyum sağlar?

Eğitim bilgilerini hukuka uygun şekilde kullanırız. Temel modellerimiz; erişilebilirlik araçları, müşteri desteği, yazılım geliştirme, kişiselleştirilmiş eğitim ve bilimsel araştırmalar dâhil olmak üzere çok çeşitli faydalı uygulamalara güç verir. Bu yetenekler; herkese açık bilgiler ve üçüncü taraf iş ortaklarından gelen bilgiler dâhil olmak üzere büyük ölçekli eğitim verilerine dayanır. Bu makalede açıklandığı üzere eğitim sürecinde kişisel bilgilerin işlenmesini azaltmak ve riskleri hafifletmek üzere tasarlanmış adımlar da dâhil olmak üzere süreç boyunca koruma önlemleri uygularız. Eğitim bilgilerinde yer alan kişisel bilgileri toplamamızı ve kullanmamızı, GDPR gibi gizlilik yasaları kapsamındaki meşru menfaatlere dayandırırız. Bunlar arasında, genel yapay zekanın herkesin yararına olmasını sağlama misyonumuz doğrultusunda modellerimizi kullanıcılar ve toplumun geneli için eğitip iyileştirmek de bulunur. Bu konu Gizlilik Politikamızda daha ayrıntılı olarak açıklanmaktadır. Bu bilgileri hukuka uygun ve sorumlu bir şekilde toplayıp kullandığımızdan emin olmaya yardımcı olmak için bir veri koruma etki değerlendirmesi tamamladık.

Bilgilerin paylaşılabileceği veya aktarılabileceği durumlar

Kişisel bilgileri “satmayız” ve eğitim verilerindeki kişisel bilgileri yalnızca Gizlilik Politikamızda açıklanan sınırlı durumlarda ifşa ederiz. Örneğin modellerimizin geliştirilmesini, test edilmesini ve iyileştirilmesini destekleyen bağlı kuruluşlar, tedarikçiler ve hizmet sağlayıcılarla bilgi paylaşabiliriz. Ayrıca Gizlilik Politikamızda açıklandığı üzere yasal bir yükümlülüğe uymak veya kendimizin, kullanıcılarımızın, çalışanlarımızın ya da kamunun haklarını ve emniyetini korumak için gerekli olduğuna iyi niyetle inandığımız durumlarda bilgileri ifşa edebiliriz.

Altyapımız küresel olduğundan eğitim verilerindeki kişisel bilgiler AEA, İsviçre veya Birleşik Krallık dışındaki ülkelerde (Amerika Birleşik Devletleri dâhil) işlenebilir. Böyle durumlarda Gizlilik Politikamızda açıklandığı üzere yeterlilik kararları veya standart sözleşme maddeleri gibi uygun koruma önlemleri uygularız.

Haklarınız ve bunları kullanma yolları

İtiraz taleplerine ve benzer hak taleplerine yanıt veririz. ChatGPT dili öğrendiği için yanıtları bazen kişisel bilgileri herkese açık internette birden çok kez yer alan kişiler (örneğin kamuya mal olmuş kişiler) hakkında kişisel bilgiler içerebilir. Belirli yargı bölgelerindeki kişiler, kişisel bilgilerinin modellerimiz tarafından işlenmesine itiraz edebilir veya Gizlilik Portalımız üzerinden veri sahibi olarak diğer haklarına ilişkin taleplerde bulunabilir. Bu haklarınızı privacy@openai.com adresine ulaşarak da kullanabilirsiniz.

Talebinizi değerlendirmemize ve yanıtlamamıza yardımcı olmak için lütfen talebinizin hangi kişisel bilgilerle ilgili olduğunu anlayabilmemizi sağlayacak yeterli bilgi sunun. Adınız, ilgili URL’ler, model çıktılarından belirli örnekler veya sorunu belirlemeye yardımcı olacak diğer ayrıntılar buna dâhil olabilir. Bazı durumlarda harekete geçmeden önce kimliğinizi doğrulamanızı veya bilgilerin sizinle ilgili olduğunu teyit etmenizi isteyebiliriz. En iyi uygulamalar ve taleplerin nasıl incelendiği dâhil olmak üzere bu taleplerin nasıl gönderileceği hakkında daha fazla bilgi, ChatGPT’den kişisel verilerin kaldırılmasına ilişkin Yardım Merkezi makalemizde bulunabilir. Talepleri geçerli gizlilik yasalarına uygun olarak inceler ve ilgili yasal süreler içinde yanıtlarız.

Gizlilik yasaları uyarınca bazı hakların mutlak olmayabileceğini lütfen unutmayın. Örneğin ilgili bilgileri doğrulayamadığımızda, talep OpenAI’ın işlediği kişisel bilgilerle ilgili olmadığında, bir istisna geçerli olduğunda veya talebi yerine getirmemek için başka bir hukuka uygun gerekçemiz bulunduğunda talebi karşılayamayabiliriz. Talepler her olayın koşullarına göre değerlendirilir ve gizlilik hakları ile ifade özgürlüğü ve kamu yararı gibi diğer önemli hususlar arasında denge kurulmasını gerektirebilir.

Bununla birlikte, kişisel bilgilerin korunmasına öncelik vermeye ve yürürlükteki tüm gizlilik yasalarına uymaya çalışırız. Bir sorunu yeterince ele almadığımızı düşünüyorsanız yerel denetim makamınıza şikâyette bulunma hakkınız vardır.

Web sitemizi, uygulamalarımızı ve hizmetlerimizi kullandığınızda sizden veya sizin hakkınızda topladığımız kişisel bilgilere ilişkin OpenAI uygulamaları hakkında daha fazla bilgi edinmek için lütfen Gizlilik Politikamıza bakın.

Bu makale yararlı oldu mu?