Genel bakış
Bir modelin yanıt uzunluğunu kontrol etmek birkaç nedenle yararlıdır: maliyeti yönetmeye yardımcı olur (çünkü token başına ödeme yaparsınız), gecikmeyi/performansı iyileştirir (daha kısa yanıtlar daha hızlı döner) ve aşırı uzun veya ayrıntılı çıktılardan kaçınarak alaka düzeyini korur.
Bunu token üst limitleri, akıl yürütme ve ayrıntı ayarları, net talimatlar, örnekler ve stop dizileri kullanarak yapabilirsiniz. En güncel ve eksiksiz ayrıntılar için her zaman platform.openai.com’daki resmi API başvurusuna bakın.
Maksimum çıktı uzunluğu ayarlayın
Responses API
GPT-5 modelleri ve O serisi modellerin çoğu için kullanılır: Modelin üreteceği token sayısını sınırlamak için max_output_tokens kullanın. compaction_trigger isteklerinde max_output_tokens parametresini atlayın veya en az 20000 olarak ayarlayın; daha küçük değerler reddedilir. Responses API, birden fazla tamamlamayı (n) desteklemez.
Chat Completions API
Eski GPT-3.5 ve GPT-4o modellerinin yanı sıra bazen O serisi için kullanılır.
o3 ve o4-mini gibi akıl yürütme modellerinde max_completion_tokens (max_tokens diğer adı) kullanın
Önceki veya akıl yürütmeyen modellerde max_tokens kullanılmaya devam edilebilir
stop ve n (birden fazla tamamlama) desteklenir.
Not: “Minimum token” ayarı yoktur. Minimum uzunluk gerekiyorsa bunu prompt’unuzda belirtin.
Model grubuna göre token sınırları
Güncel token sınırları, bağlam boyutları ve çıktı üst limitleri için lütfen ilgili model belgelerine bakın.
Hızlı örnekler
Responses API
{ "model": "gpt-5", "input": "Bulguları ~80 kelimeyle özetle.", "max_output_tokens": 120 }Chat Completions (akıl yürütme modeli)
{ "model": "o3-mini", "messages": [{"role": "user", "content": "Write five one-line options."}], "max_completion_tokens": 100 }GPT-5 modellerine özel denetimler: verbosity ve reasoning.effort
Bu denetimler yalnızca GPT-5 modellerinde kullanılabilir (gpt-5.2, gpt-5.2-chat-latest, gpt-5.2 pro vb.). O serisi ve eski modeller bunları desteklemez.
verbosity; "low", "medium" (varsayılan) veya "high" değerlerini kabul eder. Ayrıntı düzeyini etkiler ancak kesin sınırları etkilemez.
{ "model": "gpt-5", "input": "PageRank’i genel hatlarıyla açıkla.", "text": { "verbosity": "low" }, "max_output_tokens": 200 }reasoning.effort, yanıt oluşturulmadan önce kaç akıl yürütme tokenı üretileceğini denetler. GPT-5.2; none, low, medium, high ve xhigh değerlerini destekler. gpt-5.2-pro yalnızca medium, high ve xhigh değerlerini destekler. Önceki akıl yürütme modelleri yalnızca low, medium ve high değerlerini destekler.
{ "model": "gpt-5", "input": "Özgürlük Heykeli’ni 1 mm’lik bir katmanla kaplamak için ne kadar altın gerekir?", "reasoning": { "effort": "minimal" } }Gecikmeye duyarlı kullanım senaryolarında modelin akıl yürütmeyen bir model gibi davranması için reasoning.effort değerini none olarak ayarlayabilirsiniz.
Belirli talimatlar verin
İstediğiniz tam uzunluğu veya biçimi belirtin. Örnekler:
“Tam olarak beş seçenek listele.”
“50 kelimelik bir özet yaz.”
“En fazla 100 token. Daha fazlası gerekirse ‘Daha fazla alana ihtiyacım var.’ deyin.”
Tutarlı uzunlukta örnekler kullanın
İstediğiniz uzunlukla eşleşen az örnekli örnekler, modelin kalıbı sürdürmesine yardımcı olur.
Durdurma dizilerini stratejik biçimde kullanın
Model bir sınırlayıcıya veya numaralı liste sınırına ulaştığında üretimi durdurmak için stop kullanın.
{ "stop": ["\n###", "6."] }Birden fazla aday
Chat Completions: n, tek bir çağrıda birden fazla tamamlama döndürür.
Responses API: n desteklenmez; birden fazla çıktıya ihtiyacınız varsa birden çok çağrı yapın.
