OpenAI
यह पेज मशीन द्वारा अनुवादित है. मूल अंग्रेज़ी आर्टिकल देखें.

OpenAI मॉडल प्रतिक्रियाओं की लंबाई नियंत्रित करना

टोकन सेटिंग्स, स्पष्ट प्रॉम्प्ट, उदाहरणों और स्टॉप सीक्वेंस का उपयोग करके OpenAI मॉडलों के लिए आउटपुट सीमाएँ सेट करना सीखें.

अपडेट किया गया: 12 days ago

अवलोकन

मॉडल की प्रतिक्रिया की लंबाई नियंत्रित करना कई कारणों से उपयोगी है: यह लागत प्रबंधित करने में मदद करता है (क्योंकि आप प्रति टोकन भुगतान करते हैं), लेटेंसी/प्रदर्शन सुधारता है (छोटी प्रतिक्रियाएँ तेज़ी से लौटती हैं), और बहुत लंबे या शब्दाडंबरपूर्ण आउटपुट से बचाकर प्रासंगिकता सुनिश्चित करता है.

आप यह टोकन कैप्स, रीज़निंग और वर्बोसिटी सेटिंग्स, स्पष्ट निर्देशों, उदाहरणों और स्टॉप सीक्वेंस का उपयोग करके कर सकते हैं. सबसे मौजूदा और पूर्ण विवरणों के लिए, हमेशा platform.openai.com पर आधिकारिक API संदर्भ देखें.

अधिकतम आउटपुट लंबाई सेट करें

रिस्पॉन्सेज़ API

GPT-5 मॉडल और अधिकतर ओ-सीरीज़ मॉडलों के लिए: मॉडल द्वारा जनरेट किए जाने वाले टोकन की संख्या सीमित करने हेतु max_output_tokens का उपयोग करें. compaction_trigger अनुरोधों के लिए या तो max_output_tokens को शामिल न करें या इसे कम-से-कम 20000 पर सेट करें; इससे छोटे मान अस्वीकार कर दिए जाते हैं. रिस्पॉन्सेज़ API एकाधिक कम्प्लीशन (n) का समर्थन नहीं करता.

चैट कम्प्लीशन्स API

पुराने GPT-3.5, GPT-4o और कभी-कभी ओ-सीरीज़ के लिए उपयोग किया जाता है.

  • o3 और o4-mini जैसे रीज़निंग मॉडल के लिए max_completion_tokens (max_tokens का उपनाम) इस्तेमाल करें.

  • पुराने या गैर-रीज़निंग मॉडल के लिए max_tokens अब भी काम करता है.

  • stop और n (एकाधिक कम्प्लीशन) का समर्थन करता है.

ध्यान दें: “न्यूनतम टोकन” की कोई सेटिंग नहीं है. यदि आपको न्यूनतम लंबाई चाहिए, तो उसे अपने प्रॉम्प्ट में निर्दिष्ट करें.

मॉडल समूह के अनुसार टोकन सीमाएँ

अप-टू-डेट टोकन सीमाओं, कॉन्टेक्स्ट आकारों और आउटपुट कैप्स के लिए, कृपया विशिष्ट मॉडल दस्तावेज़ देखें.

त्वरित उदाहरण

रिस्पॉन्सेस API

{ "model": "gpt-5", "input": "निष्कर्षों को लगभग 80 शब्दों में संक्षेपित करें.", "max_output_tokens": 120 }

चैट कम्प्लीशन्स (रीज़निंग मॉडल)

{ "model": "o3-mini", "messages": [{"role": "user", "content": "पाँच एक-पंक्ति विकल्प लिखें।"}], "max_completion_tokens": 100 }

GPT-5 मॉडलों के लिए खास नियंत्रण: verbosity और reasoning.effort

ये नियंत्रण केवल GPT-5 मॉडलों में उपलब्ध हैं (gpt-5.2, gpt-5.2-chat-latest, gpt-5.2 pro आदि). ओ-सीरीज़ और पुराने मॉडल इनका समर्थन नहीं करते.


verbosity के लिए "low", "medium" (डिफ़ॉल्ट) या "high" स्वीकार्य है. यह विवरण के स्तर को प्रभावित करता है, तय सीमाओं को नहीं.

{ "model": "gpt-5", "input": "PageRank को उच्च स्तर पर समझाएँ.", "text": { "verbosity": "low" }, "max_output_tokens": 200 }

reasoning.effort यह नियंत्रित करता है कि उत्तर देने से पहले कितने रीज़निंग टोकन जनरेट किए जाएँ. GPT-5.2 में none, low, medium, high और xhigh समर्थित हैं. gpt-5.2-pro में केवल medium, high और xhigh समर्थित हैं. पुराने रीज़निंग मॉडल केवल low, medium और high का समर्थन करते हैं.

{ "model": "gpt-5", "input": "स्टैच्यू ऑफ़ लिबर्टी पर 1mm की परत चढ़ाने में कितना सोना लगेगा?", "reasoning": { "effort": "minimal" } }

विलंब-संवेदी उपयोगों में मॉडल को गैर-रीज़निंग मॉडल की तरह काम कराने के लिए आप reasoning.effort को none पर सेट कर सकते हैं.

विशिष्ट निर्देश दें

अपनी इच्छित सटीक लंबाई या रूप के लिए कहें. उदाहरण:

  • ठीक पाँच विकल्प सूचीबद्ध करें.”

  • 50-शब्दों का सारांश लिखें.”

  • 100 टोकन से ज़्यादा नहीं. अगर और चाहिए, तो कहें ‘और जगह चाहिए.’”

संगत लंबाई वाले उदाहरणों का उपयोग करें

आपकी वांछित लंबाई से मेल खाने वाले फ्यू-शॉट उदाहरण मॉडल को पैटर्न जारी रखने में मदद करते हैं.

रणनीतिक स्टॉप अनुक्रम लागू करें

जब मॉडल किसी सीमांकक या क्रमांकित सूची की सीमा तक पहुँचे, तो जनरेशन रोकने के लिए stop का उपयोग करें.

{ "stop": ["\n###", "6."] }

एकाधिक विकल्प

  • चैट कम्प्लीशन्स: n एक ही कॉल में एकाधिक कम्प्लीशन देता है.

  • रिस्पॉन्सेज़ API: n समर्थित नहीं है; यदि आपको एक से अधिक आउटपुट चाहिए, तो कई कॉल करें.

क्या यह लेख मददगार था?