OpenAI
या पेजला मशीनद्वारे भाषांतरित केले आहे. मूळ इंग्रजी लेख पहा.

OpenAI मॉडेल प्रतिसादांची लांबी नियंत्रित करणे

टोकन सेटिंग्ज, स्पष्ट प्रॉम्प्ट, उदाहरणे आणि stop sequences वापरून OpenAI मॉडेल्ससाठी आउटपुट मर्यादा कशा सेट करायच्या ते जाणून घ्या.

अपडेट केले: 19 days ago

विहंगावलोकन

मॉडेलच्या प्रतिसादाची लांबी नियंत्रित करणे अनेक कारणांसाठी उपयुक्त ठरते: यामुळे खर्च व्यवस्थापित करण्यास मदत होते (कारण तुम्ही प्रत्येक टोकनसाठी पैसे देता), विलंब/कार्यप्रदर्शन सुधारते (लहान प्रतिसाद अधिक जलद परत येतात) आणि खूप लांब किंवा पाल्हाळिक आउटपुट टाळून संबंधितता राखली जाते.

हे तुम्ही टोकन कॅप्स, रीझनिंग आणि verbosity सेटिंग्ज, स्पष्ट सूचना, उदाहरणे आणि स्टॉप सीक्वेन्सेस वापरून साध्य करू शकता. सर्वात अद्ययावत आणि संपूर्ण तपशीलांसाठी, नेहमी platform.openai.com वरील अधिकृत API संदर्भ पहा.

कमाल आउटपुट लांबी सेट करा

रिस्पॉन्सेस API

GPT-5 मॉडेल्स आणि बहुतांश o-series मॉडेल्ससाठी वापरले जाते: मॉडेल निर्माण करेल त्या टोकनची संख्या मर्यादित करण्यासाठी max_output_tokens वापरा. compaction_trigger विनंत्यांसाठी max_output_tokens वगळा किंवा त्याचे मूल्य किमान 20000 ठेवा; यापेक्षा लहान मूल्ये नाकारली जातात. रिस्पॉन्सेस API अनेक कम्प्लीशन्सना (n) समर्थन देत नाही.

चॅट कम्प्लीशन्स API

पूर्वीचे GPT-3.5, GPT-4o आणि काही वेळा o-series यांसाठी वापरले जाते.

  • o3 आणि o4-mini यांसारख्या रीझनिंग मॉडेल्ससाठी max_completion_tokens वापरा; हे max_tokens चे पर्यायी नाव आहे.

  • आधीच्या किंवा रीझनिंग न करणाऱ्या मॉडेल्ससाठी max_tokens अजूनही कार्य करते.

  • stop आणि n (अनेक कम्प्लीशन्स) यांना समर्थन देते.

टीप: “किमान टोकन्स” अशी कोणतीही सेटिंग नाही. तुम्हाला किमान लांबी हवी असल्यास, ती तुमच्या प्रॉम्प्टमध्ये नमूद करा.

मॉडेल गटानुसार टोकन मर्यादा

अद्ययावत टोकन मर्यादा, संदर्भ आकार आणि आउटपुट कॅप्ससाठी, कृपया विशिष्ट मॉडेल दस्तऐवजीकरण पहा.

झटपट उदाहरणे

रिस्पॉन्सेस API

{ "model": "gpt-5", "input": "निष्कर्ष ~80 शब्दांत संक्षेपित करा.", "max_output_tokens": 120 }

चॅट कम्प्लीशन्स (रीझनिंग मॉडेल)

{ "model": "o3-mini", "messages": [{"role": "user", "content": "Write five one-line options."}], "max_completion_tokens": 100 }

GPT-5 मॉडेल्ससाठी विशिष्ट नियंत्रणे: verbosity आणि reasoning.effort

ही नियंत्रणे फक्त GPT-5 मॉडेल्सवर उपलब्ध आहेत (gpt-5.2, gpt-5.2-chat-latest, gpt-5.2 pro इ.). O-series आणि पूर्वीची मॉडेल्स त्यांना समर्थन देत नाहीत.


verbosity साठी "low", "medium" (डीफॉल्ट) किंवा "high" स्वीकारले जाते. यामुळे तपशीलाच्या पातळीवर परिणाम होतो, पण निश्चित मर्यादांवर नाही.

{ "model": "gpt-5", "input": "PageRank उच्च स्तरावर समजावून सांगा.", "text": { "verbosity": "low" }, "max_output_tokens": 200 }

उत्तर देण्यापूर्वी किती रीझनिंग टोकन निर्माण करायचे, हे reasoning.effort नियंत्रित करते. GPT-5.2 हे none, low, medium, high आणि xhigh यांना समर्थन देते. gpt-5.2-pro फक्त medium, high आणि xhigh यांना समर्थन देते. आधीची रीझनिंग मॉडेल्स फक्त low, medium आणि high यांना समर्थन देतात.

{ "model": "gpt-5", "input": "स्टॅच्यू ऑफ लिबर्टीला 1mm थराने कोट करण्यासाठी किती सोने लागेल?", "reasoning": { "effort": "minimal" } }

प्रतिसाद-विलंब महत्त्वाचा असलेल्या उपयोगांसाठी मॉडेलने रीझनिंग न करणाऱ्या मॉडेलसारखे वागावे यासाठी reasoning.effort चे मूल्य none ठेवा.

विशिष्ट सूचना द्या

तुम्हाला हवी असलेली अचूक लांबी किंवा रचना मागा. उदाहरणे:

  • “नेमके पाच पर्याय सूचीबद्ध करा.”

  • 50 शब्दांचा सारांश लिहा.”

  • “कमाल 100 टोकन. अधिक हवे असल्यास, ‘अधिक जागा हवी.’ असे म्हणा.”

सुसंगत लांबीची उदाहरणे वापरा

तुमच्या अपेक्षित लांबीशी जुळणारी फ्यू-शॉट उदाहरणे मॉडेलला तो नमुना पुढे चालू ठेवण्यास मदत करतात.

धोरणात्मक थांबा-अनुक्रम वापरा

मॉडेल विभाजकापर्यंत किंवा क्रमांकित यादीच्या सीमेपर्यंत पोहोचल्यावर निर्मिती थांबवण्यासाठी stop वापरा.

{ "stop": ["
###", "6."] }

अनेक पर्याय

  • चॅट कम्प्लीशन्स: n एका API विनंतीत अनेक कम्प्लीशन्स परत करते.

  • रिस्पॉन्सेस API: n समर्थित नाही; एकापेक्षा जास्त आउटपुट हवे असल्यास अनेक विनंत्या करा.

हा लेख उपयुक्त आहे का?