OpenAI
या पेजला मशीनद्वारे भाषांतरित केले आहे. मूळ इंग्रजी लेख पहा.

OpenAI मॉडेल प्रतिसादांची लांबी नियंत्रित करणे

टोकन सेटिंग्ज, स्पष्ट प्रॉम्प्ट, उदाहरणे आणि stop sequences वापरून OpenAI मॉडेल्ससाठी आउटपुट मर्यादा कशा सेट करायच्या ते जाणून घ्या.

अपडेट केले: 8 days ago

विहंगावलोकन

मॉडेलच्या प्रतिसादाची लांबी नियंत्रित करणे अनेक कारणांसाठी उपयुक्त ठरते: यामुळे खर्च व्यवस्थापित करण्यास मदत होते (कारण तुम्ही प्रत्येक टोकनसाठी पैसे देता), विलंब/कार्यप्रदर्शन सुधारते (लहान प्रतिसाद अधिक जलद परत येतात) आणि खूप लांब किंवा पाल्हाळिक आउटपुट टाळून संबंधितता राखली जाते.

हे तुम्ही टोकन कॅप्स, रीझनिंग आणि verbosity सेटिंग्ज, स्पष्ट सूचना, उदाहरणे आणि स्टॉप सीक्वेन्सेस वापरून साध्य करू शकता. सर्वात अद्ययावत आणि संपूर्ण तपशीलांसाठी, नेहमी platform.openai.com वरील अधिकृत API संदर्भ पहा.

कमाल आउटपुट लांबी सेट करा

रिस्पॉन्सेस API

GPT-5 मॉडेल आणि बहुतेक o-series मॉडेलसाठी वापरले जाते: मॉडेल किती टोकन जनरेट करेल यावर मर्यादा घालण्यासाठी max_output_tokens वापरा. compaction_trigger विनंत्यांसाठी, max_output_tokens वगळा किंवा ते किमान 20000 वर सेट करा; त्यापेक्षा लहान मूल्ये नाकारली जातात. रिस्पॉन्सेस API अनेक कम्प्लीशन्सना (n) सपोर्ट करत नाही.

चॅट कम्प्लीशन्स API

लेगसी GPT-3.5, GPT-4o आणि कधीकधी o-series साठी वापरले जाते.

  • o3 आणि o4-mini सारख्या रीझनिंग मॉडेलसाठी, max_completion_tokens वापरा (max_tokens चे alias).

  • आधीच्या/रीझनिंग नसलेल्या मॉडेलसाठी, max_tokens अजूनही काम करते.

  • stop आणि n (अनेक कम्प्लीशन्स) यांना सपोर्ट करते.

टीप: “किमान टोकन्स” अशी कोणतीही सेटिंग नाही. तुम्हाला किमान लांबी हवी असल्यास, ती तुमच्या प्रॉम्प्टमध्ये नमूद करा.

मॉडेल गटानुसार टोकन मर्यादा

अद्ययावत टोकन मर्यादा, संदर्भ आकार आणि आउटपुट कॅप्ससाठी, कृपया विशिष्ट मॉडेल दस्तऐवजीकरण पहा.

झटपट उदाहरणे

रिस्पॉन्सेस API

{ "model": "gpt-5", "input": "निष्कर्ष ~80 शब्दांत संक्षेपित करा.", "max_output_tokens": 120 }

चॅट कम्प्लीशन्स (रीझनिंग मॉडेल)

{ "model": "o3-mini", "messages": [{"role": "user", "content": "Write five one-line options."}], "max_completion_tokens": 100 }

GPT-5 मॉडेलांसाठी विशिष्ट नियंत्रणे: verbosity आणि reasoning.effort

ही नियंत्रणे फक्त GPT-5 मॉडेलांवर उपलब्ध आहेत (gpt-5.2, gpt-5.2-chat-latest, gpt-5.2 pro इ.). O-series आणि लेगसी मॉडेल त्यांना सपोर्ट करत नाहीत.

`verbosity` मध्ये "low", "medium" (डीफॉल्ट) किंवा "high" स्वीकारले जाते. ते तपशीलांच्या पातळीवर परिणाम करते, पण कठोर मर्यादांवर नाही.

{ "model": "gpt-5", "input": "PageRank उच्च स्तरावर समजावून सांगा.", "text": { "verbosity": "low" }, "max_output_tokens": 200 }

उत्तर तयार करण्यापूर्वी किती रीझनिंग टोकन जनरेट केले जातील हे `reasoning.effort` नियंत्रित करते. GPT-5.2 none,low, medium, high,and xhigh यांना सपोर्ट करते. gpt-5.2-pro फक्त medium, high,and xhigh यांना सपोर्ट करते. आधीची रीझनिंग मॉडेल फक्त low, medium आणि high यांना सपोर्ट करतात.

{ "model": "gpt-5", "input": "स्टॅच्यू ऑफ लिबर्टीला 1mm थराने कोट करण्यासाठी किती सोने लागेल?", "reasoning": { "effort": "minimal" } }

विलंब-संवेदनशील वापर प्रकरणांसाठी मॉडेलने रीझनिंग नसलेल्या मॉडेलसारखे वागावे यासाठी तुम्ही `reasoning.effort` none वर सेट करू शकता.

विशिष्ट सूचना द्या

तुम्हाला हवी असलेली अचूक लांबी किंवा रचना मागा. उदाहरणे:

  • “नेमके पाच पर्याय सूचीबद्ध करा.”

  • 50 शब्दांचा सारांश लिहा.”

  • “कमाल 100 टोकन. अधिक हवे असल्यास, ‘अधिक जागा हवी.’ असे म्हणा.”

सुसंगत लांबीची उदाहरणे वापरा

तुमच्या अपेक्षित लांबीशी जुळणारी फ्यू-शॉट उदाहरणे मॉडेलला तो नमुना पुढे चालू ठेवण्यास मदत करतात.

योग्य स्टॉप सीक्वेन्सेस वापरा

मॉडेल डिलिमिटर किंवा क्रमांकित यादीची सीमा गाठल्यावर जनरेशन थांबवण्यासाठी stop वापरा.

{ "stop": ["
###", "6."] }

अनेक उमेदवार

  • चॅट कम्प्लीशन्स: n एका कॉलमध्ये अनेक कम्प्लीशन्स परत करते.

  • रिस्पॉन्सेस API: n सपोर्टेड नाही; एकापेक्षा जास्त आउटपुट हवे असल्यास अनेक कॉल करा.

हा लेख उपयुक्त आहे का?