მიმოხილვა
მოდელის პასუხის სიგრძის კონტროლი რამდენიმე მიზეზით არის სასარგებლო: ის გეხმარებათ ხარჯის მართვაში (რადგან იხდით თითო token-ზე), აუმჯობესებს დაყოვნებას/წარმადობას (მოკლე პასუხები უფრო სწრაფად ბრუნდება) და უზრუნველყოფს შესაბამისობას ზედმეტად გრძელი ან სიტყვამრავალი შედეგების თავიდან აცილებით.
ამის მიღწევა შეგიძლიათ token-ების ზღვრული მნიშვნელობებით, მსჯელობისა და დეტალიზაციის პარამეტრებით, მკაფიო ინსტრუქციებით, მაგალითებით და შეჩერების მიმდევრობებით. ყველაზე ახალი და სრული ინფორმაციისთვის ყოველთვის მიმართეთ ოფიციალურ API ცნობარს platform.openai.com-ზე.
დააყენეთ გამოტანის მაქსიმალური სიგრძე
პასუხების API
გამოიყენება GPT-5 მოდელებისა და O-სერიის მოდელების უმეტესობისთვის: მოდელის მიერ გენერირებული ტოკენების რაოდენობის შესაზღუდად გამოიყენეთ max_output_tokens. compaction_trigger მოთხოვნებში ან გამოტოვეთ max_output_tokens, ან მიუთითეთ სულ მცირე 20000; უფრო მცირე მნიშვნელობები უარყოფილია. პასუხების API-ს რამდენიმე დასრულების (n) მხარდაჭერა არ აქვს.
ჩატის დასრულების API
გამოიყენება მოძველებული GPT-3.5-ის, GPT-4o-სა და ზოგჯერ O-სერიისთვის.
ისეთი მსჯელობის მოდელებისთვის, როგორიცაა o3 და o4-mini, გამოიყენეთ max_completion_tokens (max_tokens-ის ფსევდონიმი)
წინა თაობის ან არამსჯელობის მოდელებისთვის max_tokens კვლავ მუშაობს
აქვს stop-ისა და n-ის (რამდენიმე დასრულების) მხარდაჭერა.
შენიშვნა: „მინიმალური token-ების“ პარამეტრი არ არსებობს. თუ მინიმალური სიგრძე გჭირდებათ, მიუთითეთ ის თქვენს მოთხოვნაში.
Token-ის ლიმიტები მოდელების ჯგუფების მიხედვით
token-ის უახლესი ლიმიტების, კონტექსტის ზომებისა და გამოტანის ზღვრული მნიშვნელობებისთვის იხილეთ კონკრეტული მოდელის დოკუმენტაცია.
სწრაფი მაგალითები
Responses API
{ "model": "gpt-5", "input": "შეაჯამე მიგნებები ~80 სიტყვაში.", "max_output_tokens": 120 }ჩატის დასრულებები (მსჯელობის მოდელი)
{ "model": "o3-mini", "messages": [{"role": "user", "content": "Write five one-line options."}], "max_completion_tokens": 100 }GPT-5 მოდელების სპეციფიკური პარამეტრები: verbosity და reasoning.effort
ეს პარამეტრები ხელმისაწვდომია მხოლოდ GPT-5 მოდელებში (gpt-5.2, gpt-5.2-chat-latest, gpt-5.2 pro და სხვ.). O-სერიისა და მოძველებულ მოდელებს მათი მხარდაჭერა არ აქვთ.
verbosity იღებს მნიშვნელობებს "low", "medium" (ნაგულისხმევი) ან "high". ის დეტალიზაციის დონეზე მოქმედებს, თუმცა მკაცრ ლიმიტებს არ ცვლის.
{ "model": "gpt-5", "input": "მარტივად ახსენი PageRank-ის პრინციპი.", "text": { "verbosity": "low" }, "max_output_tokens": 200 }reasoning.effort განსაზღვრავს, პასუხის შექმნამდე მსჯელობის რამდენი ტოკენი გენერირდება. GPT-5.2-ს აქვს none, low, medium, high და xhigh მნიშვნელობების მხარდაჭერა. gpt-5.2-pro-ს მხარდაჭერა აქვს მხოლოდ medium, high და xhigh მნიშვნელობებისთვის. წინა თაობის მსჯელობის მოდელებს მხოლოდ low, medium და high მნიშვნელობების მხარდაჭერა აქვთ.
{ "model": "gpt-5", "input": "რამდენი ოქრო იქნება საჭირო თავისუფლების ქანდაკების 1 მმ-იანი ფენით დასაფარად?", "reasoning": { "effort": "minimal" } }დაყოვნებისადმი მგრძნობიარე შემთხვევებში, მოდელმა არამსჯელობის მოდელივით რომ იმუშაოს, reasoning.effort-ის მნიშვნელობად შეგიძლიათ none მიუთითოთ.
მიაწოდეთ კონკრეტული ინსტრუქციები
მოითხოვეთ ზუსტად ის სიგრძე ან ფორმა, რომელიც გჭირდებათ. მაგალითები:
„ჩამოთვალე ზუსტად ხუთი ვარიანტი.“
„დაწერე 50-სიტყვიანი შეჯამება.“
„არაუმეტეს 100 token-ისა. თუ მეტი სივრცე გჭირდება, თქვი: „მეტი სივრცე მჭირდება.““
გამოიყენეთ თანაბარი სიგრძის მაგალითები
Few-shot სწავლების მაგალითები, რომლებიც სასურველ სიგრძეს ემთხვევა, მოდელს შაბლონის გაგრძელებაში ეხმარება.
სტრატეგიული შეჩერების მიმდევრობების გამოყენება
გამოიყენეთ stop, რათა გენერაცია შეწყდეს, როცა მოდელი გამყოფ ნიშნამდე ან დანომრილი სიის საზღვრამდე მივა.
{ "stop": ["
###", "6."] }რამდენიმე კანდიდატი
ჩატის დასრულებები: n ერთი გამოძახებით რამდენიმე დასრულებას აბრუნებს.
პასუხების API: n მხარდაჭერილი არ არის; თუ ერთზე მეტი შედეგი გჭირდებათ, რამდენიმე გამოძახება შეასრულეთ.
