Тойм
Загварын хариултын уртыг хянах нь хэд хэдэн шалтгаанаар хэрэгтэй: зардлыг удирдахад тусална (та токен бүрээр төлдөг тул), хоцролт/гүйцэтгэлийг сайжруулна (богино хариулт хурдан ирдэг), мөн хэт урт эсвэл нуршуу гаралтаас зайлсхийж хамааралтай байдлыг хангана.
Үүнийг токены дээд хязгаар, сэтгэн бодох ба дэлгэрэнгүй байдлын тохиргоо, тодорхой заавар, жишээ болон зогсоох дарааллаар хийж болно. Хамгийн шинэ бөгөөд бүрэн мэдээллийг авахын тулд platform.openai.com дээрх албан ёсны API лавлагааг үргэлж үзнэ үү.
Гаралтын дээд уртыг тохируулах
Responses API
GPT-5 болон O цувралын ихэнх загварт ашиглана: загварын үүсгэх токены тоог хязгаарлахын тулд max_output_tokens-ыг ашиглана. compaction_trigger хүсэлтэд max_output_tokens-ыг орхих эсвэл хамгийн багадаа 20000 болгож тохируулна; үүнээс бага утгыг хүлээн авахгүй. Responses API нь олон гүйцээлтийг (n) дэмждэггүй.
Чат боловсруулах API
Хуучин үеийн GPT-3.5, GPT-4o болон зарим O цувралын загварт ашиглана.
o3, o4-mini зэрэг сэтгэн бодох загварт max_completion_tokens-ыг (max_tokens-ын өөр нэр) ашиглана
Өмнөх үеийн болон сэтгэн бодох бус загварт max_tokens ажилласаар байна
stop болон n-ийг (олон гүйцээлт) дэмждэг.
Тэмдэглэл: “Хамгийн бага токен” гэсэн тохиргоо байхгүй. Хэрэв хамгийн бага урт хэрэгтэй бол өгөгдөлдөө үүнийг зааж өг.
Загварын бүлгээрх токены хязгаарууд
Токены хязгаар, контекстийн хэмжээ, гаралтын дээд хязгаарын хамгийн сүүлийн мэдээллийг тухайн загварын баримт бичгээс харна уу.
Товч жишээнүүд
Responses API
{ "model": "gpt-5", "input": "Олдворуудыг ~80 үгээр хураангуйл.", "max_output_tokens": 120 }Chat Completions (сэтгэн бодох загвар)
{ "model": "o3-mini", "messages": [{"role": "user", "content": "Write five one-line options."}], "max_completion_tokens": 100 }GPT-5 загварт зориулсан удирдлагууд: verbosity ба reasoning.effort
Эдгээр удирдлагыг зөвхөн GPT-5 загваруудад ашиглах боломжтой (gpt-5.2, gpt-5.2-chat-latest, gpt-5.2 pro гэх мэт). O цувралын болон хуучин үеийн загварууд эдгээрийг дэмждэггүй.
verbosity нь "low", "medium" (өгөгдмөл) эсвэл "high" утгыг авна. Энэ нь дэлгэрэнгүй байдлын түвшинд нөлөөлөх боловч хатуу хязгаарт нөлөөлөхгүй.
{ "model": "gpt-5", "input": "PageRank-ийг ерөнхий түвшинд тайлбарла.", "text": { "verbosity": "low" }, "max_output_tokens": 200 }reasoning.effort нь хариулт гаргахаас өмнө хэдэн сэтгэн бодох токен үүсгэхийг удирдана. GPT-5.2 нь none, low, medium, high, xhigh утгуудыг дэмждэг. gpt-5.2-pro нь зөвхөн medium, high, xhigh утгуудыг дэмждэг. Өмнөх үеийн сэтгэн бодох загварууд зөвхөн low, medium, high утгуудыг дэмждэг.
{ "model": "gpt-5", "input": "Эрх чөлөөний хөшөөг 1мм зузаан давхаргаар бүрэхэд хэр их алт хэрэгтэй вэ?", "reasoning": { "effort": "minimal" } }Хариу өгөх хугацаа чухал хэрэглээнд загварыг сэтгэн бодох бус загвар шиг ажиллуулахын тулд reasoning.effort-ыг none болгож тохируулж болно.
Тодорхой заавар өг
Хүссэн яг урт эсвэл хэлбэрээ зааж хүс. Жишээ:
“Яг таван хувилбар жагсаа.”
“50 үгтэй хураангуй бич.”
“100 токеноос илүүгүй. Хэрэв илүү зай хэрэгтэй бол ‘Илүү зай хэрэгтэй.’ гэж хэл.”
Ижил урттай жишээ ашиглах
Таны хүссэн урттай тохирох цөөн оролдлогын жишээнүүд загварт хэв маягийг үргэлжлүүлэхэд тусална.
Зогсоох дарааллыг оновчтой ашиглах
Загвар тусгаарлагч эсвэл дугаарласан жагсаалтын заагт хүрэхэд үүсгэлтийг зогсоохын тулд stop-ыг ашиглана.
{ "stop": ["
###", "6."] }Олон хувилбар
Чат гүйцээлт: n нь нэг дуудалтаар олон гүйцээлт буцаана.
Responses API: n-ийг дэмждэггүй; нэгээс олон гаралт хэрэгтэй бол олон дуудалт хийнэ.
