Visió general
Controlar la longitud de la resposta d’un model és útil per diversos motius: ajuda a gestionar el cost (ja que pagues per segment), millora la latència i el rendiment (les respostes més curtes es retornen més de pressa) i garanteix la rellevància evitant sortides massa llargues o verboses.
Pots aconseguir-ho fent servir límits de segments, paràmetres de raonament i verbositat, instruccions clares, exemples i seqüències d’aturada. Per obtenir els detalls més actuals i complets, consulta sempre la referència oficial de l’API a platform.openai.com.
Defineix una longitud màxima de sortida
API de respostes
S’utilitza per als models GPT-5 i la majoria de models de la sèrie o: fes servir max_output_tokens per limitar el nombre de segments que generarà el model. Per a les sol·licituds compaction_trigger, omet max_output_tokens o estableix-lo com a mínim en 20000; els valors més petits es rebutgen. L’API de respostes no admet diverses complecions (n).
API de complecions de xat
S’utilitza per a GPT-3.5 i GPT-4o heretats, i de vegades per a la sèrie o.
Per a models de raonament com o3 i o4-mini, fes servir
max_completion_tokens(àlies demax_tokens)Per a models anteriors o sense raonament,
max_tokensencara funcionaAdmet
stopin(diverses complecions).
Nota: No hi ha cap configuració de «segments mínims». Si necessites una longitud mínima, especifica-la a la indicació.
Límits de segments per grup de models
Per consultar els límits de segments, les mides de context i els límits de sortida actualitzats, consulta la documentació del model específic.
Exemples ràpids
API de respostes
{ "model": "gpt-5", "input": "Resumeix les conclusions en unes 80 paraules.", "max_output_tokens": 120 }Complecions de xat (model de raonament)
{ "model": "o3-mini", "messages": [{"role": "user", "content": "Write five one-line options."}], "max_completion_tokens": 100 }Controls específics dels models GPT-5: verbosity i reasoning.effort
Aquests controls només estan disponibles als models GPT-5 (gpt-5.2, gpt-5.2-chat-latest, gpt-5.2 pro, etc.). Els models de la sèrie o i els models heretats no els admeten.
`verbosity` accepta "low", "medium" (per defecte) o "high". Influeix en el nivell de detall, però no en els límits estrictes.
{ "model": "gpt-5", "input": "Explica PageRank a grans trets.", "text": { "verbosity": "low" }, "max_output_tokens": 200 }`reasoning.effort` controla quants segments de raonament es generen abans de produir una resposta. GPT-5.2 admet none,low, medium, high,and xhigh. gpt-5.2-pro només admet medium, high,and xhigh. Els models de raonament anteriors només admeten low, medium i high.
{ "model": "gpt-5", "input": "Quant or caldria per recobrir l’Estàtua de la Llibertat amb una capa d’1 mm?", "reasoning": { "effort": "minimal" } }Pots establir `reasoning.effort` en none perquè el model es comporti com un model sense raonament en casos d’ús sensibles a la latència.
Proporciona instruccions específiques
Demana la longitud o la forma exactes que vols. Exemples:
«Llista exactament cinc opcions.»
«Escriu un resum de 50 paraules.»
«No més de 100 segments. Si en necessites més, digues: “Necessito més espai.”»
Fes servir exemples amb una longitud coherent
Els exemples amb pocs exemples que coincideixen amb la longitud desitjada ajuden el model a continuar el patró.
Aplica seqüències d’aturada estratègiques
Fes servir stop per aturar la generació quan el model arribi a un delimitador o al límit d’una llista numerada.
{ "stop": ["
###", "6."] }Diversos candidats
Complecions de xat:
nretorna diverses complecions en una sola crida.API de respostes:
nno s’admet; fes diverses crides si necessites més d’una sortida.
