Overzicht
De lengte van het antwoord van een model beheren is om verschillende redenen nuttig: het helpt de kosten te beheersen (omdat je per token betaalt), verbetert latentie/prestaties (kortere antwoorden worden sneller teruggegeven) en waarborgt de relevantie door te lange of te uitvoerige output te voorkomen.
Je kunt dit bereiken met tokenlimieten, instellingen voor redenering en uitvoerigheid, duidelijke instructies, voorbeelden en stopsequenties. Raadpleeg voor de meest actuele en volledige informatie altijd de officiële API-referentie op platform.openai.com.
Stel een maximale uitvoerlengte in
Responses-API
Voor GPT-5-modellen en de meeste modellen uit de o-serie: gebruik max_output_tokens om het aantal tokens dat het model genereert te beperken. Laat bij aanvragen met compaction_trigger max_output_tokens weg of stel deze in op minimaal 20000; lagere waarden worden geweigerd. De Responses-API ondersteunt geen meerdere voltooiingen (n).
Chat Completions-API
Wordt gebruikt voor oudere GPT-3.5- en GPT-4o-modellen en soms voor modellen uit de o-serie.
Gebruik voor redenerende modellen zoals o3 en o4-mini max_completion_tokens (alias van max_tokens)
Voor oudere of niet-redenerende modellen werkt max_tokens nog steeds
Ondersteunt stop en n (meerdere voltooiingen).
Opmerking: Er is geen instelling voor ‘minimale tokens’. Als je een minimumlengte nodig hebt, specificeer die dan in je prompt.
Tokenlimieten per modelgroep
Raadpleeg voor actuele tokenlimieten, contextgroottes en uitvoerlimieten de documentatie voor het specifieke model.
Korte voorbeelden
Responses-API
{ "model": "gpt-5", "input": "Vat de bevindingen samen in ~80 woorden.", "max_output_tokens": 120 }Chat Completions (redenerend model)
{ "model": "o3-mini", "messages": [{"role": "user", "content": "Write five one-line options."}], "max_completion_tokens": 100 }Specifieke instellingen voor GPT-5-modellen: verbosity en reasoning.effort
Deze instellingen zijn alleen beschikbaar voor GPT-5-modellen (gpt-5.2, gpt-5.2-chat-latest, gpt-5.2 pro enz.). Modellen uit de o-serie en oudere modellen ondersteunen deze instellingen niet.
verbosity accepteert "low", "medium" (standaard) of "high". Dit beïnvloedt het detailniveau, maar niet de harde limieten.
{ "model": "gpt-5", "input": "Leg PageRank op hoofdlijnen uit.", "text": { "verbosity": "low" }, "max_output_tokens": 200 }reasoning.effort bepaalt hoeveel redeneringstokens worden gegenereerd voordat een antwoord wordt geproduceerd. GPT-5.2 ondersteunt none, low, medium, high en xhigh. gpt-5.2-pro ondersteunt alleen medium, high en xhigh. Eerdere redenerende modellen ondersteunen alleen low, medium en high.
{ "model": "gpt-5", "input": "Hoeveel goud zou er nodig zijn om het Vrijheidsbeeld met een laag van 1 mm te bedekken?", "reasoning": { "effort": "minimal" } }U kunt reasoning.effort instellen op none, zodat het model zich bij toepassingen waarbij lage latentie belangrijk is als een niet-redenerend model gedraagt.
Geef specifieke instructies
Vraag om de exacte lengte of vorm die je wilt. Voorbeelden:
“Noem precies vijf opties.”
“Schrijf een samenvatting van 50 woorden.”
“Niet meer dan 100 tokens. Als je meer nodig hebt, zeg dan: ‘Meer ruimte nodig.’”
Gebruik voorbeelden met een consistente lengte
Few-shot-voorbeelden die overeenkomen met je gewenste lengte helpen het model het patroon voort te zetten.
Stopreeksen strategisch toepassen
Gebruik stop om het genereren te beëindigen wanneer het model een scheidingsteken of een grens in een genummerde lijst bereikt.
{ "stop": ["
###", "6."] }Meerdere kandidaten
Chat Completions: n levert in één aanroep meerdere voltooiingen op.
Responses-API: n wordt niet ondersteund; voer meerdere aanroepen uit als u meer dan één uitvoer nodig hebt.
