Oversigt
Det er nyttigt at styre længden af en models svar af flere grunde: Det hjælper med at styre omkostninger (da du betaler pr. token), forbedrer latenstid/ydeevne (kortere svar returneres hurtigere) og sikrer relevans ved at undgå alt for lange eller ordrige output.
Det kan du opnå med tokengrænser, indstillinger for ræsonnering og detaljeringsgrad, klare instruktioner, eksempler og stopsekvenser. For de nyeste og mest komplette oplysninger skal du altid se den officielle API-reference på platform.openai.com.
Angiv en maksimal outputlængde
Responses API
Bruges til GPT-5-modeller og de fleste modeller i o-serien: Brug max_output_tokens til at begrænse antallet af tokens, som modellen genererer. Ved anmodninger med compaction_trigger skal du enten udelade max_output_tokens eller angive værdien til mindst 20000. Lavere værdier afvises. Responses API understøtter ikke flere fuldførelser (n).
Chat Completions API
Bruges til ældre GPT-3.5- og GPT-4o-modeller og undertiden modeller i o-serien.
Til ræsonneringsmodeller som o3 og o4-mini skal du bruge max_completion_tokens (alias for max_tokens)
Til tidligere modeller og modeller uden ræsonnering fungerer max_tokens stadig
Understøtter stop og n (flere fuldførelser).
Bemærk: Der findes ingen indstilling for “minimum tokens”. Hvis du har brug for en minimumslængde, skal du angive det i din prompt.
Tokengrænser efter modelgruppe
For opdaterede tokengrænser, kontekststørrelser og outputgrænser henvises der til dokumentationen for den specifikke model.
Hurtige eksempler
Responses API
{ "model": "gpt-5", "input": "Opsummer resultaterne på ~80 ord.", "max_output_tokens": 120 }Chat Completions (ræsonneringsmodel)
{ "model": "o3-mini", "messages": [{"role": "user", "content": "Write five one-line options."}], "max_completion_tokens": 100 }GPT-5-modelspecifikke indstillinger: verbosity og reasoning.effort
Disse indstillinger er kun tilgængelige på GPT-5-modeller (gpt-5.2, gpt-5.2-chat-latest, gpt-5.2 pro osv.). Modeller i o-serien og ældre modeller understøtter dem ikke.
verbosity kan være "low", "medium" (standard) eller "high". Det påvirker detaljeringsgraden, men ikke faste grænser.
{ "model": "gpt-5", "input": "Forklar PageRank på et overordnet niveau.", "text": { "verbosity": "low" }, "max_output_tokens": 200 }reasoning.effort styrer, hvor mange ræsonneringstokens der genereres, før der produceres et svar. GPT-5.2 understøtter none, low, medium, high og xhigh. gpt-5.2-pro understøtter kun medium, high og xhigh. Tidligere ræsonneringsmodeller understøtter kun low, medium og high.
{ "model": "gpt-5", "input": "Hvor meget guld skulle der til for at belægge Frihedsgudinden med et lag på 1 mm?", "reasoning": { "effort": "minimal" } }Du kan indstille reasoning.effort til none, så modellen opfører sig som en model uden ræsonnering i anvendelser, hvor latenstid er afgørende.
Giv specifikke instruktioner
Bed om den præcise længde eller form, du ønsker. Eksempler:
»Angiv præcis fem muligheder.«
»Skriv et resumé på 50 ord.«
»Ikke mere end 100 tokens. Hvis du har brug for mere, så skriv ‘Har brug for mere plads.’«
Brug eksempler med ensartet længde
Eksempler med få eksempler, der matcher din ønskede længde, hjælper modellen med at fortsætte mønsteret.
Brug stopsekvenser strategisk
Brug stop til at standse genereringen, når modellen når en afgrænser eller grænsen for en nummereret liste.
{ "stop": ["
###", "6."] }Flere kandidater
Chat Completions: n returnerer flere fuldførelser i ét kald.
Responses API: n understøttes ikke. Foretag flere kald, hvis du har brug for mere end ét output.
