OpenAI
Den här sidan har maskinöversatts. Visa den ursprungliga engelska artikeln.

Styra längden på svar från OpenAI-modeller

Lär dig ange utdatagränser för OpenAI-modeller med tokeninställningar, tydliga prompter, exempel och stoppsekvenser.

Uppdaterades: 7 days ago

Översikt

Att styra längden på en modells svar är användbart av flera skäl: det hjälper dig att hantera kostnader (eftersom du betalar per token), förbättrar latens/prestanda (kortare svar returneras snabbare) och säkerställer relevans genom att undvika alltför långa eller ordrika utdata.

Du kan göra detta med tokengränser, inställningar för resonemang och detaljnivå, tydliga instruktioner, exempel och stoppsekvenser. Den mest aktuella och fullständiga informationen finns alltid i den officiella API-referensen på platform.openai.com.

Ange en maximal utdatalängd

Responses API

Används för GPT-5-modeller och de flesta modeller i o-serien: använd max_output_tokens för att begränsa antalet token som modellen genererar. För begäranden med compaction_trigger ska du antingen utelämna max_output_tokens eller ange minst 20000; lägre värden avvisas. Responses API stöder inte flera slutföranden (n).

API för slutförda chattar.

Används för äldre GPT-3.5, GPT-4o och ibland modeller i o-serien.

  • För resonemangsmodeller som o3 och o4-mini använder du max_completion_tokens (alias för max_tokens)

  • För äldre modeller och modeller utan resonemang fungerar max_tokens fortfarande

  • Stöder stop och n (flera slutföranden).

Obs! Det finns ingen inställning för ”minsta antal token”. Om du behöver en minimilängd anger du den i din prompt.

Tokengränser per modellgrupp

Aktuella tokengränser, kontextstorlekar och utdatagränser finns i dokumentationen för den specifika modellen.

Snabba exempel

Responses API

{ "model": "gpt-5", "input": "Sammanfatta resultaten med ~80 ord.", "max_output_tokens": 120 }

Chat Completions (resonemangsmodell)

{ "model": "o3-mini", "messages": [{"role": "user", "content": "Write five one-line options."}], "max_completion_tokens": 100 }

Särskilda inställningar för GPT-5-modeller: verbosity och reasoning.effort

De här inställningarna är endast tillgängliga för GPT-5-modeller (gpt-5.2, gpt-5.2-chat-latest, gpt-5.2 pro osv.). Modeller i o-serien och äldre modeller stöder dem inte.


verbosity kan vara "low", "medium" (standard) eller "high". Det påverkar detaljnivån, men inte fasta gränser.

{ "model": "gpt-5", "input": "Förklara PageRank på en övergripande nivå.", "text": { "verbosity": "low" }, "max_output_tokens": 200 }

reasoning.effort styr hur många resonemangstoken som genereras innan ett svar skapas. GPT-5.2 stöder none, low, medium, high och xhigh. gpt-5.2-pro stöder endast medium, high och xhigh. Tidigare resonemangsmodeller stöder endast low, medium och high.

{ "model": "gpt-5", "input": "Hur mycket guld skulle krävas för att täcka Frihetsgudinnan med ett 1 mm tjockt lager?", "reasoning": { "effort": "minimal" } }

Du kan ange none för reasoning.effort så att modellen fungerar som en modell utan resonemang i latenskänsliga användningsfall.

Ge specifika instruktioner

Be om exakt längd eller önskat format. Exempel:

  • ”Lista exakt fem alternativ.”

  • ”Skriv en sammanfattning på 50 ord.”

  • ”Högst 100 token. Om du behöver mer, skriv ’Behöver mer utrymme.’”

Använd exempel med konsekvent längd

Few-shot-exempel som matchar önskad längd hjälper modellen att fortsätta mönstret.

Använd stoppsekvenser strategiskt

Använd stop för att avbryta genereringen när modellen når en avgränsare eller slutet på en numrerad lista.

{ "stop": ["\n###", "6."] }

Flera kandidater

  • Slutförda chattar: n returnerar flera slutföranden i ett enda anrop.

  • Responses API: n stöds inte. Gör flera anrop om du behöver mer än ett resultat.

Var den här artikeln till hjälp?