OpenAI
Tämä sivu on konekäännetty. Katso alkuperäinen englanninkielinen artikkeli.

OpenAI-mallien vastausten pituuden hallinta

Lue, miten OpenAI-mallien tulosteen rajoja asetetaan token-asetuksilla, selkeillä kehotteilla, esimerkeillä ja pysäytyssekvensseillä.

Päivitetty: 3 days ago

Yleiskatsaus

Mallin vastauksen pituuden hallinta on hyödyllistä useista syistä: se auttaa hallitsemaan kustannuksia (koska maksat tokenien mukaan), parantaa viivettä ja suorituskykyä (lyhyemmät vastaukset palautuvat nopeammin) ja varmistaa osuvuuden välttämällä liian pitkiä tai laveita tulosteita.

Voit tehdä tämän tokenirajoilla, päättely- ja laveusasetuksilla, selkeillä ohjeilla, esimerkeillä ja pysäytyssekvensseillä. Ajantasaisimmat ja kattavimmat tiedot ovat aina virallisessa API-viitteessä osoitteessa platform.openai.com.

Aseta tulosteen enimmäispituus

Responses API

Käytetään GPT-5-malleissa ja useimmissa o-sarjan malleissa: rajoita mallin tuottamien tokenien määrää max_output_tokens-parametrilla. Kun käytät compaction_trigger-pyyntöjä, jätä max_output_tokens pois tai aseta sen arvoksi vähintään 20000. Pienemmät arvot hylätään. Responses API ei tue useita täydennyksiä (n).

Keskustelun täydennys-API

Käytetään vanhoissa GPT-3.5- ja GPT-4o-malleissa sekä joskus o-sarjan malleissa.

  • Käytä o3:n ja o4-minin kaltaisissa päättelymalleissa max_completion_tokens-parametria (max_tokens-parametrin alias)

  • Aiemmissa malleissa ja muissa kuin päättelymalleissa max_tokens toimii edelleen

  • Tukee stop- ja n-parametreja (useita täydennyksiä).

Huomautus: Asetusta ”vähimmäistokeneita” ei ole. Jos tarvitset vähimmäispituuden, määritä se kehotteessasi.

Tokenirajat malliryhmittäin

Ajantasaiset tokenirajat, kontekstikoot ja tulosteen enimmäismäärät löytyvät tietyn mallin dokumentaatiosta.

Pikaesimerkkejä

Responses API

{ "model": "gpt-5", "input": "Tiivistä havainnot noin 80 sanaan.", "max_output_tokens": 120 }

Keskustelun täydennykset (päättelymalli)

{ "model": "o3-mini", "messages": [{"role": "user", "content": "Write five one-line options."}], "max_completion_tokens": 100 }

GPT-5-mallien omat asetukset: verbosity ja reasoning.effort

Nämä asetukset ovat käytettävissä vain GPT-5-malleissa (gpt-5.2, gpt-5.2-chat-latest, gpt-5.2 pro jne.). O-sarjan ja vanhat mallit eivät tue niitä.


verbosity-arvoksi hyväksytään "low", "medium" (oletus) tai "high". Se vaikuttaa yksityiskohtaisuuteen mutta ei kiinteisiin rajoituksiin.

{ "model": "gpt-5", "input": "Selitä PageRank yleisellä tasolla.", "text": { "verbosity": "low" }, "max_output_tokens": 200 }

reasoning.effort määrittää, kuinka monta päättelytokenia luodaan ennen vastauksen tuottamista. GPT-5.2 tukee arvoja none, low, medium, high ja xhigh. gpt-5.2-pro tukee vain arvoja medium, high ja xhigh. Aiemmat päättelymallit tukevat vain arvoja low, medium ja high.

{ "model": "gpt-5", "input": "Kuinka paljon kultaa tarvittaisiin Vapaudenpatsaan päällystämiseen 1 mm:n kerroksella?", "reasoning": { "effort": "minimal" } }

Voit asettaa reasoning.effort-arvoksi none, jolloin malli toimii päättelyä käyttämättömän mallin tavoin viiveherkissä käyttötapauksissa.

Anna tarkat ohjeet

Pyydä täsmälleen haluamaasi pituutta tai muotoa. Esimerkkejä:

  • ”Luettele täsmälleen viisi vaihtoehtoa.”

  • ”Kirjoita 50 sanan yhteenveto.”

  • ”Enintään 100 tokenia. Jos tarvitset lisää, sano ’Tarvitsen lisää tilaa.’”

Käytä yhdenmukaisen pituisia esimerkkejä

Haluttua pituutta vastaavat muutamalla esimerkillä opettavat esimerkit auttavat mallia jatkamaan kaavaa.

Käytä pysäytysjaksoja harkitusti

Käytä stop-parametria, jotta generointi pysähtyy mallin saavuttaessa erottimen tai numeroidun luettelon rajan.

{ "stop": ["
###", "6."] }

Useita ehdokkaita

  • Keskustelun täydennykset: n palauttaa yhdellä kutsulla useita täydennyksiä.

  • Responses API: n-parametria ei tueta. Tee useita kutsuja, jos tarvitset useamman kuin yhden tulosteen.

Oliko tästä artikkelista apua?