OpenAI
Для перекладу цієї сторінки виконано машинний переклад. Ви можете переглянути оригінальну статтю англійською.

Керування довжиною відповідей моделей OpenAI

Дізнайтеся, як задавати обмеження виводу для моделей OpenAI за допомогою налаштувань токенів, чітких запитів, прикладів і стоп-послідовностей.

Оновлено: 11 days ago

Огляд

Керувати довжиною відповіді моделі корисно з кількох причин: це допомагає контролювати витрати (адже оплата здійснюється за токен), покращує затримку та продуктивність (коротші відповіді повертаються швидше) і забезпечує релевантність, уникаючи надто довгих або багатослівних відповідей.

Цього можна досягти за допомогою лімітів токенів, налаштувань міркування й докладності, чітких інструкцій, прикладів і послідовностей зупинки. Щоб отримати найактуальніші й найповніші відомості, завжди звертайтеся до офіційного довідника API на platform.openai.com.

Установіть максимальну довжину виводу

API відповідей

Використовується для моделей GPT-5 і більшості моделей серії o: параметр max_output_tokens обмежує кількість токенів, які згенерує модель. У запитах із compaction_trigger або не вказуйте max_output_tokens, або встановіть для нього значення не менше ніж 20000; менші значення відхиляються. API відповідей не підтримує кілька завершень (n).

API завершення чатів

Використовується для застарілих GPT-3.5, GPT-4o, а іноді й для моделей серії o.

  • Для моделей міркування, як-от o3 та o4-mini, використовуйте max_completion_tokens (псевдонім max_tokens)

  • Для ранніх моделей і моделей без міркування параметр max_tokens досі працює

  • Підтримує stop і n (кілька завершень).

Примітка: Налаштування «мінімальна кількість токенів» не існує. Якщо вам потрібна мінімальна довжина, вкажіть це у своєму запиті.

Обмеження токенів за групами моделей

Актуальні обмеження токенів, розміри контексту та ліміти виводу дивіться в документації конкретної моделі.

Короткі приклади

API Responses

{ "model": "gpt-5", "input": "Підсумуйте висновки приблизно у 80 словах.", "max_output_tokens": 120 }

Chat Completions (модель міркування)

{ "model": "o3-mini", "messages": [{"role": "user", "content": "Write five one-line options."}], "max_completion_tokens": 100 }

Спеціальні параметри моделей GPT-5: verbosity і reasoning.effort

Ці параметри доступні лише в моделях GPT-5 (gpt-5.2, gpt-5.2-chat-latest, gpt-5.2 pro тощо). Моделі серії o та застарілі моделі їх не підтримують.

Параметр verbosity приймає значення "low", "medium" (за замовчуванням) або "high". Він впливає на рівень деталізації, але не на жорсткі обмеження.

{ "model": "gpt-5", "input": "Поясніть PageRank на високому рівні.", "text": { "verbosity": "low" }, "max_output_tokens": 200 }

Параметр reasoning.effort визначає кількість токенів міркування, які генеруються перед формуванням відповіді. GPT-5.2 підтримує значення none, low, medium, high і xhigh. gpt-5.2-pro підтримує лише medium, high і xhigh. Раніші моделі міркування підтримують лише low, medium і high.

{ "model": "gpt-5", "input": "Скільки золота знадобилося б, щоб покрити Статую Свободи шаром 1 мм?", "reasoning": { "effort": "minimal" } }

Щоб для чутливих до затримки сценаріїв модель працювала як модель без міркування, установіть для reasoning.effort значення none.

Надавайте конкретні інструкції

Укажіть точну довжину або формат, який вам потрібен. Приклади:

  • «Перелічіть рівно п’ять варіантів».

  • «Напишіть резюме на 50 слів».

  • «Не більше ніж 100 токенів. Якщо потрібно більше, напишіть: „Потрібно більше місця“».

Використовуйте приклади сталої довжини

Приклади з кількома прикладами, що відповідають потрібній довжині, допомагають моделі продовжувати шаблон.

Стратегічно використовуйте стоп-послідовності

Використовуйте stop, щоб зупинити генерування, коли модель досягне роздільника або межі нумерованого списку.

{ "stop": ["
###", "6."] }

Кілька варіантів

  • API завершення чатів: параметр n повертає кілька завершень за один виклик.

  • API відповідей: параметр n не підтримується; якщо потрібен не один результат, зробіть кілька викликів.

Чи була ця стаття корисною?