Як працює тарифікація RFT
Тонке налаштування з підкріпленням (RFT) дає змогу оптимізувати продуктивність моделей міркування OpenAI за допомогою навчання з підкріпленням. На відміну від наших рішень для контрольованого тонкого налаштування або тонкого налаштування за вподобаннями, які тарифікуються за кількістю токенів у навчальному наборі даних, RFT тарифікується на основі часу, протягом якого ваш навчальний запуск виконує основну роботу машинного навчання.
У цьому посібнику пояснюється, що вважається оплачуваним часом навчання, як ми обробляємо паузи й скасування та як ваші параметри конфігурації можуть впливати на вартість.
Ціни
Обчислення: $100 за годину фактичного часу, витраченого в основному циклі навчання для o4-mini-2025-04-16. Плата розраховується пропорційно з точністю до секунди, а в рахунку час округлюється до двох знаків після коми (наприклад, 2,55 години).
Використання моделі-оцінювача: якщо під час навчання ви використовуєте модель OpenAI для «оцінювання» результатів, токени, витрачені на ці виклики, оплачуються окремо за нашими стандартними тарифами API після завершення навчання.
Ми стягуємо плату лише за ту навчальну роботу, яка фактично оновлює вашу модель (ми називаємо це «зафіксованим поступом»).
За що ми стягуємо плату
Ми стягуємо плату за час, протягом якого ваш воркер навчання активно навчає вашу модель, а саме:
Генерування зразків із вашої моделі під час процесу тонкого налаштування (відомих як «rollouts»)
Оцінювання цих результатів за допомогою одного або кількох оцінювачів, визначених вами для завдання (дізнатися більше про оцінювачів)
Обчислення й застосування оновлень ваг на основі оцінок (зворотне поширення помилки).
Виконання будь-яких налаштованих вами кроків валідації (оцінювання).
Більшість оцінювачів є «безкоштовними» для запуску, тобто ми не стягуємо додаткову плату за їх використання поза часом, який вони додають до основного циклу навчання. Виняток становлять оцінювачі на основі моделей: ми також підраховуємо токени, які ці оцінювачі споживають під час зазначених вище дій. Ці токени відображаються в рахунку-фактурі окремою позицією. Токени, спожиті оцінювачами на основі моделей, оплачуються за звичайними тарифами інференсу (ціни OpenAI).
За що ми НЕ стягуємо плату
Ми не стягуємо плату за час, витрачений на:
Валідацію або перевірку вашого набору даних до початку навчання.
Перевірки безпеки вашого набору даних.
Очікування в черзі на обчислювальні ресурси.
Завантаження ваг моделі або наборів даних.
Підготовку (рендеринг) вашого набору даних у наш навчальний формат.
Оцінювання безпеки вашої донавченої моделі після навчання.
Якщо навчальна робота втрачається через помилку з нашого боку (наприклад, якщо воркер аварійно завершує роботу і мусить відкотитися до попередньої контрольної точки), плата за втрачений час обчислень або токени оцінювачів не стягується. Докладніше про це — у наступному розділі.
Зафіксований поступ уперед і події виставлення рахунків
Навчання складається з багатьох невеликих оновлень вашої моделі. Ми відстежуємо, скільки з цих оновлень успішно завершується. Нарахування базуються на часі обчислень і токенах оцінювачів, пов’язаних із цими успішними оновленнями.
Ми виставляємо плату, коли відбувається одна з таких «подій виставлення рахунків»:
Навчання успішно завершено.
Ви ставите навчання на паузу.
Ви скасовуєте навчання.
Навчання завершується помилкою.
Кожне нарахування покриває приріст роботи, виконаної з часу останнього нарахування. Наприклад:
Якщо ви ставите запуск на паузу, ми зберігаємо контрольну точку й нараховуємо плату за час обчислень і токени оцінювачів, використані з часу останнього нарахування.
Коли ви відновлюєте роботу, навчання продовжується з контрольної точки. Наступне нарахування (після завершення, чергової паузи, скасування або помилки) покриватиме лише додаткову роботу, виконану після відновлення.
Якщо ви скасовуєте запуск, ми нараховуємо плату за роботу, виконану до моменту скасування.
Якщо навчання завершується помилкою і робота з часу останнього нарахування втрачається, плата за втрачену частину не стягується.
Такий підхід «зафіксованого поступу уперед» гарантує, що ви платите лише за роботу, яка зберігається у вашій моделі або від якої ви свідомо відмовляєтеся.
Перегляд перебігу завдання
Завдання RFT мають поле usage_metrics, у якому зазначено загальне використання ресурсів завдання до поточного кроку включно. Сюди входять час, витрачений на навчання, і всі токени, використані всіма моделями-оцінювачами в межах завдання. Це поле можна переглянути через API (GET /v1/fine_tuning/jobs/{job_id}) або на панелі тонкого налаштування.
Чинники, що впливають на тривалість навчання
Оскільки плата залежить від часу, вибрані параметри безпосередньо впливають на вартість. Основні чинники:
Складність задач: якщо ваш набір даних складається зі складних задач, модель, імовірно, витрачатиме більше часу на міркування над кожною з них, тому створення кожного зразка триватиме довше.
Інтенсивність обчислень: гіперпараметр compute_multiplier визначає обсяг обчислень на кожному кроці навчання. Вищі значення спонукають модель докладніше міркувати над кожним елементом даних, через що кожен крок виконується повільніше.
Параметри перевірки:
Продуктивність оцінювача:
Більшим або потужнішим моделям-оцінювачам потрібно більше часу, щоб повернути оцінку, ніж меншим. Наприклад, оцінювання за допомогою моделі міркування може тривати в 10 разів довше, ніж за допомогою моделі без міркування.
Складні функції оцінювання на Python виконуються довше, ніж прості.
Ці параметри дають змогу вибрати оптимальне співвідношення вартості, швидкості та якості моделі. Наприклад, часта перевірка допомагає раніше виявляти проблеми, але збільшує вартість. Оцінювання за допомогою досконалішої моделі може суттєво підвищити точність, але сповільнить кожен крок оцінювання та збільшить вартість завдань.
Керування витратами
Щоб контролювати витрати:
Почніть із коротших запусків, щоб зрозуміти, як ваша конфігурація впливає на тривалість.
Використовуйте помірну кількість прикладів для перевірки та eval_samples. Не виконуйте перевірку частіше, ніж потрібно.
Виберіть найменшу модель-оцінювач, яка відповідає вашим вимогам до якості.
Забезпечте ефективність власних оцінювачів на Python.
Налаштуйте compute_multiplier, щоб збалансувати швидкість збіжності та вартість.
Відстежуйте виконання на панелі керування або через API. Виконання можна будь-коли призупинити або скасувати.
Приклади
Успішний запуск навчання
| Час навчання | Оплачуваний час | Статус | Опис |
|---|---|---|---|
| 00:00 | 00:00 | – | Користувач створює завдання RFT через API |
| 00:10 | 00:00 | VALIDATING_FILES | 10 хвилин витрачено на перевірку набору даних |
| 00:30 | 00:00 | VALIDATING_FILES | 20 хвилин виконання перевірок безпеки набору даних |
| 01:00 | 00:00 | QUEUED | 30 хвилин очікування доступного воркера |
| 01:30 | 00:00 | RUNNING | 30 хвилин налаштування навчання (завантаження ваг, попередня обробка тощо) |
| 05:30 | 04:00 | RUNNING | 4 години витрачено на навчання |
| 06:00 | 04:00 | RUNNING | 30 хвилин виконання оцінок безпеки отриманої моделі |
| 06:00 | 04:00 | SUCCEEDED | Навчання завершується |
У цьому випадку загальний фактичний час становить 6 годин, але оплачуються лише 4 години. Вартість становитиме 4 години × $100/годину = $400.
Приклад невдалого завдання
У цьому прикладі запуск навчається 2 години, записує контрольну точку, навчається ще 1 годину, але потім завершується помилкою. Оплачуються лише 2 години навчання до контрольної точки.
| Час навчання | Оплачуваний час | Статус | Опис |
|---|---|---|---|
| 00:00 | 00:00 | – | Користувач створює завдання RFT через API |
| 00:10 | 00:00 | VALIDATING_FILES | 10 хвилин витрачено на перевірку набору даних |
| 00:30 | 00:00 | VALIDATING_FILES | 20 хвилин виконання перевірок безпеки набору даних |
| 01:00 | 00:00 | QUEUED | 30 хвилин очікування доступного воркера |
| 01:30 | 00:00 | RUNNING | 30 хвилин налаштування навчання (завантаження ваг, попередня обробка тощо) |
| 03:30 | 02:00 | RUNNING | 2 години витрачено на навчання |
| 03:30 | 02:00 | RUNNING | Контрольну точку створено на кроці 5 |
| 04:30 | 02:00 | RUNNING | Навчання завершується помилкою через внутрішню помилку на кроці 8 (ще через 1 годину) |
| 04:30 | 02:00 | RUNNING | 30 хвилин оцінювання та перевірки контрольної точки |
| 04:30 | 02:00 | SUCCEEDED | Завдання завершується (з останньою контрольною точкою) |
Хоча загалом на навчання було витрачено 3 години, лише 2 години «зафіксовано» в придатній для використання контрольній точці й виставлено до оплати. Ви не відповідаєте за годину навчальної роботи, втрачену через збій. Вартість становитиме 2 години × $100/годину = $200.
Часті запитання
Коли з мене стягується плата?
Ми виставляємо рахунок, коли виконання завершується, призупиняється, скасовується або закінчується помилкою. Кожен рахунок охоплює роботу, виконану після виставлення попереднього рахунку.
Чи плачу я, якщо запуск завершується помилкою?
Якщо запуск завершується помилкою через нашу помилку й частину нещодавньої навчальної роботи втрачено, ми не стягуємо з вас плату за втрачену частину. Якщо ви скасуєте запуск, з вас стягуватиметься плата за роботу до моменту скасування.
Як оплачуються токени моделей-оцінювачів?
Ми рахуємо токени, використані будь-якими оцінювачами на основі моделей, які ви налаштуєте. Після завершення навчання ми виставляємо рахунок за ці токени за нашими стандартними тарифами за токен.
Чи можу я призупинити та відновити запуск?
Так. Коли ви призупиняєте запуск, ми зберігаємо контрольну точку й стягуємо плату за вже виконану роботу. Коли ви відновлюєте запуск, з вас стягуватиметься плата лише за додаткову роботу, виконану після відновлення.
Якщо у вас є інші запитання щодо виставлення рахунків за Reinforcement Fine‑Tuning, зверніться до нашої служби підтримки.
