OpenAI
Оваа страница беше машински преведена. Погледнете ја оригиналната статија на англиски јазик.

Водич за наплата за API за Reinforcement Fine-Tuning

Како функционира наплатата за RFT API

Ажурирано: 15 days ago

Како функционира наплатата за RFT

Финото подесување со зајакнување (RFT) ви овозможува да ги оптимизирате перформансите на моделите со расудување на OpenAI преку зајакнување на учењето. За разлика од нашите понуди за надгледувано или преференцијално фино подесување, кои се наплатуваат според бројот на токени во збирката податоци за обука, RFT се наплатува врз основа на времето што вашето извршување на обуката го поминува извршувајќи ја суштинската работа на машинското учење.

Овој водич објаснува што се смета за наплатливо време за обука, како постапуваме со паузи и откажувања и како вашите избори за конфигурација можат да влијаат врз цената.

Цени

  • Пресметување: 100 $ за секој час реално време поминат во главниот циклус на обука за o4-mini-2025-04-16. Трошоците се пресметуваат пропорционално до секунда, а на фактурата се заокружуваат на две децимални места (на пр., 2,55 часа).

  • Употреба на модел за оценување: ако користите модел на OpenAI за да ги „оценувате“ резултатите за време на обуката, токените потрошени за тие повици за оценување се наплаќаат одделно по нашите стандардни цени за API откако ќе заврши обуката.

Наплаќаме само за обуката што навистина го ажурира вашиот модел (што го нарекуваме „остварен напредок“).

Што наплаќаме

Наплаќаме за времето што вашиот работник за тренирање го поминува активно тренирајќи го вашиот модел, конкретно:

  • Генерирање примероци од вашиот модел за време на процесот на фино подесување (познато како „ролаути“)

  • Оценување на тие излези со еден или повеќе оценувачи што сте ги дефинирале во задачата (дознајте повеќе за оценувачите)

  • Пресметување и примена на ажурирања на тежините врз основа на оценките (обратно пропагирање).

  • Извршување на сите чекори за валидација (евалуација) што сте ги конфигурирале.

Повеќето оценувачи се „бесплатни“ за извршување, што значи дека не наплаќаме дополнително за нивната употреба надвор од времето што го додаваат во основната јамка за тренирање. Исклучок од ова се моделските оценувачи, каде што ги пресметуваме и токените што тие оценувачи ги трошат за време на горенаведените активности. Овие токени се појавуваат како посебна ставка на вашата фактура. Токените што ги трошат моделските оценувачи се наплаќаат според нормалните тарифи за инференција (цени на OpenAI).

Што НЕ наплатуваме

Не наплатуваме за време потрошено на:

  • Валидација или проверка на вашата збирка на податоци пред почетокот на обуката.

  • Безбедносни проверки на вашата збирка на податоци.

  • Чекање во редица за пресметковни ресурси.

  • Преземање на тежини на моделот или збирки на податоци.

  • Подготовка (рендерирање) на вашата збирка на податоци во нашиот формат за обука.

  • Безбедносни евалуации по обуката на вашиот фино прилагоден модел.

Ако работата од обуката се изгуби поради грешка од наша страна (на пример, ако worker се сруши и мора да се врати на претходен checkpoint), не ви се наплатува изгубеното време за пресметка или токените на оценувачите. Повеќе детали за ова во следниот дел.

Зачуван напредок и настани за наплата

Обуката се состои од многу мали ажурирања на вашиот модел. Следиме колку од овие ажурирања успешно завршуваат. Наплатата се заснова на времето за пресметка и токените на оценувачите поврзани со овие успешни ажурирања.

Издаваме наплата кога ќе се случи еден од следните „настани за наплата“:

  • Обуката успешно завршува.

  • Ја паузирате обуката.

  • Ја откажувате обуката.

  • Обуката не успева.

Секоја наплата ја покрива дополнителната работа извршена од последната наплата. На пример:

  • Ако паузирате извршување, зачувуваме checkpoint и ви наплатуваме за времето за пресметка и токените на оценувачите искористени од последната наплата.

  • Кога ќе продолжите, обуката продолжува од checkpoint. Следната наплата (при завршување, нова пауза, откажување или неуспех) ќе ја покрие само дополнителната работа извршена по продолжувањето.

  • Ако откажете извршување, ви наплатуваме за работата извршена до моментот на откажување.

  • Ако обуката не успее и работата од последната наплата се изгуби, не ви се наплатува изгубениот дел.

Овој пристап на „зачуван напредок“ осигурува дека плаќате само за работа што е задржана во вашиот модел или што намерно сте ја напуштиле.

Следење на напредокот на задачата

Задачите за RFT имаат поле наречено usage_metrics, во кое е евидентирана вкупната употреба на задачата до тековниот чекор. Тоа ги опфаќа времето потрошено за обука и сите токени искористени од сите модели за оценување во задачата. Ова поле може да се провери преку API (GET /v1/fine_tuning/jobs/{job_id}) или преку контролната табла за фино приспособување.

Фактори што влијаат врз времето за обука

Бидејќи наплатата се пресметува според времето, изборот на конфигурацијата директно влијае врз трошоците. Клучните фактори се:

  • Тежина на проблемите: ако вашата збирка податоци содржи тешки проблеми, моделот веројатно ќе троши повеќе време на расудување за секој проблем, поради што ќе биде потребно повеќе време за создавање на секој примерок.

  • Интензитет на пресметување: хиперпараметарот compute_multiplier одредува колку пресметки се вршат во секој чекор од обуката. Повисоките вредности го поттикнуваат моделот да расудува поопширно за секоја податочна точка, поради што секој чекор се извршува побавно.

  • Поставки за валидација:

  • Перформанси на оценувачот:

  • На поголемите или поспособните модели за оценување им треба повеќе време да вратат оценка отколку на помалите. На пример, оценувањето со модел со расудување може да трае 10 пати подолго отколку со модел без расудување.

  • На сложените функции за оценување во Python им треба повеќе време за извршување отколку на едноставните.

Овие поставки ви овозможуваат да воспоставите рамнотежа меѓу трошоците, брзината и квалитетот на моделот. На пример, честата валидација може порано да ги открие проблемите, но ги зголемува трошоците. Оценувањето со понапреден модел може значително да ја подобри точноста, но ќе го забави секој чекор на оценување и ќе ги направи задачите поскапи.

Управување со трошоците

За да ги контролирате трошоците:

  • Започнете со пократки извршувања за да разберете како вашата конфигурација влијае врз времето.

  • Користете разумен број примери за валидација и eval_samples. Не вршете валидација почесто отколку што е потребно.

  • Изберете го најмалиот модел за оценување што ги исполнува вашите барања за квалитет.

  • Одржувајте ги ефикасни приспособените оценувачи во Python.

  • Приспособете го compute_multiplier за да ги урамнотежите брзината на конвергенција и трошоците.

  • Следете го извршувањето преку контролната табла или API. Може да го паузирате или откажете во секое време.

Примери

Успешно извршување на тренирање

Време на тренирањеНаплатено времеСтатусОпис
00:0000:00Корисник создава RFT задача преку API
00:1000:00VALIDATING_FILES10 минути поминати во валидација на збирката податоци
00:3000:00VALIDATING_FILES20 минути извршување безбедносни проверки на збирката податоци
01:0000:00QUEUED30 минути чекање достапен работник
01:3000:00RUNNING30 минути поставување на тренирањето (преземање тежини, претпроцесирање итн.)
05:3004:00RUNNING4 часа поминати во тренирање
06:0004:00RUNNING30 минути извршување безбедносни евалуации на добиениот модел
06:0004:00SUCCEEDEDТренирањето завршува

Во овој случај, вкупното време според часовникот е 6 часа, но се наплаќаат само 4 часа. Трошокот би бил 4 часа × $100/час = $400.

Пример за неуспешна задача

Во овој пример, извршувањето тренира 2 часа, запишува контролна точка, тренира уште 1 час, но потоа не успева. Се наплаќаат само 2 часа тренирање до контролната точка.

Време на тренирањеНаплатено времеСтатусОпис
00:0000:00Корисник создава RFT задача преку API
00:1000:00VALIDATING_FILES10 минути поминати во валидација на збирката податоци
00:3000:00VALIDATING_FILES20 минути извршување безбедносни проверки на збирката податоци
01:0000:00QUEUED30 минути чекање достапен работник
01:3000:00RUNNING30 минути поставување на тренирањето (преземање тежини, претпроцесирање итн.)
03:3002:00RUNNING2 часа поминати во тренирање
03:3002:00RUNNINGСоздадена контролна точка на чекор 5
04:3002:00RUNNINGТренирањето не успева поради внатрешна грешка на чекор 8 (по уште 1 час)
04:3002:00RUNNING30 минути евалуација и валидација на контролната точка
04:3002:00SUCCEEDEDЗадачата завршува (со најновата контролна точка)

Иако вкупно беа потрошени 3 часа за тренирање, само 2 часа се „фатени“ во употреблива контролна точка и се наплаќаат. Часот работа на тренирање изгубен поради неуспехот не е ваша одговорност. Трошокот би бил 2 часа × $100/час = $200.

Често поставувани прашања

Кога ми се наплаќа?

Наплаќаме кога извршувањето ќе заврши, ќе се паузира, ќе се откаже или ќе биде неуспешно. Секоја наплата ја опфаќа работата извршена по претходната наплата.

Дали плаќам ако извршувањето не успее?

Ако извршувањето не успее поради наша грешка и се изгуби неодамнешна работа на тренирање, не ви се наплаќа изгубениот дел. Ако откажете извршување, ви се наплаќа работата до откажувањето.

Како се наплаќаат токените на моделските оценувачи?

Ги броиме токените што ги користат сите моделски оценувачи што ги конфигурирате. Откако ќе заврши тренирањето, ги наплаќаме тие токени според нашите стандардни тарифи по токен.

Може ли да паузирам и продолжам извршување?

Да. Кога паузирате, зачувуваме контролна точка и наплаќаме за работата извршена дотогаш. Кога продолжувате, ќе ви се наплати само дополнителната работа извршена по продолжувањето.

Ако имате други прашања за наплатата за Reinforcement Fine‑Tuning, контактирајте го нашиот тим за поддршка.

Дали оваа статија ви беше корисна?