Com funciona la facturació de l’RFT
El Reinforcement Fine‑Tuning (RFT) et permet optimitzar el rendiment dels models de raonament d’OpenAI mitjançant l’aprenentatge per reforç. A diferència de les nostres opcions d’ajust supervisat o d’ajust segons preferències, que es facturen segons el nombre de segments del conjunt de dades d’entrenament, l’RFT es factura en funció del temps que l’execució d’entrenament dedica a dur a terme el treball principal d’aprenentatge automàtic.
Aquesta guia explica què es considera temps d’entrenament facturable, com gestionem les pauses i les cancel·lacions, i com les teves opcions de configuració poden afectar el cost.
Preus
Càlcul: $100 per hora de temps de rellotge dedicat al bucle principal d’entrenament per a
o4-mini-2025-04-16. Els càrrecs es prorrategen al segon i s’arrodoneixen a dos decimals a la factura (p. ex., 2,55 hores).Ús de l’avaluador model: si utilitzes un model d’OpenAI per «avaluar» sortides durant l’entrenament, els segments consumits per aquestes crides d’avaluació es facturen per separat a les nostres tarifes estàndard de l’API un cop finalitzat l’entrenament.
Només cobrem per la feina d’entrenament que realment actualitza el teu model (el que anomenem «progrés endavant capturat»).
Què facturem
Facturem el temps que el vostre worker d’entrenament passa entrenant activament el vostre model, concretament:
Generar mostres del vostre model durant el procés d’ajust fi (conegudes com a «desplegaments»)
Avaluar aquestes sortides amb un o més avaluadors que heu definit a la tasca (més informació sobre els avaluadors)
Calcular i aplicar actualitzacions dels pesos basades en les qualificacions (retropropagació).
Executar qualsevol pas de validació (avaluació) que hàgiu configurat.
La majoria d’avaluadors es poden executar «gratis», cosa que vol dir que no cobrem cap càrrec addicional pel seu ús més enllà del temps que contribueixen al bucle d’entrenament principal. L’excepció són els avaluadors de model, per als quals també comptabilitzem els segments que consumeixen durant les activitats anteriors. Aquests segments apareixen com una partida independent a la factura. Els segments consumits pels avaluadors de model es facturen a les tarifes normals d’inferència (preus d’OpenAI).
Què NO facturem
No cobrem pel temps dedicat a:
Validar o inspeccionar el teu conjunt de dades abans que comenci l’entrenament.
Comprovacions de seguretat del teu conjunt de dades.
Esperar en cua recursos de càlcul.
Baixar pesos del model o conjunts de dades.
Preparar (renderitzar) el teu conjunt de dades al nostre format d’entrenament.
Avaluacions de seguretat posteriors a l’entrenament del teu model ajustat.
Si es perd feina d’entrenament a causa d’un error per part nostra (per exemple, si un treballador falla i ha de tornar a un punt de control anterior), no se’t cobra ni el temps de càlcul perdut ni els segments dels avaluadors. A la secció següent n’expliquem més detalls.
Progrés endavant capturat i esdeveniments de facturació
L’entrenament consisteix en moltes petites actualitzacions del teu model. Fem un seguiment de quantes d’aquestes actualitzacions es completen correctament. Els càrrecs es basen en el temps de càlcul i els segments dels avaluadors associats a aquestes actualitzacions correctes.
Emetem un càrrec quan es produeix un dels «esdeveniments de facturació» següents:
L’entrenament es completa correctament.
Pares l’entrenament.
Cancel·les l’entrenament.
L’entrenament falla.
Cada càrrec cobreix la feina incremental feta des de l’últim càrrec. Per exemple:
Si poses una execució en pausa, desem un punt de control i et cobrem el temps de càlcul i els segments d’avaluador utilitzats des de l’últim càrrec.
Quan la reprens, l’entrenament continua des del punt de control. El càrrec següent (en completar-se, una altra pausa, cancel·lació o error) només cobrirà la feina addicional feta després de reprendre.
Si cancel·les una execució, et cobrem la feina feta fins a la cancel·lació.
Si l’entrenament falla i la feina feta des de l’últim càrrec es perd, no se’t factura la part perduda.
Aquest enfocament de «progrés endavant capturat» garanteix que només paguis per la feina que es conserva al teu model o que abandones intencionadament.
Consultar el progrés de la tasca
Les tasques RFT tenen un camp anomenat usage_metrics que documenta l’ús total de la tasca fins al pas actual. Això inclou el temps dedicat a l’entrenament i tots els segments utilitzats per tots els avaluadors de model de la tasca. Aquest camp es pot inspeccionar mitjançant l’API (GET /v1/fine_tuning/jobs/{job_id}) o el tauler d’ajust fi.
Factors que influeixen en el temps d’entrenament
Com que la facturació es basa en el temps, les teves opcions de configuració afecten directament el cost. Els factors clau inclouen:
Dificultat del problema: si el teu conjunt de dades consisteix en problemes difícils, és probable que el model dediqui més temps de raonament a cada problema, cosa que augmenta el temps necessari per produir cada mostra.
Intensitat de càlcul: l’hiperparàmetre
compute_multipliercontrola quina quantitat de càlcul fas per pas d’entrenament. Valors més alts animen el model a raonar de manera més extensa sobre cada punt de dades, fet que fa que cada pas s’executi més lentament.Configuració de validació:
Un conjunt de validació més gran augmenta el temps dedicat a l’avaluació.
Augmentar
eval_samples(el nombre de sortides del model avaluades per exemple de validació) augmenta el temps de validació.Executar la validació amb més freqüència (amb un
eval_intervalmés baix) augmenta la proporció de temps dedicada a la validació.
Rendiment dels avaluadors:
Els avaluadors model més grans o més capaços triguen més a retornar una qualificació que els més petits. Per exemple, avaluar amb un model de raonament pot trigar 10 vegades més que fer-ho amb un model no orientat al raonament.
Les funcions d’avaluació en Python complexes triguen més a executar-se que les senzilles.
Aquests paràmetres et permeten equilibrar cost, velocitat i qualitat del model. Per exemple, una validació freqüent pot detectar problemes abans, però augmenta el cost. Avaluar amb un model més avançat pot millorar dràsticament la precisió de l’avaluació, però alentirà cada pas d’avaluació i encarirà les tasques.
Gestió del cost
Per controlar la despesa:
Comença amb execucions més curtes per entendre com la configuració afecta el temps.
Fes servir un nombre raonable d’exemples de validació i
eval_samples. Evita validar més sovint del necessari.Tria el model d’avaluació més petit que compleixi els teus requisits de qualitat.
Mantén eficients els avaluadors personalitzats en Python.
Ajusta
compute_multiplierper equilibrar la velocitat de convergència i el cost.Supervisa l’execució al tauler o mitjançant l’API. Pots posar-la en pausa o cancel·lar-la en qualsevol moment.
Exemples
Execució d’entrenament correcta
| Temps d’entrenament | Temps facturat | Estat | Descripció |
|---|---|---|---|
| 00:00 | 00:00 | – | L’usuari crea una tasca RFT mitjançant l’API |
| 00:10 | 00:00 | VALIDATING_FILES | 10 minuts dedicats a validar el conjunt de dades |
| 00:30 | 00:00 | VALIDATING_FILES | 20 minuts executant comprovacions de seguretat del conjunt de dades |
| 01:00 | 00:00 | QUEUED | 30 minuts esperant un worker disponible |
| 01:30 | 00:00 | RUNNING | 30 minuts configurant l’entrenament (baixada de pesos, preprocessament, etc.) |
| 05:30 | 04:00 | RUNNING | 4 hores dedicades a l’entrenament |
| 06:00 | 04:00 | RUNNING | 30 minuts executant avaluacions de seguretat del model resultant |
| 06:00 | 04:00 | SUCCEEDED | L’entrenament finalitza |
En aquest cas, el temps total transcorregut és de 6 hores, però només 4 hores són facturables. El cost seria de 4 hores × $100/hora = $400.
Exemple de tasca fallida
En aquest exemple, l’execució entrena el model durant 2 hores, escriu un punt de control, entrena 1 hora més, però després falla. Només són facturables les 2 hores d’entrenament fins al punt de control.
| Temps d’entrenament | Temps facturat | Estat | Descripció |
|---|---|---|---|
| 00:00 | 00:00 | – | L’usuari crea una tasca RFT mitjançant l’API |
| 00:10 | 00:00 | VALIDATING_FILES | 10 minuts dedicats a validar el conjunt de dades |
| 00:30 | 00:00 | VALIDATING_FILES | 20 minuts executant comprovacions de seguretat del conjunt de dades |
| 01:00 | 00:00 | QUEUED | 30 minuts esperant un worker disponible |
| 01:30 | 00:00 | RUNNING | 30 minuts configurant l’entrenament (baixada de pesos, preprocessament, etc.) |
| 03:30 | 02:00 | RUNNING | 2 hores dedicades a l’entrenament |
| 03:30 | 02:00 | RUNNING | Punt de control creat al pas 5 |
| 04:30 | 02:00 | RUNNING | L’entrenament falla per un error intern al pas 8 (després d’1 hora més) |
| 04:30 | 02:00 | RUNNING | 30 minuts avaluant i validant el punt de control |
| 04:30 | 02:00 | SUCCEEDED | La tasca finalitza (amb l’últim punt de control) |
Tot i que es van dedicar 3 hores a l’entrenament en total, només 2 hores queden «capturades» en un punt de control utilitzable i es facturen. L’hora de feina d’entrenament perduda a causa de la fallada no és responsabilitat vostra. El cost seria de 2 hores × $100/hora = $200.
Preguntes freqüents
Quan se’m cobra?
Facturem quan l’execució es completa, es posa en pausa, es cancel·la o falla. Cada factura cobreix la feina feta des de la factura anterior.
He de pagar si una execució falla?
Si una execució falla per un error nostre i es perd feina d’entrenament recent, no se us cobra la part perduda. Si cancel·leu una execució, se us cobra la feina feta fins a la cancel·lació.
Com es facturen els segments dels avaluadors de model?
Comptem els segments utilitzats per qualsevol avaluador de model que configureu. Quan acaba l’entrenament, facturem aquests segments a les nostres tarifes estàndard per segment.
Puc posar en pausa i reprendre una execució?
Sí. Quan poseu en pausa, desem un punt de control i cobrem la feina feta fins aquell moment. Quan repreneu, només se us cobrarà la feina addicional feta després de reprendre.
Si teniu altres preguntes sobre la facturació de l’ajust fi per reforç, contacteu amb el nostre equip de suport.
