Com funciona la facturació de l’RFT
El Reinforcement Fine‑Tuning (RFT) et permet optimitzar el rendiment dels models de raonament d’OpenAI mitjançant l’aprenentatge per reforç. A diferència de les nostres opcions d’ajust supervisat o d’ajust segons preferències, que es facturen segons el nombre de segments del conjunt de dades d’entrenament, l’RFT es factura en funció del temps que l’execució d’entrenament dedica a dur a terme el treball principal d’aprenentatge automàtic.
Aquesta guia explica què es considera temps d’entrenament facturable, com gestionem les pauses i les cancel·lacions, i com les teves opcions de configuració poden afectar el cost.
Preus
Càlcul: 100 $ per hora de temps real dedicada al bucle principal d'entrenament de l'o4-mini-2025-04-16. Els càrrecs es prorrategen per segon i s'arrodoneixen a dos decimals a la factura (p. ex., 2,55 hores).
Ús del model avaluador: si feu servir un model d'OpenAI per "avaluar" resultats durant l'entrenament, els segments consumits per aquestes crides d'avaluació es facturen per separat segons les tarifes estàndard de l'API un cop acabat l'entrenament.
Només cobrem la feina d'entrenament que realment actualitza el model (el que anomenem "progrés efectiu registrat").
Què facturem
Facturem el temps que el vostre worker d’entrenament passa entrenant activament el vostre model, concretament:
Generar mostres del vostre model durant el procés d’ajust fi (conegudes com a «desplegaments»)
Avaluar aquestes sortides amb un o més avaluadors que heu definit a la tasca (més informació sobre els avaluadors)
Calcular i aplicar actualitzacions dels pesos basades en les qualificacions (retropropagació).
Executar qualsevol pas de validació (avaluació) que hàgiu configurat.
La majoria d’avaluadors es poden executar «gratis», cosa que vol dir que no cobrem cap càrrec addicional pel seu ús més enllà del temps que contribueixen al bucle d’entrenament principal. L’excepció són els avaluadors de model, per als quals també comptabilitzem els segments que consumeixen durant les activitats anteriors. Aquests segments apareixen com una partida independent a la factura. Els segments consumits pels avaluadors de model es facturen a les tarifes normals d’inferència (preus d’OpenAI).
Què NO facturem
No cobrem pel temps dedicat a:
Validar o inspeccionar el teu conjunt de dades abans que comenci l’entrenament.
Comprovacions de seguretat del teu conjunt de dades.
Esperar en cua recursos de càlcul.
Baixar pesos del model o conjunts de dades.
Preparar (renderitzar) el teu conjunt de dades al nostre format d’entrenament.
Avaluacions de seguretat posteriors a l’entrenament del teu model ajustat.
Si es perd feina d’entrenament a causa d’un error per part nostra (per exemple, si un treballador falla i ha de tornar a un punt de control anterior), no se’t cobra ni el temps de càlcul perdut ni els segments dels avaluadors. A la secció següent n’expliquem més detalls.
Progrés endavant capturat i esdeveniments de facturació
L’entrenament consisteix en moltes petites actualitzacions del teu model. Fem un seguiment de quantes d’aquestes actualitzacions es completen correctament. Els càrrecs es basen en el temps de càlcul i els segments dels avaluadors associats a aquestes actualitzacions correctes.
Emetem un càrrec quan es produeix un dels «esdeveniments de facturació» següents:
L’entrenament es completa correctament.
Pares l’entrenament.
Cancel·les l’entrenament.
L’entrenament falla.
Cada càrrec cobreix la feina incremental feta des de l’últim càrrec. Per exemple:
Si poses una execució en pausa, desem un punt de control i et cobrem el temps de càlcul i els segments d’avaluador utilitzats des de l’últim càrrec.
Quan la reprens, l’entrenament continua des del punt de control. El càrrec següent (en completar-se, una altra pausa, cancel·lació o error) només cobrirà la feina addicional feta després de reprendre.
Si cancel·les una execució, et cobrem la feina feta fins a la cancel·lació.
Si l’entrenament falla i la feina feta des de l’últim càrrec es perd, no se’t factura la part perduda.
Aquest enfocament de «progrés endavant capturat» garanteix que només paguis per la feina que es conserva al teu model o que abandones intencionadament.
Consulta del progrés de la tasca
Les tasques d'RFT tenen un camp anomenat usage_metrics que documenta l'ús total de la tasca fins al pas actual. Això inclou el temps dedicat a l'entrenament i tots els segments utilitzats per tots els models avaluadors de la tasca. Aquest camp es pot consultar mitjançant l'API (GET /v1/fine_tuning/jobs/{job_id}) o el tauler d'ajustament fi.
Factors que influeixen en el temps d'entrenament
Com que la facturació es basa en el temps, les opcions de configuració afecten directament el cost. Els factors principals són:
Dificultat dels problemes: si el conjunt de dades conté problemes difícils, és probable que el model dediqui més temps a raonar sobre cadascun, cosa que augmenta el temps necessari per generar cada mostra.
Intensitat de càlcul: l'hiperparàmetre compute_multiplier controla la quantitat de càlcul que es fa en cada pas d'entrenament. Els valors més alts afavoreixen que el model raoni de manera més detallada sobre cada dada, cosa que alenteix cada pas.
Configuració de validació:
Rendiment dels avaluadors:
Els models avaluadors més grans o potents triguen més a retornar una puntuació que els més petits. Per exemple, avaluar amb un model de raonament pot trigar deu vegades més que fer-ho amb un model que no sigui de raonament.
Les funcions d'avaluació complexes en Python triguen més a executar-se que les senzilles.
Aquesta configuració permet equilibrar el cost, la velocitat i la qualitat del model. Per exemple, una validació freqüent pot detectar abans els problemes, però augmenta el cost. L'avaluació amb un model més avançat pot millorar dràsticament la precisió, però alenteix cada pas d'avaluació i encareix les tasques.
Gestió del cost
Per controlar la despesa:
Comenceu amb execucions més curtes per entendre com afecta la configuració al temps.
Feu servir un nombre raonable d'exemples de validació i d'eval_samples. No valideu més sovint del necessari.
Trieu el model avaluador més petit que compleixi els requisits de qualitat.
Manteniu eficients els avaluadors personalitzats en Python.
Ajusteu compute_multiplier per equilibrar la velocitat de convergència i el cost.
Superviseu l'execució des del tauler o mitjançant l'API. Podeu posar-la en pausa o cancel·lar-la en qualsevol moment.
Exemples
Execució d’entrenament correcta
| Temps d’entrenament | Temps facturat | Estat | Descripció |
|---|---|---|---|
| 00:00 | 00:00 | – | L’usuari crea una tasca RFT mitjançant l’API |
| 00:10 | 00:00 | VALIDATING_FILES | 10 minuts dedicats a validar el conjunt de dades |
| 00:30 | 00:00 | VALIDATING_FILES | 20 minuts executant comprovacions de seguretat del conjunt de dades |
| 01:00 | 00:00 | QUEUED | 30 minuts esperant un worker disponible |
| 01:30 | 00:00 | RUNNING | 30 minuts configurant l’entrenament (baixada de pesos, preprocessament, etc.) |
| 05:30 | 04:00 | RUNNING | 4 hores dedicades a l’entrenament |
| 06:00 | 04:00 | RUNNING | 30 minuts executant avaluacions de seguretat del model resultant |
| 06:00 | 04:00 | SUCCEEDED | L’entrenament finalitza |
En aquest cas, el temps total transcorregut és de 6 hores, però només 4 hores són facturables. El cost seria de 4 hores × $100/hora = $400.
Exemple de tasca fallida
En aquest exemple, l’execució entrena el model durant 2 hores, escriu un punt de control, entrena 1 hora més, però després falla. Només són facturables les 2 hores d’entrenament fins al punt de control.
| Temps d’entrenament | Temps facturat | Estat | Descripció |
|---|---|---|---|
| 00:00 | 00:00 | – | L’usuari crea una tasca RFT mitjançant l’API |
| 00:10 | 00:00 | VALIDATING_FILES | 10 minuts dedicats a validar el conjunt de dades |
| 00:30 | 00:00 | VALIDATING_FILES | 20 minuts executant comprovacions de seguretat del conjunt de dades |
| 01:00 | 00:00 | QUEUED | 30 minuts esperant un worker disponible |
| 01:30 | 00:00 | RUNNING | 30 minuts configurant l’entrenament (baixada de pesos, preprocessament, etc.) |
| 03:30 | 02:00 | RUNNING | 2 hores dedicades a l’entrenament |
| 03:30 | 02:00 | RUNNING | Punt de control creat al pas 5 |
| 04:30 | 02:00 | RUNNING | L’entrenament falla per un error intern al pas 8 (després d’1 hora més) |
| 04:30 | 02:00 | RUNNING | 30 minuts avaluant i validant el punt de control |
| 04:30 | 02:00 | SUCCEEDED | La tasca finalitza (amb l’últim punt de control) |
Tot i que es van dedicar 3 hores a l’entrenament en total, només 2 hores queden «capturades» en un punt de control utilitzable i es facturen. L’hora de feina d’entrenament perduda a causa de la fallada no és responsabilitat vostra. El cost seria de 2 hores × $100/hora = $200.
Preguntes freqüents
Quan se'm cobra?
Facturem quan l'execució acaba, es posa en pausa, es cancel·la o falla. Cada factura cobreix la feina feta des de l'anterior.
He de pagar si una execució falla?
Si una execució falla per un error nostre i es perd feina d’entrenament recent, no se us cobra la part perduda. Si cancel·leu una execució, se us cobra la feina feta fins a la cancel·lació.
Com es facturen els segments dels avaluadors de model?
Comptem els segments utilitzats per qualsevol avaluador de model que configureu. Quan acaba l’entrenament, facturem aquests segments a les nostres tarifes estàndard per segment.
Puc posar en pausa i reprendre una execució?
Sí. Quan poseu en pausa, desem un punt de control i cobrem la feina feta fins aquell moment. Quan repreneu, només se us cobrarà la feina addicional feta després de reprendre.
Si teniu altres preguntes sobre la facturació de l’ajust fi per reforç, contacteu amb el nostre equip de suport.
