OpenAI
Aquesta pàgina s'ha traduït automàticament. Mostra l'article original en anglès.

Guia de facturació de l’API d’ajust fi per reforç

Com funciona la facturació de l’API d’RFT

Actualització: yesterday

Com funciona la facturació de l’RFT

El Reinforcement Fine‑Tuning (RFT) et permet optimitzar el rendiment dels models de raonament d’OpenAI mitjançant l’aprenentatge per reforç. A diferència de les nostres opcions d’ajust supervisat o d’ajust segons preferències, que es facturen segons el nombre de segments del conjunt de dades d’entrenament, l’RFT es factura en funció del temps que l’execució d’entrenament dedica a dur a terme el treball principal d’aprenentatge automàtic.

Aquesta guia explica què es considera temps d’entrenament facturable, com gestionem les pauses i les cancel·lacions, i com les teves opcions de configuració poden afectar el cost.

Preus

  • Càlcul: $100 per hora de temps de rellotge dedicat al bucle principal d’entrenament per a o4-mini-2025-04-16. Els càrrecs es prorrategen al segon i s’arrodoneixen a dos decimals a la factura (p. ex., 2,55 hores).

  • Ús de l’avaluador model: si utilitzes un model d’OpenAI per «avaluar» sortides durant l’entrenament, els segments consumits per aquestes crides d’avaluació es facturen per separat a les nostres tarifes estàndard de l’API un cop finalitzat l’entrenament.

Només cobrem per la feina d’entrenament que realment actualitza el teu model (el que anomenem «progrés endavant capturat»).

Què facturem

Facturem el temps que el vostre worker d’entrenament passa entrenant activament el vostre model, concretament:

  • Generar mostres del vostre model durant el procés d’ajust fi (conegudes com a «desplegaments»)

  • Avaluar aquestes sortides amb un o més avaluadors que heu definit a la tasca (més informació sobre els avaluadors)

  • Calcular i aplicar actualitzacions dels pesos basades en les qualificacions (retropropagació).

  • Executar qualsevol pas de validació (avaluació) que hàgiu configurat.

La majoria d’avaluadors es poden executar «gratis», cosa que vol dir que no cobrem cap càrrec addicional pel seu ús més enllà del temps que contribueixen al bucle d’entrenament principal. L’excepció són els avaluadors de model, per als quals també comptabilitzem els segments que consumeixen durant les activitats anteriors. Aquests segments apareixen com una partida independent a la factura. Els segments consumits pels avaluadors de model es facturen a les tarifes normals d’inferència (preus d’OpenAI).

Què NO facturem

No cobrem pel temps dedicat a:

  • Validar o inspeccionar el teu conjunt de dades abans que comenci l’entrenament.

  • Comprovacions de seguretat del teu conjunt de dades.

  • Esperar en cua recursos de càlcul.

  • Baixar pesos del model o conjunts de dades.

  • Preparar (renderitzar) el teu conjunt de dades al nostre format d’entrenament.

  • Avaluacions de seguretat posteriors a l’entrenament del teu model ajustat.

Si es perd feina d’entrenament a causa d’un error per part nostra (per exemple, si un treballador falla i ha de tornar a un punt de control anterior), no se’t cobra ni el temps de càlcul perdut ni els segments dels avaluadors. A la secció següent n’expliquem més detalls.

Progrés endavant capturat i esdeveniments de facturació

L’entrenament consisteix en moltes petites actualitzacions del teu model. Fem un seguiment de quantes d’aquestes actualitzacions es completen correctament. Els càrrecs es basen en el temps de càlcul i els segments dels avaluadors associats a aquestes actualitzacions correctes.

Emetem un càrrec quan es produeix un dels «esdeveniments de facturació» següents:

  • L’entrenament es completa correctament.

  • Pares l’entrenament.

  • Cancel·les l’entrenament.

  • L’entrenament falla.

Cada càrrec cobreix la feina incremental feta des de l’últim càrrec. Per exemple:

  • Si poses una execució en pausa, desem un punt de control i et cobrem el temps de càlcul i els segments d’avaluador utilitzats des de l’últim càrrec.

  • Quan la reprens, l’entrenament continua des del punt de control. El càrrec següent (en completar-se, una altra pausa, cancel·lació o error) només cobrirà la feina addicional feta després de reprendre.

  • Si cancel·les una execució, et cobrem la feina feta fins a la cancel·lació.

  • Si l’entrenament falla i la feina feta des de l’últim càrrec es perd, no se’t factura la part perduda.

Aquest enfocament de «progrés endavant capturat» garanteix que només paguis per la feina que es conserva al teu model o que abandones intencionadament.

Consultar el progrés de la tasca

Les tasques RFT tenen un camp anomenat usage_metrics que documenta l’ús total de la tasca fins al pas actual. Això inclou el temps dedicat a l’entrenament i tots els segments utilitzats per tots els avaluadors de model de la tasca. Aquest camp es pot inspeccionar mitjançant l’API (GET /v1/fine_tuning/jobs/{job_id}) o el tauler d’ajust fi.

Factors que influeixen en el temps d’entrenament

Com que la facturació es basa en el temps, les teves opcions de configuració afecten directament el cost. Els factors clau inclouen:

  • Dificultat del problema: si el teu conjunt de dades consisteix en problemes difícils, és probable que el model dediqui més temps de raonament a cada problema, cosa que augmenta el temps necessari per produir cada mostra.

  • Intensitat de càlcul: l’hiperparàmetre compute_multiplier controla quina quantitat de càlcul fas per pas d’entrenament. Valors més alts animen el model a raonar de manera més extensa sobre cada punt de dades, fet que fa que cada pas s’executi més lentament.

  • Configuració de validació:

    • Un conjunt de validació més gran augmenta el temps dedicat a l’avaluació.

    • Augmentar eval_samples (el nombre de sortides del model avaluades per exemple de validació) augmenta el temps de validació.

    • Executar la validació amb més freqüència (amb un eval_interval més baix) augmenta la proporció de temps dedicada a la validació.

  • Rendiment dels avaluadors:

    • Els avaluadors model més grans o més capaços triguen més a retornar una qualificació que els més petits. Per exemple, avaluar amb un model de raonament pot trigar 10 vegades més que fer-ho amb un model no orientat al raonament.

    • Les funcions d’avaluació en Python complexes triguen més a executar-se que les senzilles.

Aquests paràmetres et permeten equilibrar cost, velocitat i qualitat del model. Per exemple, una validació freqüent pot detectar problemes abans, però augmenta el cost. Avaluar amb un model més avançat pot millorar dràsticament la precisió de l’avaluació, però alentirà cada pas d’avaluació i encarirà les tasques.

Gestió del cost

Per controlar la despesa:

  • Comença amb execucions més curtes per entendre com la configuració afecta el temps.

  • Fes servir un nombre raonable d’exemples de validació i eval_samples. Evita validar més sovint del necessari.

  • Tria el model d’avaluació més petit que compleixi els teus requisits de qualitat.

  • Mantén eficients els avaluadors personalitzats en Python.

  • Ajusta compute_multiplier per equilibrar la velocitat de convergència i el cost.

  • Supervisa l’execució al tauler o mitjançant l’API. Pots posar-la en pausa o cancel·lar-la en qualsevol moment.

Exemples

Execució d’entrenament correcta

Temps d’entrenamentTemps facturatEstatDescripció
00:0000:00L’usuari crea una tasca RFT mitjançant l’API
00:1000:00VALIDATING_FILES10 minuts dedicats a validar el conjunt de dades
00:3000:00VALIDATING_FILES20 minuts executant comprovacions de seguretat del conjunt de dades
01:0000:00QUEUED30 minuts esperant un worker disponible
01:3000:00RUNNING30 minuts configurant l’entrenament (baixada de pesos, preprocessament, etc.)
05:3004:00RUNNING4 hores dedicades a l’entrenament
06:0004:00RUNNING30 minuts executant avaluacions de seguretat del model resultant
06:0004:00SUCCEEDEDL’entrenament finalitza

En aquest cas, el temps total transcorregut és de 6 hores, però només 4 hores són facturables. El cost seria de 4 hores × $100/hora = $400.

Exemple de tasca fallida

En aquest exemple, l’execució entrena el model durant 2 hores, escriu un punt de control, entrena 1 hora més, però després falla. Només són facturables les 2 hores d’entrenament fins al punt de control.

Temps d’entrenamentTemps facturatEstatDescripció
00:0000:00L’usuari crea una tasca RFT mitjançant l’API
00:1000:00VALIDATING_FILES10 minuts dedicats a validar el conjunt de dades
00:3000:00VALIDATING_FILES20 minuts executant comprovacions de seguretat del conjunt de dades
01:0000:00QUEUED30 minuts esperant un worker disponible
01:3000:00RUNNING30 minuts configurant l’entrenament (baixada de pesos, preprocessament, etc.)
03:3002:00RUNNING2 hores dedicades a l’entrenament
03:3002:00RUNNINGPunt de control creat al pas 5
04:3002:00RUNNINGL’entrenament falla per un error intern al pas 8 (després d’1 hora més)
04:3002:00RUNNING30 minuts avaluant i validant el punt de control
04:3002:00SUCCEEDEDLa tasca finalitza (amb l’últim punt de control)

Tot i que es van dedicar 3 hores a l’entrenament en total, només 2 hores queden «capturades» en un punt de control utilitzable i es facturen. L’hora de feina d’entrenament perduda a causa de la fallada no és responsabilitat vostra. El cost seria de 2 hores × $100/hora = $200.

Preguntes freqüents

Quan se’m cobra?

Facturem quan l’execució es completa, es posa en pausa, es cancel·la o falla. Cada factura cobreix la feina feta des de la factura anterior.

He de pagar si una execució falla?

Si una execució falla per un error nostre i es perd feina d’entrenament recent, no se us cobra la part perduda. Si cancel·leu una execució, se us cobra la feina feta fins a la cancel·lació.

Com es facturen els segments dels avaluadors de model?

Comptem els segments utilitzats per qualsevol avaluador de model que configureu. Quan acaba l’entrenament, facturem aquests segments a les nostres tarifes estàndard per segment.

Puc posar en pausa i reprendre una execució?

Sí. Quan poseu en pausa, desem un punt de control i cobrem la feina feta fins aquell moment. Quan repreneu, només se us cobrarà la feina addicional feta després de reprendre.

Si teniu altres preguntes sobre la facturació de l’ajust fi per reforç, contacteu amb el nostre equip de suport.

T'ha estat útil aquest article?