Az RFT számlázásának működése
A Reinforcement Fine‑Tuning (RFT) lehetővé teszi, hogy megerősítéses tanulással optimalizáld az OpenAI érvelési modelljeinek teljesítményét. A felügyelt vagy preferenciaalapú finomhangolási ajánlatainktól eltérően, amelyeket a betanítási adatkészletben lévő tokenek száma alapján számlázunk, az RFT számlázása azon az időn alapul, amelyet a betanítási futtatás az alapvető gépi tanulási munkával tölt.
Ez az útmutató ismerteti, mi számít számlázható tanítási időnek, hogyan kezeljük a szüneteltetéseket és lemondásokat, valamint hogyan befolyásolhatják a konfigurációs beállításai a költségeket.
Díjszabás
Számítás: 100 USD az o4-mini-2025-04-16 alapvető betanítási ciklusában eltöltött tényleges idő minden órájára. A díjakat másodpercre arányosítjuk, a számlán pedig két tizedesjegyre kerekítjük (például 2,55 óra).
Az értékelő modell használata: Ha OpenAI-modellt használ a kimenetek „értékelésére” a betanítás során, az értékelési hívások által felhasznált tokeneket a betanítás befejezése után, a szokásos API-díjszabásunk szerint külön számlázzuk.
Csak azért a betanítási munkáért számítunk fel díjat, amely ténylegesen frissíti a modellt (ezt „rögzített tényleges előrehaladásnak” nevezzük).
Mit számlázunk
Azt az időt számlázzuk, amelyet a betanítási worker aktívan a modell betanításával tölt, konkrétan:
Minták generálása a modellből a finomhangolási folyamat során (úgynevezett „rolloutok”)
Ezeknek a kimeneteknek a kiértékelése a feladathoz Ön által definiált egy vagy több értékelővel (további információ az értékelőkről)
Súlyfrissítések kiszámítása és alkalmazása az értékelések alapján (visszaterjesztés).
Az Ön által konfigurált validálási (kiértékelési) lépések futtatása.
A legtöbb értékelő futtatása „ingyenes”, ami azt jelenti, hogy a használatukért nem számítunk fel külön díjat azon az időn felül, amellyel hozzájárulnak az alapvető betanítási ciklushoz. Ez alól kivételt jelentenek a modellértékelők, amelyeknél azokat a tokeneket is összesítjük, amelyeket ezek az értékelők a fenti tevékenységek során felhasználnak. Ezek a tokenek külön tételként jelennek meg a számláján. A modellértékelők által felhasznált tokeneket a normál következtetési díjszabás szerint számlázzuk (OpenAI-árazás).
Miért NEM számlázunk
Nem számítunk fel díjat az alábbiakra fordított időért:
Az adatkészlet validálása vagy vizsgálata a tanítás megkezdése előtt.
Az adatkészlet biztonsági ellenőrzései.
Várakozás a sorban számítási erőforrásokra.
Modellsúlyok vagy adatkészletek letöltése.
Az adatkészlet előkészítése (renderelése) a tanítási formátumunkhoz.
A finomhangolt modell tanítás utáni biztonsági értékelései.
Ha a tanítási munka a mi oldalunkon fellépő hiba miatt vész el (például ha egy munkafolyamat összeomlik, és vissza kell állnia egy korábbi ellenőrzőpontra), az elveszett számítási időért vagy osztályozói tokenekért nem számítunk fel díjat. Erről a következő részben talál további részleteket.
Rögzített előrehaladás és számlázási események
A tanítás a modell számos apró frissítéséből áll. Nyomon követjük, hogy ezek közül hány frissítés fejeződik be sikeresen. A díjak ezekhez a sikeres frissítésekhez kapcsolódó számítási időn és osztályozói tokeneken alapulnak.
Díjat számítunk fel, amikor az alábbi „számlázási események” egyike bekövetkezik:
A tanítás sikeresen befejeződik.
Szünetelteti a tanítást.
Megszakítja a tanítást.
A tanítás meghiúsul.
Minden díj az előző díj óta elvégzett többletmunkát fedezi. Például:
Ha szüneteltet egy futást, mentünk egy ellenőrzőpontot, és kiszámlázzuk az előző díj óta felhasznált számítási időt és osztályozói tokeneket.
Amikor folytatja, a tanítás az ellenőrzőponttól folytatódik. A következő díj (befejezéskor, újabb szüneteltetéskor, megszakításkor vagy meghibásodáskor) csak a folytatás után elvégzett további munkát fogja fedezni.
Ha megszakít egy futást, a megszakításig elvégzett munkát számlázzuk ki.
Ha a tanítás meghiúsul, és az előző díj óta végzett munka elveszik, az elveszett részért nem számlázunk.
Ez a „rögzített előrehaladás” megközelítés biztosítja, hogy csak azért a munkáért fizessen, amely megmarad a modelljében, vagy amelyet szándékosan felad.
A feladat előrehaladásának megtekintése
Az RFT-feladatok usage_metrics mezője rögzíti a feladat teljes erőforrás-használatát az aktuális lépésig. Ez magában foglalja a betanítással töltött időt, valamint a feladat összes értékelő modellje által felhasznált valamennyi tokent. Ez a mező az API-n (GET /v1/fine_tuning/jobs/{job_id}) vagy a finomhangolási irányítópulton keresztül tekinthető meg.
A betanítási időt befolyásoló tényezők
Mivel a számlázás időalapú, a konfigurációs beállítások közvetlenül befolyásolják a költségeket. A legfontosabb tényezők:
A problémák nehézsége: ha az adatkészlet nehéz problémákból áll, a modell valószínűleg több időt tölt az egyes problémák végiggondolásával, így az egyes minták előállítása is tovább tart.
Számításigény: A compute_multiplier hiperparaméter szabályozza az egyes betanítási lépések során elvégzett számítások mennyiségét. A magasabb értékek arra ösztönzik a modellt, hogy minden adatpontot részletesebben végiggondoljon, ezért az egyes lépések lassabban futnak le.
Validációs beállítások:
Az értékelő teljesítménye:
A nagyobb vagy fejlettebb értékelő modelleknek több időre van szükségük az értékelés visszaadásához, mint a kisebbeknek. Az érvelési modellel végzett értékelés például tízszer annyi időt vehet igénybe, mint a nem érvelési modellel végzett értékelés.
Az összetett Python-alapú értékelési függvények futtatása tovább tart, mint az egyszerűeké.
Ezekkel a beállításokkal egyensúlyba hozhatja a költségeket, a sebességet és a modell minőségét. A gyakori validáció például hamarabb feltárhatja a problémákat, de növeli a költségeket. A fejlettebb modellel végzett értékelés jelentősen javíthatja a pontosságot, de lelassítja az egyes értékelési lépéseket, és megdrágítja a feladatokat.
A költségek kezelése
A kiadások kordában tartásához:
Kezdje rövidebb futtatásokkal, hogy felmérje, miként befolyásolja a konfiguráció a szükséges időt.
Használjon észszerű számú validációs példát és eval_samples értéket. Ne végezzen a szükségesnél gyakrabban validációt.
Válassza a minőségi követelményeknek megfelelő legkisebb értékelő modellt.
Tartsa hatékonyan működőképesen az egyéni Python-értékelőket.
A konvergencia sebességének és a költségeknek az egyensúlyához módosítsa a compute_multiplier értékét.
Kövesse nyomon a futtatást az irányítópulton vagy az API-n keresztül. A futtatást bármikor szüneteltetheti vagy megszakíthatja.
Példák
Sikeres betanítási futtatás
| Betanítási idő | Számlázott idő | Állapot | Leírás |
|---|---|---|---|
| 00:00 | 00:00 | – | A felhasználó RFT-feladatot hoz létre API-n keresztül |
| 00:10 | 00:00 | VALIDATING_FILES | 10 perc az adatkészlet validálásával |
| 00:30 | 00:00 | VALIDATING_FILES | 20 perc az adatkészlet biztonsági ellenőrzéseivel |
| 01:00 | 00:00 | QUEUED | 30 perc várakozás egy elérhető workerre |
| 01:30 | 00:00 | RUNNING | 30 perc a betanítás előkészítésével (súlyok letöltése, előfeldolgozás stb.) |
| 05:30 | 04:00 | RUNNING | 4 óra betanítással töltve |
| 06:00 | 04:00 | RUNNING | 30 perc a létrejött modell biztonsági kiértékeléseivel |
| 06:00 | 04:00 | SUCCEEDED | A betanítás befejeződik |
Ebben az esetben a teljes eltelt idő 6 óra, de csak 4 óra számlázható. A költség 4 óra × $100/óra = $400 lenne.
Sikertelen feladat példája
Ebben a példában a futtatás 2 órán át tanít, ellenőrzőpontot ír, még 1 órán át tanít, majd sikertelen lesz. Csak az ellenőrzőpontig tartó 2 óra betanítás számlázható.
| Betanítási idő | Számlázott idő | Állapot | Leírás |
|---|---|---|---|
| 00:00 | 00:00 | – | A felhasználó RFT-feladatot hoz létre API-n keresztül |
| 00:10 | 00:00 | VALIDATING_FILES | 10 perc az adatkészlet validálásával |
| 00:30 | 00:00 | VALIDATING_FILES | 20 perc az adatkészlet biztonsági ellenőrzéseivel |
| 01:00 | 00:00 | QUEUED | 30 perc várakozás egy elérhető workerre |
| 01:30 | 00:00 | RUNNING | 30 perc a betanítás előkészítésével (súlyok letöltése, előfeldolgozás stb.) |
| 03:30 | 02:00 | RUNNING | 2 óra betanítással töltve |
| 03:30 | 02:00 | RUNNING | Ellenőrzőpont létrehozva az 5. lépésnél |
| 04:30 | 02:00 | RUNNING | A betanítás belső hiba miatt sikertelen lesz a 8. lépésnél (további 1 óra után) |
| 04:30 | 02:00 | RUNNING | 30 perc az ellenőrzőpont kiértékelésével és validálásával |
| 04:30 | 02:00 | SUCCEEDED | A feladat befejeződik (a legutóbbi ellenőrzőponttal) |
Bár összesen 3 órát töltöttek betanítással, csak 2 óra van "rögzítve" használható ellenőrzőpontban, és ez kerül számlázásra. A hiba miatt elveszett egyórányi betanítási munka nem az Ön felelőssége. A költség 2 óra × $100/óra = $200 lenne.
Gyakran ismételt kérdések
Mikor számítják fel a díjat?
A díjat a futtatás befejezésekor, szüneteltetésekor, megszakításakor vagy sikertelenségekor számítjuk fel. Minden elszámolás az előző óta elvégzett munkát tartalmazza.
Fizetek, ha egy futtatás sikertelen?
Ha egy futtatás a mi hibánk miatt sikertelen, és a közelmúltbeli betanítási munka egy része elveszik, az elveszett részért nem számítunk fel díjat. Ha megszakít egy futtatást, a megszakításig elvégzett munkáért számítunk fel díjat.
Hogyan számlázzuk az értékelő modellek tokenjeit?
Számoljuk az Ön által konfigurált modellértékelők által használt tokeneket. A betanítás befejezése után ezeket a tokeneket a szokásos tokenenkénti díjszabásunk szerint számlázzuk.
Szüneteltethetek és folytathatok egy futtatást?
Igen. Szüneteltetéskor elmentünk egy ellenőrzőpontot, és díjat számítunk fel az addig elvégzett munkáért. Folytatáskor csak a folytatás után elvégzett további munkáért számítunk fel díjat.
Ha további kérdései vannak a Reinforcement Fine‑Tuning számlázásával kapcsolatban, forduljon támogatási csapatunkhoz.
