نحوه محاسبه هزینه برای بهبود تقویتی (RFT)
بهبود تقویتی (RFT) به شما امکان میدهد عملکرد مدلهای استدلال OpenAI را با استفاده از یادگیری تقویتی بهینه کنید. برخلاف خدمات فاینتیونینگ نظارتشده یا مبتنی بر ترجیح ما، که هزینهشان بر اساس تعداد توکنهای موجود در مجموعهداده آموزشی محاسبه میشود، هزینه بهبود تقویتی (RFT) بر پایه مدت زمانی محاسبه میشود که فرایند آموزش شما صرف انجام کار اصلی یادگیری ماشین میکند.
این راهنما توضیح میدهد چه چیزی بهعنوان زمان آموزشی قابلصورتحساب محسوب میشود، وقفهها و لغوها را چگونه مدیریت میکنیم، و انتخابهای پیکربندی شما چگونه میتوانند بر هزینه اثر بگذارند.
قیمتگذاری
محاسبات: ۱۰۰ دلار بهازای هر ساعت زمان سپریشده در حلقهٔ اصلی آموزش برای
o4-mini-2025-04-16. هزینهها بهصورت متناسب تا واحد ثانیه محاسبه و در فاکتور تا دو رقم اعشار گرد میشوند (مثلاً ۲٫۵۵ ساعت).مصرف مدل ارزیاب: اگر در طول آموزش از یک مدل OpenAI برای «نمرهگذاری» خروجیها استفاده کنید، توکنهای مصرفشده در این فراخوانیهای نمرهگذاری پس از پایان آموزش، جداگانه و با نرخهای استاندارد API ما صورتحساب میشوند.
ما فقط برای کار آموزشیای هزینه میگیریم که واقعاً مدل شما را بهروزرسانی میکند (چیزی که آن را «پیشرفت روبهجلوی ثبتشده» مینامیم).
مواردی که برای آنها هزینه دریافت میکنیم
ما برای زمانی هزینه دریافت میکنیم که ورکر آموزشی شما فعالانه مدل شما را آموزش میدهد؛ مشخصاً:
تولید نمونهها از مدل شما در فرایند بهبود تنظیم (معروف به «رولاوتها»)
ارزیابی آن خروجیها با یک یا چند ارزیابی که در کار تعریف کردهاید (درباره ارزیابها بیشتر بدانید)
محاسبه و اعمال بهروزرسانیهای وزن بر اساس نمرهها (پسانتشار).
اجرای هر مرحله اعتبارسنجی (ارزیابی) که پیکربندی کردهاید.
اجرای بیشتر ارزیابها «رایگان» است؛ یعنی خارج از زمانی که به حلقه اصلی آموزش اضافه میکنند، هزینه اضافی بابت استفاده از آنها دریافت نمیکنیم. استثنا مربوط به ارزیابهای مدل است؛ در آنها توکنهایی را که این ارزیابها طی فعالیتهای بالا مصرف میکنند نیز محاسبه میکنیم. این توکنها بهصورت یک قلم جداگانه در فاکتور شما ظاهر میشوند. توکنهای مصرفشده توسط ارزیابهای مدل با نرخهای عادی استنتاج محاسبه میشوند (قیمتگذاری OpenAI).
برای چه چیزهایی هزینه نمیگیریم
ما برای زمان صرفشده در این موارد هزینهای دریافت نمیکنیم:
اعتبارسنجی یا بررسی مجموعهدادهٔ شما پیش از شروع آموزش.
بررسیهای ایمنی روی مجموعهدادهٔ شما.
انتظار در صف برای منابع محاسباتی.
دانلود وزنهای مدل یا مجموعهدادهها.
آمادهسازی (rendering) مجموعهدادهٔ شما به قالب آموزشی ما.
ارزیابیهای ایمنیِ پس از آموزش برای مدل ریزتنظیمشدهٔ شما.
اگر کار آموزشی بهدلیل خطا از سمت ما از دست برود (برای مثال، اگر یک کارگر از کار بیفتد و مجبور شود به checkpoint قبلی برگردد)، بابت زمان محاسباتی ازدسترفته یا توکنهای ارزیاب از شما هزینهای دریافت نمیشود. جزئیات بیشتر در اینباره در بخش بعدی آمده است.
پیشرفت روبهجلوی ثبتشده و رویدادهای صورتحساب
آموزش از بهروزرسانیهای کوچک فراوانی برای مدل شما تشکیل شده است. ما پیگیری میکنیم چه تعداد از این بهروزرسانیها با موفقیت کامل میشوند. هزینهها بر پایهٔ زمان محاسبات و توکنهای ارزیابِ مرتبط با این بهروزرسانیهای موفق هستند.
وقتی یکی از «رویدادهای صورتحساب» زیر رخ دهد، هزینه صادر میکنیم:
آموزش با موفقیت کامل میشود.
شما آموزش را متوقف میکنید.
شما آموزش را لغو میکنید.
آموزش شکست میخورد.
هر هزینه، کار افزایشی انجامشده از زمان آخرین هزینه را پوشش میدهد. برای مثال:
اگر اجرایی را متوقف کنید، ما یک checkpoint ذخیره میکنیم و بابت زمان محاسبات و توکنهای ارزیابِ استفادهشده از زمان آخرین هزینه از شما مبلغ دریافت میکنیم.
وقتی از سر میگیرید، آموزش از checkpoint ادامه پیدا میکند. هزینهٔ بعدی (در زمان تکمیل، توقف دیگر، لغو یا شکست) فقط کار اضافی انجامشده پس از ازسرگیری را پوشش میدهد.
اگر اجرایی را لغو کنید، بابت کار انجامشده تا زمان لغو از شما هزینه میگیریم.
اگر آموزش شکست بخورد و کار انجامشده از زمان آخرین هزینه از دست برود، بابت بخش ازدسترفته از شما صورتحساب گرفته نمیشود.
این رویکرد «پیشرفت روبهجلوی ثبتشده» تضمین میکند فقط برای کاری هزینه بپردازید که در مدل شما حفظ میشود یا خودتان عمداً از آن صرفنظر میکنید.
مشاهده پیشرفت کار
کارهای بهبود تقویتی (RFT) فیلدی به نام usage_metrics دارند که کل میزان استفاده کار را تا مرحله فعلی مستند میکند. این شامل زمان صرفشده برای آموزش و همه توکنهای استفادهشده در همه ارزیابهای مدل در آن کار است. این فیلد را میتوان از طریق API (GET /v1/fine_tuning/jobs/{job_id}) یا از طریق داشبورد بهبود تنظیم بررسی کرد.
عوامل مؤثر بر زمان آموزش
از آنجا که صورتحساب بر پایهٔ زمان است، انتخابهای پیکربندی شما مستقیماً بر هزینه اثر میگذارند. عوامل کلیدی شامل این موارد هستند:
دشواری مسئله: اگر مجموعهدادهٔ شما از مسائل دشوار تشکیل شده باشد، مدل احتمالاً زمان بیشتری را صرف استدلال روی هر مسئله میکند که زمان لازم برای تولید هر نمونه را افزایش میدهد.
شدت محاسبات: ابرپارامتر
compute_multiplierمیزان محاسبهای را که در هر گام آموزش انجام میدهید کنترل میکند. مقادیر بالاتر مدل را تشویق میکنند برای هر نقطهداده با شرحوبسط بیشتری استدلال کند، که باعث میشود هر گام کندتر اجرا شود.تنظیمات اعتبارسنجی:
بزرگتر بودن مجموعهٔ اعتبارسنجی زمان صرفشده برای ارزیابی را افزایش میدهد.
افزایش
eval_samples(تعداد خروجیهای مدل که برای هر نمونهٔ اعتبارسنجی نمرهگذاری میشوند) زمان اعتبارسنجی را افزایش میدهد.اجرای مکررتر اعتبارسنجی (کاهش
eval_interval) سهم زمان صرفشده برای اعتبارسنجی را بیشتر میکند.
عملکرد ارزیاب:
مدلهای ارزیاب بزرگتر یا توانمندتر نسبت به مدلهای کوچکتر زمان بیشتری برای برگرداندن نمره نیاز دارند. برای مثال، نمرهگذاری با یک مدل استدلال ممکن است ۱۰ برابر بیشتر از نمرهگذاری با یک مدل غیر استدلالی زمان ببرد.
توابع نمرهگذاری پیچیدهٔ Python نسبت به توابع ساده زمان بیشتری برای اجرا نیاز دارند.
این تنظیمات به شما امکان میدهند بین هزینه، سرعت و کیفیت مدل موازنه برقرار کنید. برای مثال، اعتبارسنجی مکرر میتواند مشکلات را زودتر آشکار کند اما هزینه را افزایش میدهد. نمرهگذاری با یک مدل پیشرفتهتر میتواند دقت نمرهگذاری را بهطور چشمگیری بهبود دهد، اما هر گام نمرهگذاری را کندتر و کارها را گرانتر میکند.
مدیریت هزینه
برای کنترل هزینههای خود:
با اجراهای کوتاهتر شروع کنید تا بفهمید پیکربندی شما چگونه بر زمان اثر میگذارد.
از تعداد معقولی نمونهٔ اعتبارسنجی و
eval_samplesاستفاده کنید. بیش از نیاز اعتبارسنجی را تکرار نکنید.کوچکترین مدل ارزیاب را که نیازهای کیفی شما را برآورده میکند انتخاب کنید.
ارزیابهای سفارشی Python را کارآمد نگه دارید.
compute_multiplierرا برای ایجاد توازن میان سرعت همگرایی و هزینه تنظیم کنید.اجرای خود را در داشبورد یا از طریق API پایش کنید. هر زمان بخواهید میتوانید آن را متوقف یا لغو کنید.
مثالها
اجرای آموزشی موفق
| زمان آموزش | زمان صورتحسابشده | وضعیت | شرح |
|---|---|---|---|
| 00:00 | 00:00 | – | کاربر کار بهبود تقویتی (RFT) را از طریق API ایجاد میکند |
| 00:10 | 00:00 | VALIDATING_FILES | ۱۰ دقیقه صرف اعتبارسنجی مجموعهداده شد |
| 00:30 | 00:00 | VALIDATING_FILES | ۲۰ دقیقه صرف اجرای بررسیهای ایمنی مجموعهداده شد |
| 01:00 | 00:00 | QUEUED | ۳۰ دقیقه انتظار برای ورکر در دسترس |
| 01:30 | 00:00 | RUNNING | ۳۰ دقیقه صرف آمادهسازی آموزش شد (دانلود وزنها، پیشپردازش و غیره) |
| 05:30 | 04:00 | RUNNING | ۴ ساعت صرف آموزش شد |
| 06:00 | 04:00 | RUNNING | ۳۰ دقیقه صرف اجرای ارزیابیهای ایمنی مدل حاصل شد |
| 06:00 | 04:00 | SUCCEEDED | آموزش به پایان میرسد |
در این حالت، کل زمان واقعی سپریشده ۶ ساعت است، اما فقط ۴ ساعت قابلصورتحساب است. هزینه ۴ ساعت × $100/ساعت = $400 خواهد بود.
نمونه کار ناموفق
در این مثال، اجرا ۲ ساعت آموزش میبیند، یک چکپوینت مینویسد، ۱ ساعت دیگر آموزش میبیند، اما سپس ناموفق میشود. فقط ۲ ساعت آموزش تا زمان چکپوینت قابلصورتحساب است.
| زمان آموزش | زمان صورتحسابشده | وضعیت | شرح |
|---|---|---|---|
| 00:00 | 00:00 | – | کاربر کار بهبود تقویتی (RFT) را از طریق API ایجاد میکند |
| 00:10 | 00:00 | VALIDATING_FILES | ۱۰ دقیقه صرف اعتبارسنجی مجموعهداده شد |
| 00:30 | 00:00 | VALIDATING_FILES | ۲۰ دقیقه صرف اجرای بررسیهای ایمنی مجموعهداده شد |
| 01:00 | 00:00 | QUEUED | ۳۰ دقیقه انتظار برای ورکر در دسترس |
| 01:30 | 00:00 | RUNNING | ۳۰ دقیقه صرف آمادهسازی آموزش شد (دانلود وزنها، پیشپردازش و غیره) |
| 03:30 | 02:00 | RUNNING | ۲ ساعت صرف آموزش شد |
| 03:30 | 02:00 | RUNNING | چکپوینت در مرحله ۵ ایجاد شد |
| 04:30 | 02:00 | RUNNING | آموزش بهدلیل خطای داخلی در مرحله ۸ ناموفق میشود (پس از ۱ ساعت دیگر) |
| 04:30 | 02:00 | RUNNING | ۳۰ دقیقه صرف ارزیابی و اعتبارسنجی چکپوینت شد |
| 04:30 | 02:00 | SUCCEEDED | کار به پایان میرسد (با آخرین چکپوینت) |
اگرچه در مجموع ۳ ساعت صرف آموزش شد، فقط ۲ ساعت در یک چکپوینت قابلاستفاده «ثبت» شده و صورتحساب میشود. مسئولیت یک ساعت کار آموزشی که بهدلیل خرابی از دست رفته، با شما نیست. هزینه ۲ ساعت × $100/ساعت = $200 خواهد بود.
پرسشهای متداول
چه زمانی از من هزینه دریافت میشود؟
وقتی اجرای شما کامل، متوقف موقت، لغو یا ناموفق شود، صورتحساب صادر میکنیم. هر صورتحساب، کار انجامشده از زمان صورتحساب قبلی را پوشش میدهد.
اگر اجرا ناموفق شود، باید هزینه بپردازم؟
اگر اجرا بهدلیل خطای ما ناموفق شود و کار آموزشی اخیر از دست برود، برای بخش ازدسترفته هزینهای از شما دریافت نمیشود. اگر اجرایی را لغو کنید، هزینه کار انجامشده تا زمان لغو از شما دریافت میشود.
توکنهای مدل ارزیاب چگونه صورتحساب میشوند؟
ما توکنهای استفادهشده توسط هر ارزیاب مدل که پیکربندی میکنید را میشماریم. پس از پایان آموزش، آن توکنها را با نرخهای استاندارد بهازای هر توکن صورتحساب میکنیم.
آیا میتوانم یک اجرا را متوقف موقت و از سر بگیرم؟
بله. وقتی توقف موقت میکنید، یک چکپوینت ذخیره میکنیم و هزینه کار انجامشده تا آن زمان را دریافت میکنیم. وقتی از سر میگیرید، فقط برای کار اضافی انجامشده پس از ازسرگیری هزینه از شما دریافت میشود.
اگر پرسشهای دیگری درباره صورتحساب Reinforcement Fine‑Tuning دارید، با تیم پشتیبانی ما تماس بگیرید.
