نحوه محاسبه هزینه برای بهبود تقویتی (RFT)
بهبود تقویتی (RFT) به شما امکان میدهد عملکرد مدلهای استدلال OpenAI را با استفاده از یادگیری تقویتی بهینه کنید. برخلاف خدمات فاینتیونینگ نظارتشده یا مبتنی بر ترجیح ما، که هزینهشان بر اساس تعداد توکنهای موجود در مجموعهداده آموزشی محاسبه میشود، هزینه بهبود تقویتی (RFT) بر پایه مدت زمانی محاسبه میشود که فرایند آموزش شما صرف انجام کار اصلی یادگیری ماشین میکند.
این راهنما توضیح میدهد چه چیزی بهعنوان زمان آموزشی قابلصورتحساب محسوب میشود، وقفهها و لغوها را چگونه مدیریت میکنیم، و انتخابهای پیکربندی شما چگونه میتوانند بر هزینه اثر بگذارند.
قیمتگذاری
محاسبات: بهازای هر ساعت زمان واقعی صرفشده در حلقه اصلی آموزش برای o4-mini-2025-04-16، مبلغ ۱۰۰ دلار. هزینهها به نسبت ثانیه محاسبه و در صورتحساب تا دو رقم اعشار گرد میشوند (برای مثال، ۲٫۵۵ ساعت).
استفاده از مدل ارزیاب: اگر هنگام آموزش از یک مدل OpenAI برای "ارزیابی" خروجیها استفاده کنید، هزینه توکنهای مصرفشده در آن فراخوانیهای ارزیابی پس از پایان آموزش، جداگانه و مطابق تعرفههای استاندارد API محاسبه میشود.
فقط بابت کار آموزشیای هزینه دریافت میکنیم که واقعاً مدل شما را بهروزرسانی کند؛ چیزی که آن را "پیشرفت روبهجلوی ثبتشده" مینامیم.
مواردی که برای آنها هزینه دریافت میکنیم
ما برای زمانی هزینه دریافت میکنیم که ورکر آموزشی شما فعالانه مدل شما را آموزش میدهد؛ مشخصاً:
تولید نمونهها از مدل شما در فرایند بهبود تنظیم (معروف به «رولاوتها»)
ارزیابی آن خروجیها با یک یا چند ارزیابی که در کار تعریف کردهاید (درباره ارزیابها بیشتر بدانید)
محاسبه و اعمال بهروزرسانیهای وزن بر اساس نمرهها (پسانتشار).
اجرای هر مرحله اعتبارسنجی (ارزیابی) که پیکربندی کردهاید.
اجرای بیشتر ارزیابها «رایگان» است؛ یعنی خارج از زمانی که به حلقه اصلی آموزش اضافه میکنند، هزینه اضافی بابت استفاده از آنها دریافت نمیکنیم. استثنا مربوط به ارزیابهای مدل است؛ در آنها توکنهایی را که این ارزیابها طی فعالیتهای بالا مصرف میکنند نیز محاسبه میکنیم. این توکنها بهصورت یک قلم جداگانه در فاکتور شما ظاهر میشوند. توکنهای مصرفشده توسط ارزیابهای مدل با نرخهای عادی استنتاج محاسبه میشوند (قیمتگذاری OpenAI).
برای چه چیزهایی هزینه نمیگیریم
ما برای زمان صرفشده در این موارد هزینهای دریافت نمیکنیم:
اعتبارسنجی یا بررسی مجموعهدادهٔ شما پیش از شروع آموزش.
بررسیهای ایمنی روی مجموعهدادهٔ شما.
انتظار در صف برای منابع محاسباتی.
دانلود وزنهای مدل یا مجموعهدادهها.
آمادهسازی (rendering) مجموعهدادهٔ شما به قالب آموزشی ما.
ارزیابیهای ایمنیِ پس از آموزش برای مدل ریزتنظیمشدهٔ شما.
اگر کار آموزشی بهدلیل خطا از سمت ما از دست برود (برای مثال، اگر یک کارگر از کار بیفتد و مجبور شود به checkpoint قبلی برگردد)، بابت زمان محاسباتی ازدسترفته یا توکنهای ارزیاب از شما هزینهای دریافت نمیشود. جزئیات بیشتر در اینباره در بخش بعدی آمده است.
پیشرفت روبهجلوی ثبتشده و رویدادهای صورتحساب
آموزش از بهروزرسانیهای کوچک فراوانی برای مدل شما تشکیل شده است. ما پیگیری میکنیم چه تعداد از این بهروزرسانیها با موفقیت کامل میشوند. هزینهها بر پایهٔ زمان محاسبات و توکنهای ارزیابِ مرتبط با این بهروزرسانیهای موفق هستند.
وقتی یکی از «رویدادهای صورتحساب» زیر رخ دهد، هزینه صادر میکنیم:
آموزش با موفقیت کامل میشود.
شما آموزش را متوقف میکنید.
شما آموزش را لغو میکنید.
آموزش شکست میخورد.
هر هزینه، کار افزایشی انجامشده از زمان آخرین هزینه را پوشش میدهد. برای مثال:
اگر اجرایی را متوقف کنید، ما یک checkpoint ذخیره میکنیم و بابت زمان محاسبات و توکنهای ارزیابِ استفادهشده از زمان آخرین هزینه از شما مبلغ دریافت میکنیم.
وقتی از سر میگیرید، آموزش از checkpoint ادامه پیدا میکند. هزینهٔ بعدی (در زمان تکمیل، توقف دیگر، لغو یا شکست) فقط کار اضافی انجامشده پس از ازسرگیری را پوشش میدهد.
اگر اجرایی را لغو کنید، بابت کار انجامشده تا زمان لغو از شما هزینه میگیریم.
اگر آموزش شکست بخورد و کار انجامشده از زمان آخرین هزینه از دست برود، بابت بخش ازدسترفته از شما صورتحساب گرفته نمیشود.
این رویکرد «پیشرفت روبهجلوی ثبتشده» تضمین میکند فقط برای کاری هزینه بپردازید که در مدل شما حفظ میشود یا خودتان عمداً از آن صرفنظر میکنید.
مشاهده پیشرفت کار
کارهای بهبود تقویتی (RFT) فیلدی به نام usage_metrics دارند که کل میزان استفاده از کار را تا مرحله فعلی ثبت میکند. این مقدار شامل زمان صرفشده برای آموزش و تمام توکنهای مصرفشده توسط همه ارزیابهای مدل در آن کار است. این فیلد را میتوان از طریق API (GET /v1/fine_tuning/jobs/{job_id}) یا داشبورد تنظیم دقیق بررسی کرد.
عوامل مؤثر بر زمان آموزش
از آنجا که صورتحساب بر مبنای زمان محاسبه میشود، انتخابهای پیکربندی شما مستقیماً بر هزینه اثر میگذارند. عوامل اصلی عبارتاند از:
دشواری مسئله: اگر مجموعهداده شما از مسائل دشوار تشکیل شده باشد، مدل احتمالاً برای استدلال درباره هر مسئله زمان بیشتری صرف میکند و درنتیجه، تولید هر نمونه بیشتر طول میکشد.
شدت محاسبات: ابرپارامتر compute_multiplier میزان محاسبات انجامشده در هر مرحله آموزش را کنترل میکند. مقادیر بالاتر مدل را ترغیب میکنند درباره هر نقطهداده مفصلتر استدلال کند؛ درنتیجه، اجرای هر مرحله کندتر میشود.
تنظیمات اعتبارسنجی:
عملکرد ارزیاب:
ارزیابهای مبتنی بر مدلهای بزرگتر یا توانمندتر، نسبت به مدلهای کوچکتر برای ارائه امتیاز به زمان بیشتری نیاز دارند. برای مثال، ارزیابی با یک مدل استدلال ممکن است ۱۰ برابر بیشتر از ارزیابی با یک مدل غیراستدلالی طول بکشد.
اجرای توابع پیچیده ارزیابی پایتون بیشتر از توابع ساده زمان میبرد.
این تنظیمات به شما امکان میدهند میان هزینه، سرعت و کیفیت مدل توازن برقرار کنید. برای مثال، اعتبارسنجی مکرر میتواند مشکلات را زودتر شناسایی کند، اما هزینه را افزایش میدهد. ارزیابی با مدلی پیشرفتهتر میتواند دقت ارزیابی را بهطور چشمگیری بهبود دهد، اما هر مرحله ارزیابی را کندتر و کارها را پرهزینهتر میکند.
مدیریت هزینه
برای کنترل مخارج خود:
با اجراهای کوتاهتر شروع کنید تا بفهمید پیکربندی شما چگونه بر زمان اثر میگذارد.
از تعداد معقولی نمونه اعتبارسنجی و eval_samples استفاده کنید. بیش از حد نیاز اعتبارسنجی نکنید.
کوچکترین مدل ارزیابی را انتخاب کنید که نیازهای کیفی شما را برآورده میکند.
ارزیابهای سفارشی پایتون را بهینه نگه دارید.
برای ایجاد توازن میان سرعت همگرایی و هزینه، compute_multiplier را تنظیم کنید.
اجرای خود را در داشبورد یا از طریق API پایش کنید. هر زمان بخواهید میتوانید اجرا را موقتاً متوقف یا لغو کنید.
مثالها
اجرای آموزشی موفق
| زمان آموزش | زمان صورتحسابشده | وضعیت | شرح |
|---|---|---|---|
| 00:00 | 00:00 | – | کاربر کار بهبود تقویتی (RFT) را از طریق API ایجاد میکند |
| 00:10 | 00:00 | VALIDATING_FILES | ۱۰ دقیقه صرف اعتبارسنجی مجموعهداده شد |
| 00:30 | 00:00 | VALIDATING_FILES | ۲۰ دقیقه صرف اجرای بررسیهای ایمنی مجموعهداده شد |
| 01:00 | 00:00 | QUEUED | ۳۰ دقیقه انتظار برای ورکر در دسترس |
| 01:30 | 00:00 | RUNNING | ۳۰ دقیقه صرف آمادهسازی آموزش شد (دانلود وزنها، پیشپردازش و غیره) |
| 05:30 | 04:00 | RUNNING | ۴ ساعت صرف آموزش شد |
| 06:00 | 04:00 | RUNNING | ۳۰ دقیقه صرف اجرای ارزیابیهای ایمنی مدل حاصل شد |
| 06:00 | 04:00 | SUCCEEDED | آموزش به پایان میرسد |
در این حالت، کل زمان واقعی سپریشده ۶ ساعت است، اما فقط ۴ ساعت قابلصورتحساب است. هزینه ۴ ساعت × $100/ساعت = $400 خواهد بود.
نمونه کار ناموفق
در این مثال، اجرا ۲ ساعت آموزش میبیند، یک چکپوینت مینویسد، ۱ ساعت دیگر آموزش میبیند، اما سپس ناموفق میشود. فقط ۲ ساعت آموزش تا زمان چکپوینت قابلصورتحساب است.
| زمان آموزش | زمان صورتحسابشده | وضعیت | شرح |
|---|---|---|---|
| 00:00 | 00:00 | – | کاربر کار بهبود تقویتی (RFT) را از طریق API ایجاد میکند |
| 00:10 | 00:00 | VALIDATING_FILES | ۱۰ دقیقه صرف اعتبارسنجی مجموعهداده شد |
| 00:30 | 00:00 | VALIDATING_FILES | ۲۰ دقیقه صرف اجرای بررسیهای ایمنی مجموعهداده شد |
| 01:00 | 00:00 | QUEUED | ۳۰ دقیقه انتظار برای ورکر در دسترس |
| 01:30 | 00:00 | RUNNING | ۳۰ دقیقه صرف آمادهسازی آموزش شد (دانلود وزنها، پیشپردازش و غیره) |
| 03:30 | 02:00 | RUNNING | ۲ ساعت صرف آموزش شد |
| 03:30 | 02:00 | RUNNING | چکپوینت در مرحله ۵ ایجاد شد |
| 04:30 | 02:00 | RUNNING | آموزش بهدلیل خطای داخلی در مرحله ۸ ناموفق میشود (پس از ۱ ساعت دیگر) |
| 04:30 | 02:00 | RUNNING | ۳۰ دقیقه صرف ارزیابی و اعتبارسنجی چکپوینت شد |
| 04:30 | 02:00 | SUCCEEDED | کار به پایان میرسد (با آخرین چکپوینت) |
اگرچه در مجموع ۳ ساعت صرف آموزش شد، فقط ۲ ساعت در یک چکپوینت قابلاستفاده «ثبت» شده و صورتحساب میشود. مسئولیت یک ساعت کار آموزشی که بهدلیل خرابی از دست رفته، با شما نیست. هزینه ۲ ساعت × $100/ساعت = $200 خواهد بود.
پرسشهای متداول
چه زمانی هزینه از من دریافت میشود؟
وقتی اجرای شما تکمیل، متوقف موقت، لغو یا ناموفق شود، صورتحساب صادر میکنیم. هر صورتحساب، کارهای انجامشده از زمان صورتحساب قبلی را پوشش میدهد.
اگر اجرا ناموفق شود، باید هزینه بپردازم؟
اگر اجرا بهدلیل خطای ما ناموفق شود و کار آموزشی اخیر از دست برود، برای بخش ازدسترفته هزینهای از شما دریافت نمیشود. اگر اجرایی را لغو کنید، هزینه کار انجامشده تا زمان لغو از شما دریافت میشود.
توکنهای مدل ارزیاب چگونه صورتحساب میشوند؟
ما توکنهای استفادهشده توسط هر ارزیاب مدل که پیکربندی میکنید را میشماریم. پس از پایان آموزش، آن توکنها را با نرخهای استاندارد بهازای هر توکن صورتحساب میکنیم.
آیا میتوانم یک اجرا را متوقف موقت و از سر بگیرم؟
بله. وقتی توقف موقت میکنید، یک چکپوینت ذخیره میکنیم و هزینه کار انجامشده تا آن زمان را دریافت میکنیم. وقتی از سر میگیرید، فقط برای کار اضافی انجامشده پس از ازسرگیری هزینه از شما دریافت میشود.
اگر پرسشهای دیگری درباره صورتحساب Reinforcement Fine‑Tuning دارید، با تیم پشتیبانی ما تماس بگیرید.
